On running the command: /usr/src/tensorrt/bin/trtexec --onnx=model_gn.onnx --shapes=input:32x3x32x32 --saveEngine=model_gn.engine --exportProfile=model_gn.json --int8 --useDLACore=0 --allowGPUFallback --useSpinWait --separateProfileRun --verbose, I do get the details of layers running on DLA and GPU, but I only get traces of GPU:
[04/28/2025-11:06:45] [I] === Trace details ===
[04/28/2025-11:06:45] [I] Trace averages of 10 runs:
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50102 ms - Host latency: 1.5608 ms (enqueue 0.778024 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.49293 ms - Host latency: 1.55209 ms (enqueue 0.777457 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50078 ms - Host latency: 1.56141 ms (enqueue 0.775542 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.49539 ms - Host latency: 1.55526 ms (enqueue 0.777785 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50013 ms - Host latency: 1.55927 ms (enqueue 0.785571 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.49252 ms - Host latency: 1.5517 ms (enqueue 0.777322 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.49584 ms - Host latency: 1.55502 ms (enqueue 0.780673 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.49623 ms - Host latency: 1.55559 ms (enqueue 0.775174 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50175 ms - Host latency: 1.56211 ms (enqueue 0.779517 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.48832 ms - Host latency: 1.54827 ms (enqueue 0.782928 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50067 ms - Host latency: 1.55959 ms (enqueue 0.780905 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.48969 ms - Host latency: 1.54971 ms (enqueue 0.781357 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.48878 ms - Host latency: 1.54963 ms (enqueue 0.783652 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.48514 ms - Host latency: 1.54452 ms (enqueue 0.782791 ms)
[04/28/2025-11:06:45] [I] Average on 10 runs - GPU latency: 1.50404 ms - Host latency: 1.56283 ms (enqueue 0.773969 ms)
...
I want to know is there any way to record the latency and other metrics for DLA?