测的不是单次推理
MLPerf Edge Agentic 衡量的是智能体在边缘设备上完整跑完多步任务的能力——英伟达的说法是,智能体与「回答单次提示的聊天机器人」不同,它要连续完成多步工作。TensorRT Edge-LLM 在该基准上以 6.4 倍的速度完成测试,硬件是 Jetson AGX Thor。
框架本身
TensorRT Edge-LLM 是英伟达为嵌入式车载与机器人平台(DRIVE AGX Thor、Jetson Thor)准备的开源 C++ 框架,随 JetPack 7.1 发布。能力上包括 EAGLE-3 投机解码、NVFP4 量化与分块预填充,管道从 Hugging Face 模型导出一直覆盖到设备上的实时推理,官方也给出了 Jetson AGX Thor、Orin 系列与 DGX Spark 等平台的性能基准页面,可自行复现。
为什么这条值得单独看
端侧部署过去常被简化成「模型能不能塞进显存」,而实际产品里决定体验的是多步任务的总耗时:一次对话可能包含语音识别、视觉输入、工具调用与文本生成。把整条链路的耗时压下来,才决定了车机、机器人能不能在人不耐烦之前给出结果,这也是这类基准的价值所在。
端侧的瓶颈已经不是装不下模型,而是多步任务跑不完——按整条链路计时,才是端侧产品的真实指标。