什么时候值得用专用运行时
不是所有端侧场景都需要 TensorRT。如果只是把一个小模型跑在单板机上、延迟要求宽松,用通用运行时更省事,也更容易换平台。当你要在固定的英伟达边缘平台上压首 token 延迟、压内存占用、跑多模态(视觉加语音)或接多路输入时,贴着硬件做的收益才开始明显。
部署链路大致分四段
- 选型与支持矩阵核对:先确认目标模型、量化格式与硬件平台在官方矩阵里,避免后面返工
- 把权重转成引擎:早期流程要先导出 ONNX,0.10.0 起提供了直接构建 TensorRT 引擎的路径
- 在真机上做基线:首 token 延迟、长上下文下的内存增长、连续运行后的温控与降频,这三个指标只能实测
- 接服务层:用实验性的 OpenAI 兼容 server 暴露接口,它支持多轮 KV-cache 复用与视频输入
近几个版本补上的能力
- 0.10.1:实验性支持双 NVIDIA DGX Spark 上的 TP=2 推理;重写 OpenAI 兼容 server,冷启动更快、内存占用更低
- 0.10.0:Qwen3.8-27B 的 Day-0 支持;Nemotron-3.5 Lightning 支持 MTP 与 DFlash;新增 Cosmos3-Edge、DiffusionGemma、流式 ASR 模型 Nemotron-3.5-ASR,以及 DSpark 投机解码
- 0.10.0:不导出 ONNX 的直接引擎构建、多轮 KV-cache 复用、server 端视频输入
- 0.9.x:Gemma 4 全家族(文本、图像、音频多模态,含 MTP)、Qwen3-Omni、Nemotron-3 的 NVFP4,以及 DFlash 投机解码
端侧最容易低估的三项成本
- 量化带来的精度回退必须做任务级评测:困惑度看着没掉,不代表你的任务没掉
- 散热与功耗约束会让持续吞吐远低于峰值,跑分和连续作业是两回事
- 模型每升一次版本,引擎要重建、基线要重测,这条维护成本要提前算进人力
文档与支持矩阵都放在 nvidia.github.io 的专属站点上,按版本组织;仓库用 Apache 2.0 授权,2025 年 10 月建仓,目前五百多星,属于官方维护但相对小众的工具链。
端侧的难点从来不是「能不能跑起来」,而是「连续跑八小时之后还稳不稳」。