这个工具是做什么的
在服务器上跑大模型有成熟的推理栈,把同一个模型塞进 Jetson、DRIVE 这类边缘平台则要重新处理算子、显存和量化,多数团队会掉进自己写一次性推理代码的坑。TensorRT Edge-LLM 是英伟达自己维护的 C++ 推理运行时,覆盖文本、视觉、音频、语音与动作模型,面向的正是车载、机器人与边缘设备。2026 年 9 月发布的 0.10.1 加了两项实验性能力:双 NVIDIA DGX Spark 上的 TP=2 推理,以及重写过的 OpenAI 兼容 server——冷启动更快、内存占用更低。往前一版 0.10.0 补了 Qwen3.8-27B 的 Day-0 支持、Nemotron-3.5 Lightning(含 MTP 与 DFlash)、Cosmos3-Edge、DiffusionGemma、流式 ASR 模型 Nemotron-3.5-ASR 与 DSpark 投机解码,还加入了不导出 ONNX 直接构建 TensorRT 引擎的路径、多轮 KV-cache 复用和 server 端的视频输入。0.9.x 系列则补齐了 Gemma 4 全家族(文本、图像、音频多模态加 MTP)与 Qwen3-Omni、Nemotron-3 的 NVFP4 支持。适合需要把模型真正落到边缘硬件上、且愿意贴着硬件做优化的团队。
基本信息
- 分类:开发者工具
- 厂商 / 团队:NVIDIA(开源,Apache 2.0)
- 价格:免费(开源,Apache 2.0)
- 收录日期:2026-09-17
- 官网:github.com
适用场景
端侧推理 · Jetson · DRIVE · TensorRT · C++ · 量化