这个工具是做什么的

在服务器上跑大模型有成熟的推理栈,把同一个模型塞进 Jetson、DRIVE 这类边缘平台则要重新处理算子、显存和量化,多数团队会掉进自己写一次性推理代码的坑。TensorRT Edge-LLM 是英伟达自己维护的 C++ 推理运行时,覆盖文本、视觉、音频、语音与动作模型,面向的正是车载、机器人与边缘设备。2026 年 9 月发布的 0.10.1 加了两项实验性能力:双 NVIDIA DGX Spark 上的 TP=2 推理,以及重写过的 OpenAI 兼容 server——冷启动更快、内存占用更低。往前一版 0.10.0 补了 Qwen3.8-27B 的 Day-0 支持、Nemotron-3.5 Lightning(含 MTP 与 DFlash)、Cosmos3-Edge、DiffusionGemma、流式 ASR 模型 Nemotron-3.5-ASR 与 DSpark 投机解码,还加入了不导出 ONNX 直接构建 TensorRT 引擎的路径、多轮 KV-cache 复用和 server 端的视频输入。0.9.x 系列则补齐了 Gemma 4 全家族(文本、图像、音频多模态加 MTP)与 Qwen3-Omni、Nemotron-3 的 NVFP4 支持。适合需要把模型真正落到边缘硬件上、且愿意贴着硬件做优化的团队。

基本信息

  • 分类:开发者工具
  • 厂商 / 团队:NVIDIA(开源,Apache 2.0)
  • 价格:免费(开源,Apache 2.0)
  • 收录日期:2026-09-17
  • 官网:github.com

适用场景

端侧推理 · Jetson · DRIVE · TensorRT · C++ · 量化

官方入口

github.com ↗

同类工具