算力往下沉不是新话题,但过去一年真正的变化是:能塞进设备的模型,明显变大了。

三个已经发生的变化

  • 量化从「能用就行」变成工程化流程。低位宽的精度损失被压到可接受范围。
  • 端侧推理的工具链逐步可用,算子覆盖不再是最大的拦路虎。
  • 设备侧内存带宽变宽,能常驻的模型规模随之上去。

这三件事叠加的结果,是过去必须回传云端做的一批任务,现在可以在本地出结果。

YOLO 系为什么还是主流

在视觉检测这个方向,YOLO 系模型仍是落地时的默认选项。原因不在精度最高,而在三个工程属性:

  1. 结构相对简单,容易做量化与剪枝。
  2. 社区实现多,各家芯片的工具链大多优先支持它。
  3. 速度与精度的档位齐全,可以按设备能力挑。

对做产品的人来说,能被工具链优先支持,比榜单上多零点几个点重要得多。

量化不是免费的

把模型放到端上的流程
  1. 1选骨架按设备算力与内存挑模型规模,不追最大
  2. 2量化先做权重量化,再评估是否需要激活量化
  3. 3对齐精度用同一批真实样本对比量化前后的输出差异
  4. 4补算子让不支持的算子回落到 CPU 或替换结构
  5. 5压测在目标设备上跑长时间稳定性,而不只是跑分

第三步最容易被跳过。我见过量化后整体指标没掉,但某个类别的召回明显下降,只有在分类别对比时才看得出来。

第五步也常被忽略。跑分漂亮但连续运行几小时后掉帧,通常是散热或内存碎片的问题,不是模型本身的问题。

芯片方案该看什么

维度为什么关键
算子覆盖覆盖不全就要频繁回落,实际性能打折
工具链成熟度决定调试成本,差一个档次就是几周的事
功耗曲线峰值性能意义有限,持续性能才是产品体验
供货周期方案再好,交不出货等于零

排在最后但最重要的其实是供货。过去两年不少团队在选型上做得很好,最后卡在交付。

海外的做法有什么不同

一个比较明显的差别是:海外团队更早把「模型迭代」当成常规支出,也就是从第一天就规划了换模型、重新量化的流程;而不少团队是把模型当一次性交付物,等到要换的时候发现整条链路都要动。

另一个差别是评估口径。海外项目普遍要求在实际部署环境里做长期压测,而不是在实验室跑一遍基准。

结语

端侧算力的进步不是一个单点突破,而是量化、工具链、内存三件事同时到位的产物。判断一个方案值不值得上,与其看它的峰值指标,不如看它的持续性能和迭代成本。

一个被低估的成本:换模型

端侧方案里,最容易被低估的成本是换模型。

实验室里换一个新模型,是重新跑一遍量化脚本。产品里换模型,意味着整条链路都要重测:精度对齐、算子回落、长时间压测、现场固件升级,以及升级失败的回滚方案。

所以选型时值得多问一句:这个工具链换一次模型需要多久。如果一个方案换一次要两个月,那它实际上把你锁死在了第一版上。

最后一条经验:评估端侧方案时,把第二年的花销也算进去,包括换模型、换芯片、重做适配的人力。只看首版成本,几乎一定会低估。


免责声明:本文为行业观察,所述选型维度基于公开信息与个人理解,不构成任何投资或采购建议。