算力往下沉不是新话题,但过去一年真正的变化是:能塞进设备的模型,明显变大了。
三个已经发生的变化
- 量化从「能用就行」变成工程化流程。低位宽的精度损失被压到可接受范围。
- 端侧推理的工具链逐步可用,算子覆盖不再是最大的拦路虎。
- 设备侧内存带宽变宽,能常驻的模型规模随之上去。
这三件事叠加的结果,是过去必须回传云端做的一批任务,现在可以在本地出结果。
YOLO 系为什么还是主流
在视觉检测这个方向,YOLO 系模型仍是落地时的默认选项。原因不在精度最高,而在三个工程属性:
- 结构相对简单,容易做量化与剪枝。
- 社区实现多,各家芯片的工具链大多优先支持它。
- 速度与精度的档位齐全,可以按设备能力挑。
对做产品的人来说,能被工具链优先支持,比榜单上多零点几个点重要得多。
量化不是免费的
- 1选骨架按设备算力与内存挑模型规模,不追最大
- 2量化先做权重量化,再评估是否需要激活量化
- 3对齐精度用同一批真实样本对比量化前后的输出差异
- 4补算子让不支持的算子回落到 CPU 或替换结构
- 5压测在目标设备上跑长时间稳定性,而不只是跑分
第三步最容易被跳过。我见过量化后整体指标没掉,但某个类别的召回明显下降,只有在分类别对比时才看得出来。
第五步也常被忽略。跑分漂亮但连续运行几小时后掉帧,通常是散热或内存碎片的问题,不是模型本身的问题。
芯片方案该看什么
| 维度 | 为什么关键 |
|---|---|
| 算子覆盖 | 覆盖不全就要频繁回落,实际性能打折 |
| 工具链成熟度 | 决定调试成本,差一个档次就是几周的事 |
| 功耗曲线 | 峰值性能意义有限,持续性能才是产品体验 |
| 供货周期 | 方案再好,交不出货等于零 |
排在最后但最重要的其实是供货。过去两年不少团队在选型上做得很好,最后卡在交付。
海外的做法有什么不同
一个比较明显的差别是:海外团队更早把「模型迭代」当成常规支出,也就是从第一天就规划了换模型、重新量化的流程;而不少团队是把模型当一次性交付物,等到要换的时候发现整条链路都要动。
另一个差别是评估口径。海外项目普遍要求在实际部署环境里做长期压测,而不是在实验室跑一遍基准。
结语
端侧算力的进步不是一个单点突破,而是量化、工具链、内存三件事同时到位的产物。判断一个方案值不值得上,与其看它的峰值指标,不如看它的持续性能和迭代成本。
一个被低估的成本:换模型
端侧方案里,最容易被低估的成本是换模型。
实验室里换一个新模型,是重新跑一遍量化脚本。产品里换模型,意味着整条链路都要重测:精度对齐、算子回落、长时间压测、现场固件升级,以及升级失败的回滚方案。
所以选型时值得多问一句:这个工具链换一次模型需要多久。如果一个方案换一次要两个月,那它实际上把你锁死在了第一版上。
最后一条经验:评估端侧方案时,把第二年的花销也算进去,包括换模型、换芯片、重做适配的人力。只看首版成本,几乎一定会低估。
免责声明:本文为行业观察,所述选型维度基于公开信息与个人理解,不构成任何投资或采购建议。