过去两年 AI 的主战场在云端:模型太大,只能放服务器。2026 年开始,「本地优先」明显抬头:小模型在手机、浏览器、个人电脑上跑,能做的越来越多。原因不复杂——隐私、成本、延迟,三个痛点全在本地。
端侧为什么现在才可行
- 模型变小:量化、蒸馏让几 B 参数的模型也能干不少实事
- 硬件变强:新一代笔记本的 NPU、手机芯片都开始为推理优化
- 工具变薄:macos-harness(809★)这类「最薄的壳」,把本地工具的调用成本压到极低
- 芯片开源:apex-inference-chip(613★)把能跑 Qwen2.5-0.5B 的推理芯片设计开源,端侧不再是黑盒
什么场景适合端侧
- 敏感数据:合同、病历、代码库,不想出本机
- 高频低延迟:输入法、翻译、摘要、会议转写
- 离线环境:无网络或弱网的现场
- 成本敏感:把高频小任务从云端 API 挪到本地,省 token 钱
什么场景先别上
- 强推理任务:长文写作、复杂代码、多跳推理,云端大模型仍是主力
- 需要最新知识的问答:端侧模型知识截止较早,得配检索
端侧不是替代云端,而是分流:能本地干的小事绝不上云,真正难的事再交给云端。