过去两年 AI 的主战场在云端:模型太大,只能放服务器。2026 年开始,「本地优先」明显抬头:小模型在手机、浏览器、个人电脑上跑,能做的越来越多。原因不复杂——隐私、成本、延迟,三个痛点全在本地。

端侧为什么现在才可行

  • 模型变小:量化、蒸馏让几 B 参数的模型也能干不少实事
  • 硬件变强:新一代笔记本的 NPU、手机芯片都开始为推理优化
  • 工具变薄:macos-harness(809★)这类「最薄的壳」,把本地工具的调用成本压到极低
  • 芯片开源:apex-inference-chip(613★)把能跑 Qwen2.5-0.5B 的推理芯片设计开源,端侧不再是黑盒

什么场景适合端侧

  • 敏感数据:合同、病历、代码库,不想出本机
  • 高频低延迟:输入法、翻译、摘要、会议转写
  • 离线环境:无网络或弱网的现场
  • 成本敏感:把高频小任务从云端 API 挪到本地,省 token 钱

什么场景先别上

  • 强推理任务:长文写作、复杂代码、多跳推理,云端大模型仍是主力
  • 需要最新知识的问答:端侧模型知识截止较早,得配检索
端侧不是替代云端,而是分流:能本地干的小事绝不上云,真正难的事再交给云端。