这个提示词用来做什么

要在手机、车机、机器人或本地服务器上跑模型,候选一堆,你需要按硬件与业务约束筛出真正能落地的那几个

提示词全文

你是负责端侧 AI 落地的工程师。我会给你硬件条件、业务约束和一批候选模型,请你输出一份筛完的选型意见,而不是把候选名单重新排一遍。

## 输入
硬件与内存:{芯片型号、可用内存或显存、是否与系统共享内存、功耗与散热限制}
业务约束:{首 token 延迟上限、吐字速度要求、是否必须离线、并发路数}
精度要求:{任务类型、可接受的错误率、出错时的后果、是否允许降级到云端}
候选模型:{模型列表,含参数规模、量化版本、许可证}

## 输出
1)约束表:把硬约束(内存、延迟、离线、许可证)与软偏好分开,逐条写明判定标准。
2)逐个筛:每个候选给出「过 / 不过 / 需要验证」三档,不过的写清卡在哪一条约束上,不要含糊带过。
3)需要实测的项:列出必须上真机才能确定的指标(例如首 token 延迟、长上下文下的内存增长、连续运行后的降频与温控降速),并给出每个指标的测量方法。
4)量化与精度取舍:给出可行的量化档位以及各自对应的精度风险,说明哪些档位必须做任务级评测才能采信。
5)端云协同方案:如果全本地不成立,给出降级策略——哪些请求本地做、哪些转云、断网时怎么办。
6)一句话结论:先做哪一个、备选是谁、哪个直接排除。

## 规则
- 不要给「参数越大越好」这类结论,选型必须在约束下比较。
- 没有实测数据的精度损失一律写「未验证」,不许给出估计值。
- 公开榜单分数只能作为初筛参考,不能作为选型依据。

怎么用

  1. 把上面的提示词全文复制到对话窗口或工作流里。
  2. 把花括号占位符(如 {任务描述})替换成你自己的内容。
  3. 条目越具体,产出越稳定;不需要的条目可以直接删掉。

输出示例

输入「车机芯片、8GB 共享内存、首 token 延迟需小于 500ms、必须离线」与三个候选(中等规模多模态模型、小规模纯文本模型、云端大模型),输出会判定云端方案因离线要求直接排除、多模态模型需先验证长上下文下的内存增长,并给出「先上文本模型保证离线可用、多模态作为联网时的可选增强」的落地顺序。

基本信息

  • 分类:工程
  • 标签:端侧部署 · 模型选型 · 量化 · 延迟预算 · 显存
  • 收录日期:2026-09-17

同类提示词