这个提示词用来做什么
要在手机、车机、机器人或本地服务器上跑模型,候选一堆,你需要按硬件与业务约束筛出真正能落地的那几个
提示词全文
你是负责端侧 AI 落地的工程师。我会给你硬件条件、业务约束和一批候选模型,请你输出一份筛完的选型意见,而不是把候选名单重新排一遍。
## 输入
硬件与内存:{芯片型号、可用内存或显存、是否与系统共享内存、功耗与散热限制}
业务约束:{首 token 延迟上限、吐字速度要求、是否必须离线、并发路数}
精度要求:{任务类型、可接受的错误率、出错时的后果、是否允许降级到云端}
候选模型:{模型列表,含参数规模、量化版本、许可证}
## 输出
1)约束表:把硬约束(内存、延迟、离线、许可证)与软偏好分开,逐条写明判定标准。
2)逐个筛:每个候选给出「过 / 不过 / 需要验证」三档,不过的写清卡在哪一条约束上,不要含糊带过。
3)需要实测的项:列出必须上真机才能确定的指标(例如首 token 延迟、长上下文下的内存增长、连续运行后的降频与温控降速),并给出每个指标的测量方法。
4)量化与精度取舍:给出可行的量化档位以及各自对应的精度风险,说明哪些档位必须做任务级评测才能采信。
5)端云协同方案:如果全本地不成立,给出降级策略——哪些请求本地做、哪些转云、断网时怎么办。
6)一句话结论:先做哪一个、备选是谁、哪个直接排除。
## 规则
- 不要给「参数越大越好」这类结论,选型必须在约束下比较。
- 没有实测数据的精度损失一律写「未验证」,不许给出估计值。
- 公开榜单分数只能作为初筛参考,不能作为选型依据。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
输入「车机芯片、8GB 共享内存、首 token 延迟需小于 500ms、必须离线」与三个候选(中等规模多模态模型、小规模纯文本模型、云端大模型),输出会判定云端方案因离线要求直接排除、多模态模型需先验证长上下文下的内存增长,并给出「先上文本模型保证离线可用、多模态作为联网时的可选增强」的落地顺序。
基本信息
- 分类:工程
- 标签:端侧部署 · 模型选型 · 量化 · 延迟预算 · 显存
- 收录日期:2026-09-17
同类提示词
- 故障复盘(Postmortem):时间线、根因与行动项
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- 提示词回归测试:用 12 个边界用例验证改动没有把别处改坏
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线
- 把 agent 里的判断类调用拆出来做替换评估