一个生产级 AI 应用不是「调一次接口」那么简单:要考虑流式输出、上下文管理、成本、限流、安全与可观测性。
最小可行架构
- 前端:聊天界面 / 表单,处理流式响应
- 后端:鉴权、会话管理、调用模型 API
- 模型层:选型(能力/价格/延迟),必要时加路由与缓存
- 数据层:RAG 用向量库,会话记录入库
关键工程点
- 流式输出:SSE 实现打字机效果,别等完整响应
- 上下文管理:控制 Token 用量,超长会话做摘要压缩
- 成本护栏:按用户/按天限额,超限降级
- 安全:提示词注入防护、输出内容审核、密钥放服务端
上线前检查清单
- 错误处理:超时、限流、模型 5xx 都有兜底提示
- 可观测:记录每次调用的模型、Token、延迟与费用
- 合规:隐私政策、数据留存说明、用户内容审核
- 灰度:先小范围试点再放开
大多数 AI 应用「模型只占三成」:剩下的七成是上下文、成本、安全与体验。