一个生产级 AI 应用不是「调一次接口」那么简单:要考虑流式输出、上下文管理、成本、限流、安全与可观测性。

最小可行架构

  • 前端:聊天界面 / 表单,处理流式响应
  • 后端:鉴权、会话管理、调用模型 API
  • 模型层:选型(能力/价格/延迟),必要时加路由与缓存
  • 数据层:RAG 用向量库,会话记录入库

关键工程点

  • 流式输出:SSE 实现打字机效果,别等完整响应
  • 上下文管理:控制 Token 用量,超长会话做摘要压缩
  • 成本护栏:按用户/按天限额,超限降级
  • 安全:提示词注入防护、输出内容审核、密钥放服务端

上线前检查清单

  • 错误处理:超时、限流、模型 5xx 都有兜底提示
  • 可观测:记录每次调用的模型、Token、延迟与费用
  • 合规:隐私政策、数据留存说明、用户内容审核
  • 灰度:先小范围试点再放开
大多数 AI 应用「模型只占三成」:剩下的七成是上下文、成本、安全与体验。