RAG 的核心思路:让大模型不靠「记忆」回答,而是先从一个知识库中检索相关片段,再把片段连同问题一起交给模型生成答案。这样答案有出处、可溯源,也能随时更新知识而不需要重新训练。
标准流程
- 准备:把企业文档切分成小块(Chunk),用嵌入模型转成向量存入向量数据库
- 检索:用户提问时,把问题也转成向量,与库里内容做相似度匹配,取 Top-K 片段
- 生成:把「问题 + 检索到的片段」一起作为提示词交给大模型,限制它只依据片段回答
什么时候需要 RAG
- 回答需要引用公司内部文档、产品手册、合同等私有资料
- 知识更新频繁,模型训练数据跟不上
- 对答案准确性和可溯源性要求高,如客服、法务、医疗场景
RAG 的效果好坏主要取决于切块策略、嵌入模型和检索质量,而不是大模型本身。后续维护时优先优化检索环节。