PaperBridge 长尾问题
RAG 和微调到底应该选哪个?
如果问题是“模型不知道最新或私有事实”,先做 RAG;如果问题是“模型知道信息但总是不按要求做”,考虑微调。RAG 更容易更新、撤回和展示来源,微调更适合稳定改变输出格式、语气、分类边界或任务行为。很多生产系统最终两者都会用:RAG 提供事实,微调规范模型如何使用这些事实。
需要频繁更新、权限控制或引用:优先 RAG
产品文档、政策、价格、库存和内部知识会变化。把它们放进可检索系统,比每次重新训练模型更容易更新和撤回。
RAG 还能记录召回了哪些文档,便于审计。但“有检索”不等于“不会幻觉”:错误召回、切块不当和模型忽略证据仍会失败。
需要稳定改变行为:考虑微调
固定 JSON 格式、品牌语气、分类规则、领域术语使用和特定任务步骤,通常更像行为学习问题。高质量示例可以通过全量或参数高效微调改变模型的响应习惯。
不要把大量事实硬塞进微调样本,并期待它像数据库一样准确更新。参数中的知识难以逐条撤回,也很难可靠给出来源。
先做最便宜的基线,再决定是否训练
先用清晰提示词和少量示例建立基线。如果只是提示不稳定,优化提示和输出校验可能已经足够。事实缺失再加检索;行为仍不稳定再收集失败案例做微调。
评测集必须把检索质量和回答质量分开:先测相关文档是否被召回,再测模型是否忠实使用证据。
常见组合:RAG 管知识,微调管行为
例如客服助手用 RAG 获取最新退换货政策,用微调学会固定的询问顺序和结构化工单格式。两者解决的不是同一层问题。
如果数据很少,先不要微调。十几个精心设计的提示示例,往往比几百条重复、矛盾的训练样本更安全。
五个问题快速决策
- 知识是否每周或每月更新?是:倾向 RAG。
- 是否必须展示来源或按权限返回?是:倾向 RAG。
- 主要失败是格式、语气或步骤不稳定?是:倾向微调。
- 是否已有大量经过审核的输入—输出示例?是:微调才有可靠基础。
- 是否需要同时满足最新事实与稳定行为?是:组合使用。
原论文、研究与官方文档
以下来源用于核对事实;流程与比较建议是 PaperBridge 对研究、官方文档和工程实践的综合。