← ClaudeAtlas

ml-rag-systemslisted

检索增强生成(RAG)决策链:判断该不该上 RAG 并设计流水线关键决策。当 LLM 应用出现 "知识过时/不知道私有知识/幻觉不能容忍"、纠结 RAG 还是长上下文还是微调、问切块策略/ embedding 选型/top-k 与重排/引用溯源时激活。核心立场:检索质量决定上限,评估必须拆 检索与生成两段归因。不适用于零外部知识的纯推理任务(ml-prompting-methodology)、档位 总决策(ml-pretraining-paradigm)。触发词: RAG 检索增强, 知识库问答, embedding 选型, chunking 切块, rerank 重排, 引用溯源 citation, hallucination 幻觉
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 检索增强生成 — 检索质量决定上限的流水线决策 ## R — 原文 (Reading) > (转述)Lewis 等指出:预训练把知识压进参数,但参数化知识的更新需要重新训练、且难以审计与扩展;他们提出把非参数的可检索语料(Wikipedia 的 dense vector 索引)与序列到序列模型联合——检索器按查询取文档、生成器以"查询+文档"为条件作答,端到端联合训练。 > > — Patrick Lewis 等, "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" (NeurIPS 2020) > (转述)后续实践形成共识:RAG 的答案质量由两段共同决定——检索段没找对材料,生成段再强也只能在错误前提上流畅发挥;因此系统评估必须把检索命中(能否召回正确来源)与生成忠实(答案是否忠于被检回的材料)拆开度量,否则无法归因。 > > — 检索增强系统评估的行业共识(RAG 三元组类指标的通行做法) --- ## I — 方法论骨架 (Interpretation) **什么时候 LLM 直答不够用?三个信号**:①知识过时(问的是模型训练截止后的事实)②私有知识(公司制度/产品手册/个人笔记,模型从未见过)③幻觉敏感场景(法律/医疗/客服承诺,错了要担责且要求给出处)。三条中一条就该考虑引入外部知识。 **知识注入三路对比**(先选路再施工): - **长上下文**: 文档总量小(塞得进窗口)时最简单——全量放进 prompt,无检索环节无检索错误;代价是 token 成本随文档线性增长、大海捞针效应使超长文档中部信息利用率下降; - **RAG**: 语料大到塞不下或频繁更新时唯一经济解——按需取相关片段;代价是引入整条检索链路,每个环节都是新的失败点; - **微调**: 适合改变行为风格/格式/技能,不适合注入事实知识——事实会过时且易被幻觉覆盖,拿微调当知识库是常见误用(档位决策见 `ml-pretraining-paradigm`)。 **RAG 流水线的四个关键决策**:①**切块 (chunking)**:粒度是第一杠杆——太大则噪声淹没信号,太小则语义断裂;按结构切(标题/段落/表格行)优于盲切固定长度,重叠块可缓解边界截断;②**embedding 选型**:向量检索的前提是"语义相近→向量相近",选型看目标语言与领域适配度,混合检索(向量+关键词 BM25)互补短板;③**top-k 与重排 (rerank)**:召回宁多勿漏(大 k),再用交叉编码器精排出少而准的上下文——召回管覆盖率、重排管精度;④**引用溯源**:答案附出处既是合规需求也是幻觉抑制手段(强制生成器"只依据材料作答")。 **核心立场**:垃圾进垃圾出——生成器只能放大检索的质量,不能弥补它。检索不到正确片段的问题,换更大的模型毫无用处。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引学界公认的经典案例与公开记录)* ### 案例 1: RAG 论文的知识密集任务验证 - **问题**: 开放域问答等任务依赖大量事实知识,纯参数化模型(当时的大型 seq2seq)在知识密集任务上落后于显式带检索的系统,且知识更新困难。 - **方法论的使用**: 把 Wikipedia 构建 dense passage 索引作为非参数记忆,与 BART 类生成器端到端联合训练;对比"仅生成