AI 可见性

RAG:让 AI 基于您的专属数据

检索增强生成(Retrieval-augmented generation)可以将 AI 助手的回答基于你的真实文档进行 Grounding 锚定。当配合检索控制、来源展示和评估时,它能极大减少无根据的响应,从而将一个聪明的聊天机器人转化为你可以更有信心地呈现给客户的专业工具,因为其信息来源完全可靠。

提供支持,NYFTY Labs AI 内容引擎

大语言模型在犯错时也显得自信满满,因为默认情况下,它们是根据训练过程中学到的模式来回答,而不是基于您的事实。检索增强生成(即 RAG)改变了这一点,它会从您控制的知识库中获取相关段落,并在模型动笔前将其作为上下文传递给模型。当检索生效时,生成的结果便是基于真实的、可引用源的回答,而非模型的主观猜测。RAG 并没有升级模型的智能水平,它只是向模型输送当下相关的最新事实,使回答有据可依,而非凭空猜测。

RAG: grounding an answer in retrieved knowledge Question user query Retriever finds top matches Knowledge vector store LLM reads + reasons Grounded cited answer query chunks context
RAG 工作流:用户输入“问题”,流向“检索器”,“检索器”查询“知识库向量数据库”并返回“相关文本块”;检索到的上下文被传递给 LLM,LLM 进行阅读和推理,从而生成“有据可依且附带引用来源的回答”。

RAG 的本质是什么

RAG 是一种将检索器与生成器配对的双重模式。当问题输入时,检索器会在知识库中搜寻最相关的段落,这些段落会被添加到提示词中,随后语言模型利用提供的上下文撰写回答。这个术语和正式方法源自 Patrick Lewis 及其 Facebook AI Research 同事在 2020 年发表的一篇论文,该论文将预训练模型的内置知识与外部可搜索的语料库结合在一起。

AI VISIBILITY 1Question2Search knowledgebase3Add passages4Model writesanswerRetriever finds facts, generator writes the answer NYFTYLABS
RAG 工作流:对输入的提问进行检索,将相关段落添加到提示词中,模型根据这些上下文生成回答。

事实锚定(Grounding)如何减少错误

没有检索功能的模型会用听起来合情合理的文本来填补信息空白,这就是捏造回答的来源。通过在生成回答时将真实的源文本呈现在模型面前,RAG 将模型的工作从回忆事实收窄为总结刚刚给出的文档。研究和行业实践一致表明,当回答被限制在检索到的、可检验的内容中时,捏造的内容会大为减少。

检索如何找到最相关的段落

大多数处于生产部署阶段的 RAG 系统都是按语义进行搜索,而不仅仅是靠关键词。文档被拆分为文本块,并转换为被称为“嵌入(embeddings)”的数值向量存储在向量数据库中。这样,即使查询时使用的词汇不同,也能匹配到语义相通的段落。许多系统还融合了传统的关键词搜索,以精确捕捉产品代码或专属名称等特定词汇。

AI VISIBILITY 1Split intochunks2Convert toembeddings3Store in vectorDB4Match query bymeaningKeyword search blended in for exact terms NYFTYLABS
文档是如何变得可通过语义进行搜索并与输入查询相匹配的。

RAG 对比模型重训

RAG 能够在不改变模型权重的情况下无缝增加知识,这意味着您可以通过直接编辑知识库来更新系统掌握的信息,而无须执行昂贵的训练任务。这使其非常适合处理频繁更新或涉及企业机密的信息。相反,微调(Fine-tuning)是将特定模式和风格融入模型本身,这对于调整行为更为管用,而不利于确保事实信息的即时更新。

AI VISIBILITYRAGNo weight changesEdit knowledge baseBest for fresh factsGood for private dataFine-tuningChanges model weightsExpensive training jobBest for behaviorBakes in stylevsNYFTYLABS
RAG 通过知识库更新知识;微调则将数据模式融入到模型权重中。

RAG 在何处仍会失效

RAG 能够减少幻觉(hallucination)却无法彻底根除它,而且其准确性完全取决于检索器返回的内容。如果应当匹配的正确文档缺失、过时或错误,模型依旧会自信满怀地重复该错误信息;若检索一无所获,模型则可能回退到凭空猜测。此外,RAG 还将某些漏洞从模型端转移到了检索端,在这种情况下,一份由于检索不佳而被悄无声息漏掉的文档,相较于显而易见的凭空捏造事实,往往更难以被察觉。

核心要点
  • RAG 将检索器与语言模型配对,因此答案能直接依据您控制的文档生成,而非仅来自训练数据。
  • Grounding 通过在 prompt 中提供真实的源文本来实现,将任务从记忆检索转变为内容摘要,从而大幅削减凭空捏造的答案。
  • 只需编辑知识库即可更新知识,无需全量重新训练模型,是处理私有或快速变化信息的理想选择。
  • RAG 能够减少幻觉,但无法将其完全消除,而且答案质量直接取决于源数据的素质和时效性。
  • 一个精心编排、准确无误的知识库,是决定 RAG 系统能否提供准确可信回答的最大关键所在。

← 更多指南

常见问题

疑问,为您解答。

这种方法允许 AI 助手首先从您自己的文档中检索相关事实,然后利用这些事实来编写回答,从而使响应牢牢锚定在您的数据中,而不是依赖于模型在训练期间偶然记住的内容。

Fine-tuning 通过示例来调整模型的内部参数权重(或可插拔的适配器权重),从而塑造其行为,但在面对快速变化的业务事实时,往往难以快速更新或进行审计。RAG 则不改变模型本身,而在提问的瞬间为其提供最新的实时事实。因此,您只需更新源文档即可同步更新回答,并且通常可以准确引用答案的具体来源。

不能,它显著减少了幻觉,但无法完全消除。Grounding 虽为模型提供了可以开展工作的真实源文本,并支持可供核实的信息引用,但回答的准确率仍然取决于提供的数据是否整洁、实时、条理清晰,以及检索系统能否精准定位并调取正确的段落,这也是该系统需要进行持续维护的原因。

希望这一方案能够服务于您的品牌?
定义

什么是 RAG(检索增强生成)

检索增强生成(RAG)是一种将 AI 助手的回答牢牢锚定在您自有文档中的技术方法:系统不再仅仅依靠模型在训练期间记住的内容进行作答,而是先从您的私有数据中检索出相关事实,再将其呈显给模型据此回答。辅以检索机制控制、来源引用和系统评估,RAG 可大幅减少无根据的无稽之谈,并确保每一条论述都有源可循、有据可查。

它是如何 工作

您的文档会被切分为不同的片段,并转化为能够表达其语义的 embeddings。当用户提出疑问时,检索系统会找出在语义上最接近的段落,并将其嵌入到 prompt 中,以便模型可以基于这些提供的信息编写具体回答,并能对回答中的每一项论断引用具体文档来源。您只需更新相关文档(而非重新训练模型)便能保持解答的实时时效。其最终质量更是完全取决于是否拥有整洁、井井有条的数据,以及检索层能否精准地召回相关片段。

适用于 哪些人群

适用于任何希望将 AI 助手直接面向客户或员工使用并高度信赖其回答质量的企业——从客服和销售,到内网知识检索。它所带来的具体成效在于提升了准确率与可审计性:大幅降低了捏造答案的概率,提供了支持在数秒内手动校验的引用链路,并显著节省了纠正或质疑助手回答内容所需耗费的精力。

实战 案例

某企业将 AI 助手与其政策手册、产品规格说明书以及历史支持工单进行对接。当客户询问是否可以在周期中途降级产品方案时,助手会精准检索并引用计费政策中的特定段落给出答复,且标明具体引用的源文件,而非基于通用训练数据进行猜测。当政策有所调整时,接下来的每一次作答都会自动反映这一最新变化,整个过程无需重新训练模型。