AI 咨询

定制化 LLM & RAG 系统

私有且有据可依的 AI,仅根据您批准的知识库进行回答,而非来自开放的网络。

这是什么

您的数据,精准可检索、安全可信赖

我们构建检索增强系统,将 LLM 的回答限定在您的专属文档、政策和数据中,并内置了引用出处、访问控制和效果评估功能。

核心服务包括
  • 知识库导入与分块
  • 向量搜索与检索流水线
  • 带引用出处的有据生成
  • 访问控制与 PII 处理
  • 效果评估与幻觉测试
  • 部署与持续微调
定义

什么是 定制化 LLM & RAG(Retrieval-Augmented Generation)系统

定制化 LLM & RAG 系统是一个专属 AI 助手。它使用您自己的文件和数据(而非公开互联网)来回答问题,在提问时检索相关的源材料,并使用大语言模型撰写有据可依、附带引用的回答。

它是如何 工作

您的内容、文档、帮助文章、产品规格、工单、政策会被拆分为段落,转化为 embeddings,并存储在向量数据库中;当有人提问时,系统会检索最相关的段落并将其提供给语言模型,从而使回答立足于您的材料,并能引用其来源。

适用于 哪些人群

适用于拥有庞大内部知识库的组织、支持团队、专业服务公司,以及需要员工和客户从可信内部来源快速获取准确答案的技术和合规导向型业务。其成效在于提高效率和节省时间:减少在文档中搜寻的时间、减少问题升级,并减少错误回答,因为所有回答都旨在立足于您批准的内容。

实战 案例

一家公司将其产品手册、保修政策和历史支持工单连接到专属助手,这样支持代表就可以问:“该型号的延保服务涵盖哪些内容?”并得到一个引用了具体政策段落并链接到源文档的回答。

它在哪些场景下适用

  • 内部知识与支持助手
  • 销售与入职培训赋能
  • 政策、合规性与 SOP 查询
  • 研究与文档分析

了解定制化 LLM & RAG 系统是否适合您的团队。

获取免费报价
构建、管理、运行

我们构建并运行的定制化 LLM 和 RAG 系统

我们基于您的私有数据构建检索系统,并为中型市场与企业团队将其投入生产环境运行。我们的资深工程师设计数据接入、分块、向量化(embedding)和检索层,然后根据您对准确性、隐私和成本的需求,将其连接到 Claude、GPT,或诸如 Llama、Qwen、Mistral 等开源模型。我们端到端负责整个系统,包括确保回答行之有据且实时更新的所有环节。

我们针对您的真实问题运行持续评估,并不间断刷新检索层,促使系统随着您知识库的增长而始终保持准确。

  • 我们构建完整的流水线:数据接入、向量化、向量搜索、重排及有据生成
  • 当数据驻留和控制权至关重要时,我们使用私有或开源模型进行部署
  • 我们加入评估、引用和护栏机制,以减少毫无根据的回答并保持所有论断的可追溯性
  • 随着您的文件和数据不断变化,我们保持索引最新并维护系统持续运行
立即查看实际效果

有据可依构建的答案,引用自您自己的文档。

您的品牌 · 知识助手有据可依 · 受 SSO 保护
企业客户可以在期中取消吗?适用什么退款政策?
是的,需提前 60 天提供书面通知 MSA §7.2。未使用的月份按比例退款,扣除入职培训费用 退款政策第 3 页。2025 年之前的合同保留旧版的 30 天窗口。
检索自经批准的来源
Enterprise-MSA-2025.pdf · §7.20.94
Refund-Policy-v4.docx · p.30.91
法律备忘录 · 内部维基0.87
98.4% 有据可依,上次评估1,283 份已审核文档不确定时拒绝猜测

示意性示例,用于展示我们交付成果的质量。

精选案例

代表性项目。

将 AI 炒作转化为获得资金支持的规划和首个落地应用案例。

探索 AI 的中端市场分销商

炒作颇多,缺乏明确规划,试点项目零散不系统。

我们的做法
  • 开展了机遇与风险评估
  • 结合 ROI 确定了路线图的优先级
  • 构建了首个受治理的落地应用场景

成效 用一个获得资金支持的路线图和可运行的试点,取代了零散杂乱的实验。

高度依赖客服支持的 SaaS 企业

希望回答基于自身文档,避免 AI 幻觉。

我们的做法
  • 基于其知识库构建了 RAG 系统
  • 引入了引用出处 + 评估回测机制
  • 权限控制 + 监控管理

成效 凭借团队信任、有据可查的回答,成功分流了常见工单。

为遵守非披露协议(NDA),案例均已进行了匿名化处理,并经过编辑以展示典型服务范围,具体成效因市场、预算及起点而异。

如何运作以及为何有效

基于您的数据源,而非模型的记忆。

该系统从您的文档中检索相关段落,并提示模型基于这些段落生成回答,从而减少对未经验证的预训练知识的依赖。在查询时,我们从您自身的数据源中检索出确实能解决该问题的段落,并指示模型依据这些段落进行回答,并为每个论点提供引用。这样,回答将完全以您的源材料为指导,并配备引用和护栏机制,以减少没有依据的主张。

  1. 数据导入、分块与嵌入我们通过导入管线提取您的数据源(PDFs、wiki、工单、CRM、数据库),清洗并将其分割成感知结构的文本块(chunks,通常为数百个 tokens,在标题和章节处截断以保持段落内容完整),然后将每个分块连同数据源、章节、日期和访问级别等元数据一起嵌入(embed)到向量数据库中。定期重新索引机制会在文档更改时保持索引最新,并直接替换陈旧版本以避免重复。
  2. 混合检索 + 重排针对每个问题,我们同时运行稠密向量检索(语义相似度)与 BM25 关键词检索,确保精确的标识符、SKUs、政策代码和错误字符串不会因模糊的向量嵌入而丢失。合并后的候选集随后会通过交叉编码器重排器审核,该重排器同时读取查询与段落并评估真实相关性,从而将数十个候选段落精简至少数几个最值得放入提示词的相关段落。检索质量是决定回答质量的核心因素,因此该步骤对于减少不相关或无依据的回复至关重要。这也是我们集中进行评估和优化工作的重点,旨在将检索精度提升至极致。
  3. 权限过滤与有据生成系统会根据元数据对照用户的权限对每个分块进行过滤,确保提供给模型的源上下文仅限于该用户有权访问的材料,并配有安全护栏和测试以减少无依据的回答。选定的段落会被组装到提示词中,并指示模型严格根据这些内容进行回答,引用所使用的具体分块。当源材料未涵盖问题时,模型会明确表示不知道。这把“我找不到相关内容”变成了一个正确、安全的结果,而不是凭空编造回答。
  4. 上线前后进行合规评估我们构建了一个包含真实问题及标准答案的评估集,并针对每个调整进行评分,包括忠实度(每个论点是否都有检索到的段落支持?)、上下文相关性(检索是否呈现了正确的段落?)以及回答正确性。这通常通过 LLM 作为裁判进行打分并结合人工抽检。绝不凭感觉上线;任何检索或提示词的改动,要么能提升这些指标,要么就会被立即回滚。
  5. 生产环境监控与持续微调系统上线后,我们会记录查询、检索到的段落和置信度,并审查低置信度或被点踩的交互,以找出漏洞——例如缺失的文档、将答案切成两半的分块,或是检索器遗漏的查询措辞。这些发现将转化为对导入、分块或检索的修复,并重新加入到评估集中。这样,如果再次出现类似的错误,极有可能在影响到用户之前,就在回归测试中被捕获。
实战案例一家中型保险公司,其客服和核保团队每天需要回答数十次相同的政策和流程问题,为此他们不得不翻阅数百份 PDFs、内部 wiki 和邮件往来。
  • 导入了政策 PDFs、内部 wiki 和理赔 SOPs;基于文档结构进行分块(字数约为数百个 tokens,并保留标题上下文)并嵌入到向量数据库中。配合每晚自动运行的重新索引任务,文档修改通常在一天内即可生效。
  • 检索采用混合模式:稠密向量检索结合 BM25 关键词匹配,用以捕获精确的政策代码和表格编号,接着使用交叉编码器对候选结果进行重排,精简出最终发送给模型的少数几个关键段落。
  • 每个回答都必须引用其所使用的源文本块,并且通过元数据过滤器限制检索范围,确保仅呈现相应角色有权查看的内容,防止仅核保人员可见的文档暴露给前台客服。
  • 在每次控制迭代中,我们都会根据量身定制的评估集来衡量忠实度和引用正确性(示例:调整分块大小并引入重排器后,被判定为完全有据可依的回答比例从 70% 左右提升至 80% 以上,且无依据的回答急剧减少)。这些数据仅代表特定项目的评估结果,并非保证或典型成效。
为何有效

此类系统的准确性在很大程度上取决于检索本身,而不仅仅取决于模型有多庞大或多聪明:如果提示词中包含正确的段落,即使是中等水平的模型也往往能正确回答;如果不包含,即使是强大的模型也更有可能凭空猜测。这就是为什么决定性效果往往在于分块、混合检索、重排和引用,而不仅仅是提示词的设计。这也是为什么评估体系至关重要,因为它能将模糊的“感觉 AI 很准”转化为可量化、可验证的忠实度得分,让您能够针对性地进行改进,并在文档和使用场景发生变化时随时防范回归风险。

常见问题

疑问,为您解答。

将文档手动粘贴到聊天窗口中属于纯人工操作,很容易迅速达到上下文窗口限制,并且在会话结束后无法保存任何记忆。而 RAG 系统会将您的完整知识库编入向量数据库,针对每个提问仅检索最相关的段落并输入给模型,从而确保回答始终基于您的源材料并附带引用。例如,支持团队可以一次性跨数千份产品文档和 SOPs 进行提问,并获得附有源页面链接的精准解答,无需挨个对 PDF 进行复制粘贴。

我们配置模型以优先考虑检索到的上下文,并指示其在源材料未涵盖某问题时,明确回答不知道而非凭空猜测。我们加入了检索质量控制措施、引用要求(确保每项陈述均可追溯至文档),以及在上线前测试幻觉的评估集。同时我们对检索步骤本身进行精细微调,因为绝大多数错误回答都源于检索到了错误的段落,而非模型本身的问题,因此我们首先重点衡量并改善检索出来的内容。

您的知识库、嵌入向量和对话日志均保存在您控制的基础设施中——无论是您的云账户,还是我们为您管理的隔离环境。您的内容绝不用于训练任何公开基础模型。根据数据的敏感程度,我们完全可以在您的环境中运行 Llama 或 Mistral 等开源模型(从而保证数据不发生外流),或者在企业级条款下使用如 Claude 或 GPT 等 API 模型。在使用 API 的情况下,推理时仅将 prompt 和为该问题检索到的对应文本段落发送给该供应商,而您存储的知识库、嵌入向量和日志仍保存在您的私有环境中。我们会在首次沟通中根据您的合规需求来规划这部分方案。

针对单一知识源和单一场景的专项试点通常需要几周,而跨多个数据源、包含权限控制和系统集成的生产环境级项目则需要更长时间。我们首先明确使用场景并盘点您的数据源,随后搭建导入与检索管线,结合您团队的真实提问进行调优,并在发布前验证其准确性。我们很早就为您提供一个可工作的原型,以便能针对您的实际内容和极端情况进行调优,而不是流于通用的功能演示。

知识在不断更新,因此随着文档的添加或修改,系统需要持续重新索引。此外,还需要对用户提问和表现不佳的解答进行监控。NYFTY 绝不止于系统的交付——我们还可以为您提供托管与运营服务,包括刷新索引、分析失败或低置信度的查询,并随着使用规模的扩大不断优化检索性能。如果您倾向于由内部团队自行维护,我们会在您团队控制的基础设施上进行搭建,并对整条管线进行详尽归档,以便您的工程师能够直接管理。

让我们使其可衡量。