炒作颇多,缺乏明确规划,试点项目零散不系统。
- 开展了机遇与风险评估
- 结合 ROI 确定了路线图的优先级
- 构建了首个受治理的落地应用场景
成效 用一个获得资金支持的路线图和可运行的试点,取代了零散杂乱的实验。
我们构建检索增强系统,将 LLM 的回答限定在您的专属文档、政策和数据中,并内置了引用出处、访问控制和效果评估功能。
定制化 LLM & RAG 系统是一个专属 AI 助手。它使用您自己的文件和数据(而非公开互联网)来回答问题,在提问时检索相关的源材料,并使用大语言模型撰写有据可依、附带引用的回答。
您的内容、文档、帮助文章、产品规格、工单、政策会被拆分为段落,转化为 embeddings,并存储在向量数据库中;当有人提问时,系统会检索最相关的段落并将其提供给语言模型,从而使回答立足于您的材料,并能引用其来源。
适用于拥有庞大内部知识库的组织、支持团队、专业服务公司,以及需要员工和客户从可信内部来源快速获取准确答案的技术和合规导向型业务。其成效在于提高效率和节省时间:减少在文档中搜寻的时间、减少问题升级,并减少错误回答,因为所有回答都旨在立足于您批准的内容。
一家公司将其产品手册、保修政策和历史支持工单连接到专属助手,这样支持代表就可以问:“该型号的延保服务涵盖哪些内容?”并得到一个引用了具体政策段落并链接到源文档的回答。
我们基于您的私有数据构建检索系统,并为中型市场与企业团队将其投入生产环境运行。我们的资深工程师设计数据接入、分块、向量化(embedding)和检索层,然后根据您对准确性、隐私和成本的需求,将其连接到 Claude、GPT,或诸如 Llama、Qwen、Mistral 等开源模型。我们端到端负责整个系统,包括确保回答行之有据且实时更新的所有环节。
我们针对您的真实问题运行持续评估,并不间断刷新检索层,促使系统随着您知识库的增长而始终保持准确。
示意性示例,用于展示我们交付成果的质量。
将 AI 炒作转化为获得资金支持的规划和首个落地应用案例。
成效 用一个获得资金支持的路线图和可运行的试点,取代了零散杂乱的实验。
成效 凭借团队信任、有据可查的回答,成功分流了常见工单。
为遵守非披露协议(NDA),案例均已进行了匿名化处理,并经过编辑以展示典型服务范围,具体成效因市场、预算及起点而异。
该系统从您的文档中检索相关段落,并提示模型基于这些段落生成回答,从而减少对未经验证的预训练知识的依赖。在查询时,我们从您自身的数据源中检索出确实能解决该问题的段落,并指示模型依据这些段落进行回答,并为每个论点提供引用。这样,回答将完全以您的源材料为指导,并配备引用和护栏机制,以减少没有依据的主张。
此类系统的准确性在很大程度上取决于检索本身,而不仅仅取决于模型有多庞大或多聪明:如果提示词中包含正确的段落,即使是中等水平的模型也往往能正确回答;如果不包含,即使是强大的模型也更有可能凭空猜测。这就是为什么决定性效果往往在于分块、混合检索、重排和引用,而不仅仅是提示词的设计。这也是为什么评估体系至关重要,因为它能将模糊的“感觉 AI 很准”转化为可量化、可验证的忠实度得分,让您能够针对性地进行改进,并在文档和使用场景发生变化时随时防范回归风险。
将文档手动粘贴到聊天窗口中属于纯人工操作,很容易迅速达到上下文窗口限制,并且在会话结束后无法保存任何记忆。而 RAG 系统会将您的完整知识库编入向量数据库,针对每个提问仅检索最相关的段落并输入给模型,从而确保回答始终基于您的源材料并附带引用。例如,支持团队可以一次性跨数千份产品文档和 SOPs 进行提问,并获得附有源页面链接的精准解答,无需挨个对 PDF 进行复制粘贴。
我们配置模型以优先考虑检索到的上下文,并指示其在源材料未涵盖某问题时,明确回答不知道而非凭空猜测。我们加入了检索质量控制措施、引用要求(确保每项陈述均可追溯至文档),以及在上线前测试幻觉的评估集。同时我们对检索步骤本身进行精细微调,因为绝大多数错误回答都源于检索到了错误的段落,而非模型本身的问题,因此我们首先重点衡量并改善检索出来的内容。
您的知识库、嵌入向量和对话日志均保存在您控制的基础设施中——无论是您的云账户,还是我们为您管理的隔离环境。您的内容绝不用于训练任何公开基础模型。根据数据的敏感程度,我们完全可以在您的环境中运行 Llama 或 Mistral 等开源模型(从而保证数据不发生外流),或者在企业级条款下使用如 Claude 或 GPT 等 API 模型。在使用 API 的情况下,推理时仅将 prompt 和为该问题检索到的对应文本段落发送给该供应商,而您存储的知识库、嵌入向量和日志仍保存在您的私有环境中。我们会在首次沟通中根据您的合规需求来规划这部分方案。
针对单一知识源和单一场景的专项试点通常需要几周,而跨多个数据源、包含权限控制和系统集成的生产环境级项目则需要更长时间。我们首先明确使用场景并盘点您的数据源,随后搭建导入与检索管线,结合您团队的真实提问进行调优,并在发布前验证其准确性。我们很早就为您提供一个可工作的原型,以便能针对您的实际内容和极端情况进行调优,而不是流于通用的功能演示。
知识在不断更新,因此随着文档的添加或修改,系统需要持续重新索引。此外,还需要对用户提问和表现不佳的解答进行监控。NYFTY 绝不止于系统的交付——我们还可以为您提供托管与运营服务,包括刷新索引、分析失败或低置信度的查询,并随着使用规模的扩大不断优化检索性能。如果您倾向于由内部团队自行维护,我们会在您团队控制的基础设施上进行搭建,并对整条管线进行详尽归档,以便您的工程师能够直接管理。