很多企业搭建数字人知识库的第一步,是把产品手册、制度文件和常见问题全部上传,然后立即测试问答。演示时它可能回答流畅,但遇到真实用户就会暴露问题:引用旧版本、混淆相似产品、找不到表格里的参数,或者在没有依据时仍然给出肯定答案。
问题通常不只是模型能力,而是知识工程没有完成。RAG(检索增强生成)的作用,是先从企业资料中找到与问题相关的内容,再让模型依据这些内容组织回答。要让这条链路可靠,必须同时管理资料、检索、回答策略和评测。
一、先定义知识库要解决哪些任务
不要从“我们有多少文件”开始,应从“用户会问什么”开始。先收集客服记录、销售咨询、搜索词、展厅问答和内部工单,整理出高频任务。
例如,面向产品咨询的数字人可能需要覆盖:
- 产品功能与适用场景;
- 不同版本和服务范围;
- 接入方式、部署条件与交付周期;
- 价格构成和询价所需信息;
- 售前资料、预约演示与人工联系;
- 不适合公开回答的商业或技术信息。
为每个任务标记用户、问题示例、权威来源、期望动作和风险等级。这个任务清单既是资料整理依据,也是后续评测集的骨架。
二、建立“单一可信来源”
同一个问题如果在官网、销售文档和内部手册中有三个答案,模型无法替企业判断哪一个有效。知识库上线前,需要为每类内容指定权威来源。
建议给资料增加以下字段:
| 字段 | 作用 |
|---|---|
| 内容名称 | 便于运营人员识别 |
| 业务类型 | 产品、服务、流程、政策或案例 |
| 适用对象 | 公开用户、客户、员工或特定角色 |
| 版本与生效时间 | 避免使用过期口径 |
| 内容负责人 | 明确谁审核和更新 |
| 权限级别 | 控制哪些终端和用户可以检索 |
| 复核日期 | 触发定期检查 |
重复、过期、无负责人和来源不明的内容不应直接进入生产知识库。历史版本可以归档,但要与当前有效内容分开检索。
三、把文档清洗成可检索的知识
原始文件通常是为人阅读设计的,不一定适合检索。目录、页眉页脚、跨页表格、扫描图片和复杂排版都会影响内容提取。
清洗时应重点处理:
- 删除重复页眉、页脚、目录编号和无意义空白;
- 保留标题层级,使每段内容知道自己属于哪个产品或章节;
- 将关键表格转换为结构清楚的文本或键值信息;
- 为图片中的必要信息补充文字说明;
- 把“本产品”“上述服务”等模糊指代改为明确名称;
- 对联系方式、价格和政策等易变化内容增加版本信息。
如果文档解析后,运营人员自己都难以判断某段话属于什么主题,检索系统也很难稳定找到它。
四、切片不是越短越好
知识库通常会把长文档分成多个片段进行向量检索。片段太长,容易混入无关内容;片段太短,则会丢失条件、上下文和结论之间的关系。
更好的做法是按语义结构切分:一个完整问答、一个产品能力、一段操作流程或一个政策条款作为基本单元,并保留标题、产品、版本和权限等元数据。
对不同内容可以采用不同策略:
- FAQ:问题与答案保持在同一片段;
- 产品手册:按功能或参数组切分,并带上产品名称;
- 流程制度:步骤、适用条件和例外规则尽量不拆开;
- 表格参数:保留表头与行的对应关系;
- 长篇案例:按背景、方案、实施和结果分别组织。
切片完成后应人工抽查,确认每个片段脱离原文页面后仍能被理解。
五、检索要同时考虑语义、关键词和业务条件
只依赖语义相似度,可能会把名称相近但版本不同的产品混在一起;只依赖关键词,又难以理解用户的口语表达。企业知识库通常需要组合语义检索、关键词检索和元数据过滤。
例如用户询问“本地部署是否支持离线运行”,系统不仅要查找“本地部署”的相似内容,还应根据当前产品、客户权限和资料版本过滤结果。对专业型号、政策编号、地名和精确参数,关键词匹配尤其重要。
检索结果不应直接等同于答案。系统还需要判断证据是否足够、多个来源是否冲突,以及当前用户是否有权看到这些内容。
六、回答策略必须包含引用、拒答和转人工
一个可信的数字人不是每个问题都回答,而是知道什么时候应该停止。
建议设计四类响应:
- 有明确依据:给出简洁回答,并在需要时展示资料来源;
- 依据不完整:说明还需要哪些信息,再进行追问;
- 超出范围或资料冲突:明确表示暂时无法确认,不自行补全事实;
- 涉及报价、承诺或高风险事项:收集必要信息后转交人工。
对预约、留资、工单等动作,应让系统先展示即将提交的信息,由用户确认后再调用接口。数字人负责自然沟通,业务程序负责确定性执行。
七、用真实问题建立评测集
知识库是否可用,不能只靠团队随手提问。应建立版本化评测集,每次调整资料、检索或模型后重复测试。
评测问题至少分为五类:
- 标准问题:口径明确、资料中直接存在答案;
- 改写问题:同一含义使用不同表达;
- 多条件问题:需要结合产品、地区、时间等条件;
- 干扰问题:资料中存在相似但不适用的内容;
- 边界问题:超出知识范围、要求承诺或包含敏感信息。
可以记录以下指标:检索是否命中正确来源、回答是否覆盖关键点、是否出现无依据内容、引用是否正确、该拒答时是否拒答、该转人工时是否顺利完成。
八、上线后要持续收集失败样本
上线不是知识库建设的结束,而是获得真实问题的开始。运营看板至少应关注:
- 无结果和低置信度问题;
- 用户重复追问或重新表述的问题;
- 被用户点踩或转人工的对话;
- 引用了过期资料的回答;
- 不同终端的高频任务差异;
- 新增问题从发现到补齐知识的时间。
每周或每月把失败样本归类:是资料缺失、切片错误、检索不准、提示策略问题,还是本来就应由人工处理。不要只补一条答案,要修复产生该类错误的机制。
九、权限与数据边界不能后补
内部资料、客户资料和公开内容不应放在没有权限区分的同一检索空间。系统需要根据用户身份、终端和业务场景决定可检索范围,并记录知识来源与工具调用。
如果对话中可能出现个人信息,应明确收集目的、必要字段、保存期限和删除流程。生产日志也应避免无差别保存敏感原文。涉及更高数据安全要求时,可结合API与私有化部署进行分层设计。
十、上线前检查清单
- 已整理真实高频任务与问题样本;
- 每类知识都有权威来源和负责人;
- 过期、重复和无权限内容已隔离;
- 文档标题、表格和版本信息解析正确;
- 切片保持必要上下文;
- 精确关键词与语义检索可以互补;
- 回答能够展示或记录知识来源;
- 已设置无依据拒答和人工转接;
- 已建立标准、改写、干扰和边界评测集;
- 上线后有人负责分析失败问题并更新知识。
结语
数字人知识库的质量,不由文档数量决定,而由知识是否可信、检索是否准确、回答是否有边界以及运营是否持续决定。先用最小知识集覆盖一个具体任务,再通过真实问题逐步扩展,通常比一次性导入全部资料更稳妥。
如果你的目标是官网咨询或售前服务,可以结合AI数字人客服解决方案与实时交互智能体规划知识、对话和业务接口;项目验收时可继续参考AI交互智能体与传统数字人的区别。
