Skip to content

腾讯文档、乐享等资料库

资料库不是垃圾桶,是带权限的问答上下文

很多人把资料库理解成“把所有文件丢进去让 AI 自己找”。结果一个库里混着制度、合同、报销规则、培训材料,问什么召回什么都乱,答案还经常互相打架。

资料库的正确定位是:把已批准的资料作为回答上下文,每条回答都能回到原文位置。它解决的是“新员工查制度要翻半天”“售前找产品参数要问三个人”这类问题,不是替代搜索引擎。一个知识库一个主题,按权限边界拆分,召回才不会乱。

主案例:把公司制度做成新员工问答库

场景:新员工入职总在问“年假怎么算”“报销流程是什么”“出差标准多少”。目标是把制度文件建成知识库,让 WorkBuddy 带着原文位置回答,答不了的明确说不知道。

第一步:按主题和权限分批接入

不要把所有部门资料混在一个库里。按主题拆:制度一个库、产品一个库、培训一个库。每个库设置可见范围,离职成员及时移除。

维度怎么拆
主题制度、产品、培训各建一个库
权限按部门或岗位设置可见范围
来源只放已批准的资料,不放草稿和待审

第二步:上传并等待索引

上传文件支持 .md、.docx、.pdf(每个不超过 30 MB)和 .zip、.tar.gz 压缩包(每个不超过 300 MB)。上传后等待索引完成,在知识库首页确认启用状态。索引失败多半是格式、大小或编码问题——文件编码用 UTF-8 或 GBK。

第三步:调检索参数

检索参数直接影响召回质量:

参数建议值说明
Top K3-5值越小越精确,只返回最相关的几条
Score threshold0-0.5值越高只返回高度相关结果

第四步:用三类问题测试

用三类问题测试,三类都过再上线:

text
用以下三类问题测试制度知识库:
1. 已知答案:年假按工龄怎么算?——应能定位原文条款;
2. 资料冲突:两版报销标准金额不同——应说明冲突并标注来源;
3. 无法回答:明年是否涨薪?——应明确说资料中无此信息,不编造。
输出 qa-test-result.md,记录问题、预期、实际、原文位置、通过状态。

ps:无法从资料得出的答案必须明确拒答或标记待确认,这是知识库可信的底线。

第五步:发现过期资料回源修订

发现过期资料时回到源系统修订,不要在知识库里直接改。知识库的内容以源文件为准,改源再重新索引。

text
基于制度资料库回答问题并给出证据。
输入:问题、资料库范围、时间要求。
动作:检索相关资料,区分事实、推断和缺失信息。
约束:只使用有权限的资料,不能找到时明确说明。
输出:简短答案、引用位置、资料日期和待确认项。
验收:读者能回到原资料复核每个关键结论。

延伸:从产品资料生成售前问答草稿

同样的方法可以用于产品资料库:把产品手册、参数表、案例放进一个库,让售前按客户问题快速生成带原文引用的问答草稿。冲突资料(两版参数不一致)单独标出,不混进正式回答。

资料库建设常见错误

常见错误为什么会发生更好的写法
所有资料混在一个库图省事按主题和权限拆分,一个库一个主题
把草稿和待审资料也丢进去没区分来源只放已批准的资料
答不了的也编一个怕回答“不知道”无资料时明确拒答,标待确认
在知识库里直接改内容以为改了就行回源系统改,再重新索引
不测冲突和无法回答的问题只测正常情况用三类问题测试,全过才上线