外观

WECHAT GROUP微信扫码加入WorkBuddy交流群
外观

很多人把资料库理解成“把所有文件丢进去让 AI 自己找”。结果一个库里混着制度、合同、报销规则、培训材料,问什么召回什么都乱,答案还经常互相打架。
资料库的正确定位是:把已批准的资料作为回答上下文,每条回答都能回到原文位置。它解决的是“新员工查制度要翻半天”“售前找产品参数要问三个人”这类问题,不是替代搜索引擎。一个知识库一个主题,按权限边界拆分,召回才不会乱。
场景:新员工入职总在问“年假怎么算”“报销流程是什么”“出差标准多少”。目标是把制度文件建成知识库,让 WorkBuddy 带着原文位置回答,答不了的明确说不知道。
不要把所有部门资料混在一个库里。按主题拆:制度一个库、产品一个库、培训一个库。每个库设置可见范围,离职成员及时移除。
| 维度 | 怎么拆 |
|---|---|
| 主题 | 制度、产品、培训各建一个库 |
| 权限 | 按部门或岗位设置可见范围 |
| 来源 | 只放已批准的资料,不放草稿和待审 |
上传文件支持 .md、.docx、.pdf(每个不超过 30 MB)和 .zip、.tar.gz 压缩包(每个不超过 300 MB)。上传后等待索引完成,在知识库首页确认启用状态。索引失败多半是格式、大小或编码问题——文件编码用 UTF-8 或 GBK。
检索参数直接影响召回质量:
| 参数 | 建议值 | 说明 |
|---|---|---|
| Top K | 3-5 | 值越小越精确,只返回最相关的几条 |
| Score threshold | 0-0.5 | 值越高只返回高度相关结果 |
用三类问题测试,三类都过再上线:
用以下三类问题测试制度知识库:
1. 已知答案:年假按工龄怎么算?——应能定位原文条款;
2. 资料冲突:两版报销标准金额不同——应说明冲突并标注来源;
3. 无法回答:明年是否涨薪?——应明确说资料中无此信息,不编造。
输出 qa-test-result.md,记录问题、预期、实际、原文位置、通过状态。ps:无法从资料得出的答案必须明确拒答或标记待确认,这是知识库可信的底线。
发现过期资料时回到源系统修订,不要在知识库里直接改。知识库的内容以源文件为准,改源再重新索引。
基于制度资料库回答问题并给出证据。
输入:问题、资料库范围、时间要求。
动作:检索相关资料,区分事实、推断和缺失信息。
约束:只使用有权限的资料,不能找到时明确说明。
输出:简短答案、引用位置、资料日期和待确认项。
验收:读者能回到原资料复核每个关键结论。同样的方法可以用于产品资料库:把产品手册、参数表、案例放进一个库,让售前按客户问题快速生成带原文引用的问答草稿。冲突资料(两版参数不一致)单独标出,不混进正式回答。
| 常见错误 | 为什么会发生 | 更好的写法 |
|---|---|---|
| 所有资料混在一个库 | 图省事 | 按主题和权限拆分,一个库一个主题 |
| 把草稿和待审资料也丢进去 | 没区分来源 | 只放已批准的资料 |
| 答不了的也编一个 | 怕回答“不知道” | 无资料时明确拒答,标待确认 |
| 在知识库里直接改内容 | 以为改了就行 | 回源系统改,再重新索引 |
| 不测冲突和无法回答的问题 | 只测正常情况 | 用三类问题测试,全过才上线 |