知识库不是文档搜索框
把文件塞进向量库、接一个大模型,两天就能跑通一个 Demo。但企业里真正难的是另外一半:资料谁维护、答案凭什么可信、这个人有没有权限看、半年后旧政策还在答。
我们按“能长期运转”来做,而不是“演示好看”。
建设路径
- 资料治理 —— 盘点来源与格式,定归属人和更新频率,清理重复与过期版本。这一步通常占一半工作量。
- 切片与索引 —— 按文档结构(条款、表格、步骤)而不是按字数切,保留出处锚点。
- 检索策略 —— 关键词加语义混合召回,配重排;不同问题类型走不同策略。
- 权限与审计 —— 在检索层做部门与密级过滤,全过程留日志。
- 评测集 —— 和你们一起整理 30-100 个真实问题与标准答案,作为验收依据。
- 更新机制 —— 文档变更自动重建索引,管理员每周维护,季度跑一次评测。
| 系统 | 可问答的知识库(Web 或嵌入你现有系统)、检索与权限服务 |
|---|---|
| 验收 | 评测集与跑分报告,逐条对答案出处 |
| 文档 | 架构说明、运维手册、管理员操作指引 |
| 培训 | 管理员与种子用户培训,含资料整理规范 |
关于这项服务,常被问到的
我们的资料很乱,扫描件、Word、飞书文档都有,还能做吗?
能做,但不要跳过清洗这一步。资料治理通常占整个项目一半以上的工作量,谁负责、什么格式、怎么命名、谁来复核,这些定下来之后,剩下的才是技术活。
准确率怎么验收?
项目开工前一起定评测集:30 到 100 个真实问题,答案由你们确认过。上线标准按这个集子跑分,达标才算交付。没有评测集的项目,最后都会变成“感觉不太准”却没人能说清差在哪。
会不会有人问到不该看的内容?
权限必须在检索层做,而不是在提示词里叮嘱模型。我们按部门和密级建索引,答案只从这个人能读的文档里生成,全过程留日志可审计。
能完全私有化吗?
能。模型、向量库、文档存储全部部署在你的机器或专有云里,资料不出域。需要外接大模型 API 的场景,我们会在方案里写清哪些字段外发、脱敏规则是什么。
上线之后谁来维护?
默认交付包含管理员培训和运维手册,日常更新由你们的知识库管理员做,每周半小时。也可以选年度陪跑,我们负责评测、索引重建和季度优化。