docs/docs/cn/ai-employees/knowledge-base/knowledge-base/documents.md
进入知识库详情页后,点击左侧「Documents」。这里用于管理当前知识库里的文档,也是进入分段管理的入口。
点击右上角「Upload」上传文件。上传完成后,文档会自动进入分段生成和向量化流程。列表中的「Status」会先显示「Pending」,处理完成后变为「Success」。如果处理失败,会显示「Error」,文件名旁边也会显示错误提示图标。
目前支持的文档类型包括:txt、md、json、csv、xls、xlsx、pdf、doc、docx、ppt、pptx。
:::tip PDF 文档
PDF 只支持纯文本内容。如果 PDF 主要是扫描图片,需要先做 OCR,再把可提取文本的文件上传到知识库。
:::
如果需要一次导入多份文档,可以把文件打包成 ZIP 后上传。NocoBase 会在后台解压 ZIP,并把其中的文档导入到当前知识库。
:::tip 上传大小限制
ZIP 导入也会受到文件存储上传大小的限制。如果上传时提示文件过大,需要到知识库所使用的「File storage」中调整限制,相关配置见 文件存储引擎。
:::
文档列表里有几个常用字段:
| 字段 | 含义 |
|---|---|
| 「Filename」 | 上传后的文件名 |
| 「Status」 | 当前向量化状态,常见值为「Pending」「Success」「Error」 |
| 「Characters」 | 当前启用分段的字符总数 |
| 「Segments」 | 当前文档生成的分段数量 |
| 「Created at」「Updated at」 | 文档创建和最近更新时间 |
如果文档长时间停留在「Pending」,可以先点击「Refresh」刷新列表;如果仍未完成,再检查后台任务、向量存储和 LLM 服务是否可用。
在列表中勾选文档后,点击上方「Vectorization」,会重新向量化已选中的文档。未勾选任何文档时,点击「Vectorization」会处理当前知识库中的全部文档。
每行里的「Vectorization」只处理当前文档。通常在这些场景会用到:
:::tip
分段管理中的编辑、禁用、删除操作会自动触发重新向量化任务。列表状态短暂变为「Pending」是正常现象。
:::
每行右侧有三个常用操作:
列表上方的「Delete」用于批量删除已勾选文档。删除不可恢复,操作前需要确认文档不再被当前知识库使用。