ForcePilot/docs/advanced/document-processing.md
Wenjie Zhang 0fdc0acf91 docs: 清理 0.7 历史遗留内容并优化 README
对照 0.7 BREAKING CHANGE 逐文件复核 docs/,移除/修正已下线功能的描述:

- 移除 LightRAG、独立图谱上传、Ollama、旧版 v1 模型配置等已删除能力的描述
- 知识库类型更新为 Milvus + 只读连接器(Dify、Notion),补全图谱存储链路
  (Neo4j + PostgreSQL + Milvus 语义索引,RRF 融合)
- 补全知识库工具集(find_kb_document/open_kb_document),修正 Skills 沙盒路径
  为 /home/gem/skills、中间件目录为 agents/middlewares、评估入口为侧边栏 tab
- 知识库权限三档修正为 全局共享/部门共享/指定人可访问
- 下载版本统一为 0.7.0.dev0
- README 新增简介、技术栈与 0.7 动态,特性描述细化

经核实保留 Neo4j(仍用于 Milvus 知识库内图谱)与 MCP enabled 机制(仍在用),
未误删。vitepress build 验证通过。
2026-06-03 17:55:10 +08:00

123 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 文档处理与 OCR
Yuxi 支持多种文档格式的智能解析,从简单的文本文件到复杂的 PDF 文档,都能自动提取内容并转换为可检索的格式。
## 支持的文件类型
### 常规文档
| 类型 | 格式 | 说明 |
|------|------|------|
| 文本 | .txt, .md, .html | 直接提取内容 |
| Word | .docx | 保留格式和结构 |
| PDF | .pdf | 支持文本和图片 PDF |
| 表格 | .csv, .xls, .xlsx | 识别表格结构 |
| JSON | .json | 结构化数据 |
### 图片文件
对于图片文件,需要启用 OCR 才能提取文字:
- .jpg, .jpeg, .png, .bmp, .tiff, .tif, .gif, .webp
### 压缩包
支持上传 ZIP 压缩包,系统会:
- 自动提取并处理其中的 Markdown 文件
- 处理图片并上传到对象存储
- 智能识别 `full.md` 或第一个 `.md` 文件
### 网页内容
支持通过 URL 直接抓取网页内容:
1. 配置 `YUXI_URL_WHITELIST` 环境变量启用白名单机制
2. 系统自动将 HTML 转换为 Markdown
3. 内置去重机制,避免重复抓取
::: tip URL 白名单配置
示例:`YUXI_URL_WHITELIST=github.com,*.wikipedia.org,docs.python.org`
:::
## OCR 方案选择
系统提供多种 OCR 方案,适用于不同场景:
### 方案对比
| 方案 | 适用场景 | 硬件要求 | 特点 |
|------|----------|----------|------|
| RapidOCR | 基础文字识别 | CPU | 免费开源,速度快 |
| MinerU | 复杂 PDF、表格 | GPU | 精度高,版面分析好 |
| MinerU Official | 复杂文档 | 无 | 官方云服务,开箱即用 |
| PP-Structure-V3 | 表格、票据 | GPU | 专业版面解析 |
| DeepSeek OCR | 智能理解 | 无 | 云端服务Markdown 输出 |
### 选择建议
- **个人使用或 CPU 环境**:选择 RapidOCR免费且资源占用低
- **高精度需求**:选择 MinerU需要 GPU或 MinerU Official
- **表格密集型文档**:选择 PP-Structure-V3
- **简单云服务**:选择 DeepSeek OCR
## 快速配置
### RapidOCR
启动后会默认下载,无需配置
### MinerU高精度
首先从官网下载最新的 docker-compose 文件:
```bash
wget https://gcore.jsdelivr.net/gh/opendatalab/MinerU@master/docker/compose.yaml -O docker/mineru.compose.yml
```
启动服务(需要 GPU
```bash
docker compose -f docker/mineru.compose.yml --profile openai-server up -d
```
### MinerU Official云服务
从 [MinerU 官网](https://mineru.net) 获取 API 密钥,在 .env 配置环境变量
```env
MINERU_API_KEY=your-api-key-here
```
### PP-Structure-V3结构化
启动服务(需要 GPU
```bash
docker compose up paddlex -d
```
### DeepSeek OCR简单云服务
在 .env 配置(使用已有的 SiliconFlow 密钥)
```env
SILICONFLOW_API_KEY=your-api-key-here
```
## 图片显示配置
上传文档中的图片需要正确配置才能在外部显示:
`.env` 中设置服务器 IP
```
HOST_IP=your_server_ip
```
## 注意事项
1. **图片文件必须启用 OCR**:否则无法提取内容
2. **GPU 要求**MinerU 和 PP-Structure-V3 需要 GPU 支持
3. **API 密钥**:部分服务需要额外的 API 密钥配置
4. **超时处理**:复杂文档解析可能耗时较长,可通过 `MINERU_TIMEOUT` 环境变量调整超时时间
5. **文件大小限制**:单个上传文件大小不超过 100 MB