Wenjie Zhang
|
eeb53f4774
|
feat: 添加 PaddleX OCR 支持及示例更新
- 在 example_usage.py 中更新分析文档的示例,使用新的 PaddleX OCR 服务。
- 在 data_router.py 中优化文件处理反馈信息,增加处理失败文件的统计。
- 在 indexing.py 中新增对 PaddleX OCR 的支持。
- 在 _ocr.py 中添加 process_pdf_paddlex 方法,集成 PaddleX OCR 处理逻辑。
- 新增 paddlex.py 文件,封装 PaddleX 版面解析服务的 API 调用。
- 更新前端 DataBaseInfoView.vue,增加 PaddleX OCR 选项。
- 新增测试文件 PixPin_2025-06-19_23-42-17.png 以支持 OCR 测试。
|
2025-06-23 10:09:51 +08:00 |
|
Wenjie Zhang
|
b0db3c6b0d
|
feat: 更新 Docker 配置和添加 MinerU OCR 服务
- 修改了 docker-compose.yml,更新了 API 和 Web 服务的镜像名称,并添加了 MinerU OCR 服务。
- 在 pyproject.toml 中添加了 Ruff 代码检查工具的配置。
- 更新了 API 和 Web Dockerfile,添加了代理环境变量。
- 新增了用于拉取 Docker 镜像的脚本。
- 在文档中添加了关于如何使用 MinerU OCR 的说明。
- 优化了代码结构和日志记录,提升了可读性和维护性。
|
2025-05-23 15:30:14 +08:00 |
|
Wenjie Zhang
|
144632b703
|
进一步优化并行处理能力:file-to-chunk 部分优化完成
|
2025-05-10 10:53:15 +08:00 |
|
Wenjie Zhang
|
7563c116fc
|
优化文档添加逻辑
|
2025-03-23 23:10:32 +08:00 |
|
Wenjie Zhang
|
d26fda4053
|
更新了很多
- 添加了系统提示词
- 添加了知识库的加载方式
|
2025-03-20 19:51:46 +08:00 |
|
Wenjie Zhang
|
87807953b5
|
1. 添加 chunk 信息
2. 前端的chunk展示优化,默认使用 start_char_idx,如果没有则使用 id
3. 修改默认overlap为100token
|
2025-03-12 21:15:04 +08:00 |
|
Wenjie Zhang
|
e968a3d9f8
|
fix pdf parser bug
|
2024-09-29 16:13:06 +08:00 |
|
Wenjie Zhang
|
542562dd5b
|
fix chunking
|
2024-09-26 22:45:02 +08:00 |
|
Wenjie Zhang
|
6f81b061d2
|
update tools view and indexing
|
2024-09-25 13:46:23 +08:00 |
|