Wenjie Zhang
|
1efbf86bf0
|
refactor: 评估系统重构 - 后端统一 dataset/run 语义
- 评估数据集/题目/运行/逐题结果全量入库,JSONL 仅作为交换格式
- benchmark -> dataset, task -> run 术语统一
- 评估生成支持配置并发数
- 移除 base.py 中旧的 benchmarks_meta 元数据逻辑
- manager.py 统一表创建方法名
|
2026-05-26 17:40:17 +08:00 |
|
Wenjie Zhang
|
e3c5f41c7c
|
refactor: 知识库重新设计
- 默认的知识库类型新增图谱抽取能力
- 移除 LightRAG 以及原有的知识图谱支持
- 移除所有兼容性的代码
|
2026-05-26 17:39:12 +08:00 |
|
supreme0597
|
d0c60d9d82
|
feat(mention): 优化@提及搜索排序与高亮展示,修复唤醒交互及路径硬编码问题
|
2026-05-25 21:11:20 +08:00 |
|
Wenjie Zhang
|
81b5d1eb96
|
feat: 使用 json_repair 替代 json 处理 LLM 评判结果,增强错误处理能力
|
2026-05-07 09:49:01 +08:00 |
|
Wenjie Zhang
|
ab513e2619
|
feat: 优化评估基准生成,支持仅使用 commonrag/Milvus 知识库,调整参数配置
|
2026-05-06 22:12:09 +08:00 |
|
Wenjie Zhang
|
179b048f07
|
refactor(eval): 重构评估指标和基准生成
- 引入了一个新的指标计算模块,用于检索和答案评估。
-通过整合基准生成和评估指标来简化评估服务。
-为新指标和基准生成功能添加了单元测试。
- 更新了前端组件,以利用新的图标,并改进了评估基准的样式。
-将与评估相关的逻辑整合为专门的“知识/评估”结构,以更好地组织。
|
2026-05-06 18:04:31 +08:00 |
|