ForcePilot/backend/package/yuxi/knowledge/eval
Wenjie Zhang 1efbf86bf0 refactor: 评估系统重构 - 后端统一 dataset/run 语义
- 评估数据集/题目/运行/逐题结果全量入库,JSONL 仅作为交换格式
- benchmark -> dataset, task -> run 术语统一
- 评估生成支持配置并发数
- 移除 base.py 中旧的 benchmarks_meta 元数据逻辑
- manager.py 统一表创建方法名
2026-05-26 17:40:17 +08:00
..
__init__.py refactor(eval): 重构评估指标和基准生成 2026-05-06 18:04:31 +08:00
benchmark_generation.py refactor: 评估系统重构 - 后端统一 dataset/run 语义 2026-05-26 17:40:17 +08:00
evaluator.py refactor(eval): 重构评估指标和基准生成 2026-05-06 18:04:31 +08:00
metrics.py feat(mention): 优化@提及搜索排序与高亮展示,修复唤醒交互及路径硬编码问题 2026-05-25 21:11:20 +08:00