- 评估数据集/题目/运行/逐题结果全量入库,JSONL 仅作为交换格式 - benchmark -> dataset, task -> run 术语统一 - 评估生成支持配置并发数 - 移除 base.py 中旧的 benchmarks_meta 元数据逻辑 - manager.py 统一表创建方法名 |
||
|---|---|---|
| .. | ||
| routers | ||
| utils | ||
| main.py | ||
| worker_main.py | ||
- 评估数据集/题目/运行/逐题结果全量入库,JSONL 仅作为交换格式 - benchmark -> dataset, task -> run 术语统一 - 评估生成支持配置并发数 - 移除 base.py 中旧的 benchmarks_meta 元数据逻辑 - manager.py 统一表创建方法名 |
||
|---|---|---|
| .. | ||
| routers | ||
| utils | ||
| main.py | ||
| worker_main.py | ||