学习路线¶
路线 A:第一次系统学习 Eval Harness¶
按顺序读七篇基础课,每篇都先把实验跑起来,看完输出再对照答案,检查自己是不是真的理解了。基础打好后,再读 Reference Harness 工程篇,然后进入六条上游源码课程。这条路线会训练你从任意 Harness 里找到谁在规划 Trial、谁在留证据、谁负责评分和聚合,以及 Gate 到底在哪里作出判定,不会只让你背下某个工具的配置。
先把一条链走通。
验收时,给你一份只写了最终准确率的报告,你应该能找出它还缺哪些身份、分母、血缘和不确定性证据,并说清证据缺失会让 Gate 判定失败、直接阻断,还是只能给出「无法判断」。
路线 B:源码阅读与工具选型¶
先读基础 01、02、04、05,然后按「完整端到端 README → 入口 → 数据结构 → 执行循环 → Scorer → 报告 → 测试」这条线追每一门源码课。等你能说清一套工具怎样把状态传下去,再进入横向比较,这样才不会拿功能勾选表充当语义分析。
验收时,面对两个项目中同名的 metric,你应该能查清它们收到的是一条 Observation 还是一组 Score,它们有没有负责 Judge、聚合或 Gate,并且能从锁定的源码里拿出证据。
路线 C:Agent 与 Coding Agent 评测¶
重点读基础 01、03、04、06,再跟着 Harbor/Terminal-Bench、SWE-bench 机制案例和 Agent Environment 工程篇往下学。建模时要把工具事件、Diff、测试结果和环境最后的状态分开记,因为 Agent 在最后自己说「完成了」,不能替代独立断言。
验收时,如果一个 Coding Agent 超时后又成功了,你应该能分清 Agent 自己做的恢复和 Harness 记录的 Attempt,证明统计分母没变,还能从 Gate 一路倒查到补丁和测试 Artifact。
路线 D:Eval-to-RL 与质量发布¶
重点读基础 05、06、07,再学 Judge 怎样校准、结果如何做统计比较、质量 Gate 根据什么放行,以及 Eval-to-RL 工程篇怎样连接评测和训练。在整个过程中,训练 reward、checkpoint choice 和 independent release eval 必须分开记。边界不能混。
验收时,给你一条 Score,你应该能写出 RewardAdapter 的能力合同,判断它能不能支持 DPO 偏好、GRPO/RFT 标量 reward,是只能支持一部分还是完全不可用,并设计一份不参与训练的独立发布集。
推荐实践节奏¶
每学完一个阶段,都要留下一份可以核对的产物:第一阶段保留完整的运行目录,第二阶段写出带永久链接的调用链笔记,第三阶段加入一个 Target Adapter 或 Scorer,第四阶段则做完一份对比报告,并在里面保留计划分母和独立 Gate。只要这些产物真的能跑、能回放,你就会比单纯统计「读完了多少页」更早发现自己还有哪里没看懂。