数据截至 (上游 commit f72f75d8c3eb)
04 · 评测闭环
本章讲「怎么知道 agent 答得对不对」:多次采样 → 裁判模型判分 → Pass@k 统计。这是评测 agentic 能力的标准套路,细节在
run_multi_react.py和evaluation/。
3.1 为什么要跑多次(rollout)
深度研究是随机的——temperature=0.6、搜索结果随时间变,同一道题跑两次可能一次对一次错。所以评测要跑多次取统计量。run_multi_react.py 默认 roll_out_count=3(run_multi_react.py:22),每道题独立跑 3 次,结果分别落 iter1.jsonl / iter2.jsonl / iter3.jsonl(run_multi_react.py:87-89)。