评测¶
评测页对模型版本运行评测,报告题目率、步骤率与热力图。

官方 Benchmark¶
官方 Benchmark卡片对官方 SciCode 基准评测。
- 官方评测集——切分选择:
validation或test。 - 模型版本——要评测的版本,如
Qwen/Qwen3.6-35B-A3B或已训版本。 - Temperature、并发数、重复次数。
- 使用背景提示——包含题目的背景上下文。
- 启用 thinking——启用模型的思考/推理模式。
点 展开完整命令 预览 scripts/eval.sh,再点 开始官方评测。
官方结果仅用于评测
官方 benchmark 结果不用作训练数据。训练数据来自模型在自建题库上的轨迹。
题目预览¶
题目预览展示官方 validation/test 集的规模、领域分布与步骤数——展开可查看正在评测的内容。
评测记录¶
评测记录在 validation / test / smoke 标签下列出历史运行。每行含 ID、模型版本、
背景提示标记、thinking 标记、重复次数、题目率、步骤率、通过数、时间与操作。
官方结果不进入训练。
热力图¶
评测热力图跨模型版本渲染每题 pass/fail 热力图,便于查看每个版本解出了哪些题。点 加载热力图 为所选记录渲染。
题库评测¶
对自建题库的评测(每题用其自己的 test_data.h5 评分)在
题库页进行;通过的轨迹可生成 SFT 训练数据。