跳转至

评测

评测页对模型版本运行评测,报告题目率、步骤率与热力图。

评测——官方 Benchmark 配置卡片与评测记录。

官方 Benchmark

官方 Benchmark卡片对官方 SciCode 基准评测。

  • 官方评测集——切分选择:validationtest
  • 模型版本——要评测的版本,如 Qwen/Qwen3.6-35B-A3B 或已训版本。
  • Temperature并发数重复次数
  • 使用背景提示——包含题目的背景上下文。
  • 启用 thinking——启用模型的思考/推理模式。

展开完整命令 预览 scripts/eval.sh,再点 开始官方评测

官方结果仅用于评测

官方 benchmark 结果用作训练数据。训练数据来自模型在自建题库上的轨迹。

题目预览

题目预览展示官方 validation/test 集的规模、领域分布与步骤数——展开可查看正在评测的内容。

评测记录

评测记录validation / test / smoke 标签下列出历史运行。每行含 ID、模型版本、 背景提示标记、thinking 标记、重复次数、题目率步骤率通过数、时间与操作。 官方结果不进入训练。

热力图

评测热力图跨模型版本渲染每题 pass/fail 热力图,便于查看每个版本解出了哪些题。点 加载热力图 为所选记录渲染。

题库评测

对自建题库的评测(每题用其自己的 test_data.h5 评分)在 题库页进行;通过的轨迹可生成 SFT 训练数据。