五维横评 · 榜单
按 agenticness 五维(autonomy / env / goal / learn / temporal)评判模型在真实生产、工作、学习场景下的可用性。 本页只读“判定层”(这道题按预设硬项到底算不算过):一格=一道题的一次跑(同一题 k 取均值),按标准答案里的硬项(gold)逐条判真假后定下的 pass。
榜单(模型 × 五维)
快照读取中…
快照日
| 模型(臂) | 可判 n | autonomy | env | goal | learn | temporal | 合计 pass | 中位(P10~P90) | 剔除 | 上屏 |
|---|---|---|---|---|---|---|---|---|---|---|
| 加载中… | ||||||||||
★ 维格里的百分数是**可判部分 pass 率**,括号内是**可判格数**;不可判的格不进分母(读法离开覆盖率会误导)。 「上屏」= 任一家模型在任一维上 ≥50% 不达标。
读法与门槛(硬要求,逐条写明)
| 报的是哪一层 | 判定层(按 gold 硬项判 pass);不是覆盖层(覆盖层=抓进多少条目) |
|---|---|
| 样本单位 | 一格 = 一道题 × 一次跑(同题多 k 先取均值) |
| pass 定义 | 全部硬项为真;任一硬项判不了则 pass=None(不猜、不默认放行) |
| 不可判格 | 既不算对也不算错,不进分母,单独列数 |
| 读数纪律 | 每个读数必带 n;合计给 中位与真 P10~P90;错配格(错腿 / status≠ok)剔除并单列,且把「本批废格」与「陈账」分开 |
| 上屏门槛 | 任一家模型在任一维上 **≥50% 不达标**才入表(判据只由客观硬项判,主观分不进门槛) |
| 不可验披露 | 缺 self_proof=verified 的格(即"读不到实际腿")仍留在分母,但**单列披露** |
| 跑法列 | 多段 / 单段 / 混跑给**比例**,不写"是或不是";同模型不同跑法不当第三家模型比 |
| 限流重试 | 印出占比但**不剔除**(重试格 ≠ 一次过格) |
| 判分程序指纹 | — |
| 数据构建 | scripts/relay/bench_build.py |
逐题明细(按模型折叠)
默认只列**干净格**;勾「连剔除格一起看」可把错腿/废格按原因列出。硬项逐条给出真/假/判不了。
加载中…
真源:`LLM五维横评/runs/<日期>/<臂>/**/{manifest,judge}.json`。 本页不重跑、不重判,判分口径直接取自 LLM五维横评/runner/judge_gold.py。