五维横评 · 榜单

按 agenticness 五维(autonomy / env / goal / learn / temporal)评判模型在真实生产、工作、学习场景下的可用性。 本页只读“判定层”(这道题按预设硬项到底算不算过):一格=一道题的一次跑(同一题 k 取均值),按标准答案里的硬项(gold)逐条判真假后定下的 pass。

榜单读法与门槛逐题明细

榜单(模型 × 五维)

快照读取中…

快照日

模型(臂)可判 n autonomyenvgoallearntemporal 合计 pass中位(P10~P90)剔除上屏
加载中…

★ 维格里的百分数是**可判部分 pass 率**,括号内是**可判格数**;不可判的格不进分母(读法离开覆盖率会误导)。 「上屏」= 任一家模型在任一维上 ≥50% 不达标。

读法与门槛(硬要求,逐条写明)

报的是哪一层判定层(按 gold 硬项判 pass);不是覆盖层(覆盖层=抓进多少条目)
样本单位一格 = 一道题 × 一次跑(同题多 k 先取均值)
pass 定义全部硬项为真;任一硬项判不了则 pass=None(不猜、不默认放行)
不可判格既不算对也不算错,不进分母,单独列数
读数纪律每个读数必带 n;合计给 中位与真 P10~P90;错配格(错腿 / status≠ok)剔除并单列,且把「本批废格」与「陈账」分开
上屏门槛任一家模型在任一维上 **≥50% 不达标**才入表(判据只由客观硬项判,主观分不进门槛)
不可验披露缺 self_proof=verified 的格(即"读不到实际腿")仍留在分母,但**单列披露**
跑法列多段 / 单段 / 混跑给**比例**,不写"是或不是";同模型不同跑法不当第三家模型比
限流重试印出占比但**不剔除**(重试格 ≠ 一次过格)
判分程序指纹—
数据构建scripts/relay/bench_build.py

逐题明细(按模型折叠)

默认只列**干净格**;勾「连剔除格一起看」可把错腿/废格按原因列出。硬项逐条给出真/假/判不了。

加载中…

真源:`LLM五维横评/runs/<日期>/<臂>/**/{manifest,judge}.json`。 本页不重跑、不重判,判分口径直接取自 LLM五维横评/runner/judge_gold.py。