总榜是档位,不是伪精确排名
按 10 轮平均分划档:S≥60,A=50–59.99,B=40–49.99,C=30–39.99,D=20–29.99,E<20。同一档内的细小均分差不被包装成确定名次。
GRAPH V2 · FIRST OFFICIAL
这是当前 16 个模型、每个模型 10 个独立工程任务的正式分析。所有公开分数统一来自 Graph V2 scorer 3.1;模型、provider、runner 和最终选用的 attempt 分开记录。它回答的是“谁在这次复杂知识图谱网站任务中交付得更完整”,不是通用模型能力排名。
OFFICIAL TASKS
160/160
16 个模型 × 10 个冻结任务,所有槽位都有分数和产物记录。
RUNNER STATE
156/160
156 个正常完成,4 个失败槽位仍按 0 分与真实消耗计入。
S TIER
2
GPT-5.6 Sol、Claude Fable 5;同档不做精确名次。
SNAPSHOT
2026-07-18
数据生成:2026年7月22日 02:22
READING THE BOARD
按 10 轮平均分划档:S≥60,A=50–59.99,B=40–49.99,C=30–39.99,D=20–29.99,E<20。同一档内的细小均分差不被包装成确定名次。
每个模型只有 10 个任务。平均分反映总产出,中位数反映典型轮次,最高/最低分和低尾次数用来暴露“偶尔极强、偶尔不可交付”的波动。
质量榜只看产物;性价比榜再引入现金成本、墙钟、调用数和 token 排名。低价或快不能替代质量,高分也不会自动等于高性价比。
QUALITY DISTRIBUTION
| 档位 | 模型 | 平均分 | 中位数 | 10 轮范围 | ≥70 | <10 | 失败槽位 | 平均耗时 | 调用数 | 10 任务成本 |
|---|---|---|---|---|---|---|---|---|---|---|
| S | GPT-5.6 Sol | 69.95 | 82.71 | 1.38–98.82 | 7/10 | 1/10 | 0/10 | 6.26 分 | 175 | 估算 ¥86.606 第一方标准价估算 |
| S | Claude Fable 5 | 62.39 | 71.47 | 3.76–98.88 | 6/10 | 1/10 | 0/10 | 8.58 分 | 207 | 估算 ¥188.394 第一方标准价估算 |
| A | Qwen 3.8 Max Preview | 53.23 | 49.34 | 12.78–89.86 | 4/10 | 0/10 | 0/10 | 16.91 分 | 292 | 订阅制,无法折现 订阅制,未定价 |
| A | Kimi K3 | 50.71 | 47.53 | 12.00–95.45 | 3/10 | 0/10 | 0/10 | 13.09 分 | 225 | ¥37.995 官方直连价 |
| B | Claude Opus 4.8 | 42.55 | 37.27 | 7.39–88.12 | 2/10 | 1/10 | 0/10 | 6.51 分 | 178 | 估算 ¥82.736 第一方标准价估算 |
| B | GLM 5.2 | 41.42 | 23.14 | 12.88–87.22 | 2/10 | 0/10 | 0/10 | 12.64 分 | 239 | ¥31.192 官方直连价 |
| C | Hunyuan Hy3 | 36.93 | 37.03 | 0.00–80.15 | 1/10 | 2/10 | 0/10 | 3.70 分 | 165 | ¥3.103 官方直连价 |
| C | MiniMax M3 | 35.55 | 25.66 | 0.00–91.74 | 1/10 | 1/10 | 0/10 | 6.97 分 | 161 | ¥4.568 官方直连价 |
| C | Qwen 3.7 Max | 31.43 | 32.40 | 0.00–92.89 | 1/10 | 1/10 | 0/10 | 8.73 分 | 235 | ¥29.312 官方直连价 |
| C | LongCat 2.0 | 30.38 | 22.52 | 0.00–81.67 | 1/10 | 1/10 | 0/10 | 7.02 分 | 229 | ¥2.847 官方直连价 |
| C | Grok 4.5 | 30.08 | 18.88 | 17.50–97.53 | 1/10 | 0/10 | 0/10 | 3.49 分 | 59 | ¥12.025 官方直连价 |
| D | DeepSeek V4 Pro | 28.07 | 18.75 | 6.09–74.62 | 1/10 | 2/10 | 0/10 | 10.32 分 | 291 | ¥3.819 官方直连价 |
| D | MiMo V2.5 Pro | 25.64 | 26.23 | 0.00–48.56 | 0/10 | 1/10 | 0/10 | 6.97 分 | 171 | ¥2.646 官方直连价 |
| D | Doubao Seed Evolving | 24.92 | 17.96 | 10.60–54.79 | 0/10 | 0/10 | 0/10 | 5.31 分 | 192 | ¥11.889 官方直连价 |
| D | Step 3.7 Flash | 21.66 | 28.36 | 2.73–35.71 | 0/10 | 3/10 | 0/10 | 7.54 分 | 372 | ¥10.034 官方直连价 |
| E | ERNIE 5.1 | 6.58 | 2.73 | 0.00–39.27 | 0/10 | 9/10 | 4/10 | 10.40 分 | 90 | ¥37.674 官方直连价 |
GPT-5.6 Sol 均分 69.95、中位数 82.71;Claude Fable 5 均分 62.39、中位数 71.47。两者的中位数都高于均分,说明典型轮次很强,但各有一个低于 10 分的尾部任务。
Qwen 3.8 Max Preview 均分 53.23,10 轮范围 12.78–89.86;Kimi K3 均分 50.71,范围 12.00–95.45。二者都没有失败槽位,但都不是“每轮稳定同分”的模型。
Claude Opus 4.8 与 GLM 5.2 均分只差 1.13,但中位数分别是 37.27 和 23.14。只看均分会漏掉 GLM 更明显的高分拉升效应。
当前 160 个槽位中有 4 个 runner 失败,全部来自 ERNIE 5.1。这些槽位按 0 分保留,已经产生的调用、token、耗时和费用同样进入工程消耗;这也是 E 档结果的一部分,而不是需要从平均值里剔除的异常点。
CROSS-RUN READ
“全面落后”已经不成立
把 Kimi K3、Qwen 3.8 与 Sol、Fable 的最新对照批及历史轨迹放在一起看,四者在算法、数据一致性、搜索、筛选和空间布局上已经互有胜负。真正还拉开样本权重的,是巅峰表现能否跨批复现、一次调用能完成多少工作,以及接近满分交付是否足够确定。
本节是跨批补充观察,不改动上方当前正式榜;不同模型取各自已审计的最新有效批次,所有对照仍来自 scorer 3.1 的 score.json。
01 · 巅峰一致性
三批都在 S 档
三批都在 50 分以上
从 B 档爬到头部
最新批次才登顶
02 · 单步效率
同题 full2 对照里,Sol、Fable、K3、Qwen 分别用了 147、226、248、245 次调用。Sol 用最少往返完成最多工作;K3 约 23 tok/s,只有 Sol、Fable 正常速度的一半左右,能力已经进第一梯队,交付体感仍在后排。
03 · 上限确定性
Sol 与 Fable 在历史批次里都不止一次出现 97+ 的近满分轮;K3 也能触到 95.9–97.4,但更像偶发上限。差距不是“能不能做到”,而是下一次是否还敢预期它做到。
ALREADY COMPETITIVE
| 评分项 | Kimi K3 | Qwen 3.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 算法 / 数据层 | 90–100% | 98–100% | 80–100% | 100% |
| 搜索状态 | 69% | 90% | 90% | 78% |
| 节点详情 | 56% | 80% | 50% | 33% |
| 类型筛选 | 60% | 70% | 40% | 67% |
| 空间可读性 | 63% | 80% | 52% | 73% |
Qwen 3.8 的最新批在搜索状态、节点详情和空间可读性上已经是四强最高;这恰好是它早期最容易出现交互漂移与布局坍缩的区域,也说明 Preview 期快速迭代既能补短板,也会让“当前测到的是哪个版本”成为额外变量。
高上限但双峰明显。主要死法是视觉持续抖动和空白画布;还欠“渲染稳定性 + 速度”两个补丁。
同类渲染事故更少,最新批灾难率降到 10%。补短板最快,但 Preview 版本漂移让跨日复现需要更谨慎。
跨批地板更可信;命门集中在画布空白与关系未渲染,本质上是渲染管线偶发断链。
单步效率与近满分复现最好;软肋是边堆叠、毛球布局和节点详情,不是能力面的全面碾压。
SCORER 3.1
评分器不是看截图打印象分,而是在浏览器中验证冻结图谱身份、真实关系渲染、可读布局、交互状态、算法正确性、离线运行和稳定性。11 项基础分合计 100 分:
数据
节点、边与端点是否与冻结输入一致
图谱
关系线是否真实、完整且可见
视觉
冷启动布局、画布占用与节点分布
交互
搜索、定位与清除是否改变状态
交互
点击节点后的字段与邻接关系
交互
筛选控件、状态变化与恢复
交互
视口操作及重置后的完整恢复
稳定性
外部请求、运行错误与资源失败
算法
固定路径用例的真实计算结果
数据
顶部、类型与关系统计是否正确
视觉
收敛时间、抖动峰值与最终稳定
页面打不开、画布空白、加载的图谱身份不一致、关系几乎没有渲染、依赖外网、主线程失去响应、持续抖动或布局退化,都会触发乘数或上限。例如入口不可加载 ×0.25、空白图谱 ×0.35、身份不一致 ×0.65、关系缺失 ×0.55、关系不完整 ×0.82。评分器按上游根因处理同源失败,避免把一个加载失败重复惩罚多次。
VALUE INDEX
综合消耗排名
成本排名 × 40% + 耗时排名 × 25% + 调用数排名 × 20% + token 排名 × 15%;性价比指数 = 质量均分 ÷ 综合消耗排名,指数越高越好。
当前结果
Hunyuan Hy3 以 9.98 位居性价比榜首。Grok 4.5 同时拥有最短平均墙钟(3.49 分钟)和最少调用(59 次)。
| 排名 | 模型 | 性价比指数 | 平均分 | 平均耗时 | 调用数 | 10 任务成本 |
|---|---|---|---|---|---|---|
| 1 | Hunyuan Hy3 | 9.98 | 36.93 | 3.70 分 | 165 | ¥3.103 |
| 2 | Grok 4.5 | 7.92 | 30.08 | 3.49 分 | 59 | ¥12.025 |
| 3 | GPT-5.6 Sol | 7.90 | 69.95 | 6.26 分 | 175 | 估算 ¥86.606 |
| 4 | MiniMax M3 | 7.81 | 35.55 | 6.97 分 | 161 | ¥4.568 |
| 5 | Claude Fable 5 | 5.36 | 62.39 | 8.58 分 | 207 | 估算 ¥188.394 |
| 6 | MiMo V2.5 Pro | 5.34 | 25.64 | 6.97 分 | 171 | ¥2.646 |
| 7 | Claude Opus 4.8 | 4.95 | 42.55 | 6.51 分 | 178 | 估算 ¥82.736 |
| 8 | Doubao Seed Evolving | 4.57 | 24.92 | 5.31 分 | 192 | ¥11.889 |
| 9 | Kimi K3 | 4.55 | 50.71 | 13.09 分 | 225 | ¥37.995 |
| 10 | LongCat 2.0 | 4.47 | 30.38 | 7.02 分 | 229 | ¥2.847 |
| 11 | GLM 5.2 | 3.57 | 41.42 | 12.64 分 | 239 | ¥31.192 |
| 12 | DeepSeek V4 Pro | 2.95 | 28.07 | 10.32 分 | 291 | ¥3.819 |
| 13 | Qwen 3.7 Max | 2.94 | 31.43 | 8.73 分 | 235 | ¥29.312 |
| 14 | Step 3.7 Flash | 2.19 | 21.66 | 7.54 分 | 372 | ¥10.034 |
| 15 | ERNIE 5.1 | 0.74 | 6.58 | 10.40 分 | 90 | ¥37.674 |
Qwen 3.8 只有 Token Plan 订阅信息,没有公开且可换算的按 token API 单价,因此不参与现金成本和性价比排名。Fable、Opus、Sol 的数据库成本字段为 0,本榜统一按各自第一方官方 API 标准价做反事实估算,不等同于代理账单实扣。
AUDIT TRAIL
当前榜采用第一轮修正后的 16×10 槽位。Opus、Kimi、Qwen 3.8 使用已确认替换轮,Sol 使用首次完整有效轮;旧 attempt 保留在全量审计数据中,但没有混入当前平均分。
每个槽位提供完整 raw.tar.gz,保留原目录、文件和符号链接;网页 viewer 只是另行生成的路径兼容副本。源目录与归档各自记录 SHA-256,可独立验证。
墙钟来自每个槽位的 startedAt→endedAt,包含模型、工具、本地读写与 harness 开销。价格基准日为 2026-07-22,美元按 1 USD = ¥6.8 折算;缓存与 reasoning 依各模型公开规则计价。
当前发布包含 160 个槽位、4,656 个原始文件、150.7 MB 源数据与 26.4 MB 压缩归档;上一轮 80 个产物完整保存在旧榜单。
LIMITATIONS
版本:web4-graph-v2-first-official · graph-v2-first-official-schema-1.3 · graph-v2-scorer-3.1-first-official · 页面生成 2026年7月22日 02:58