GRAPH V2 · FIRST OFFICIAL

模型分析

这是当前 16 个模型、每个模型 10 个独立工程任务的正式分析。所有公开分数统一来自 Graph V2 scorer 3.1;模型、provider、runner 和最终选用的 attempt 分开记录。它回答的是“谁在这次复杂知识图谱网站任务中交付得更完整”,不是通用模型能力排名。

OFFICIAL TASKS

160/160

16 个模型 × 10 个冻结任务,所有槽位都有分数和产物记录。

RUNNER STATE

156/160

156 个正常完成,4 个失败槽位仍按 0 分与真实消耗计入。

S TIER

2

GPT-5.6 Sol、Claude Fable 5;同档不做精确名次。

SNAPSHOT

2026-07-18

数据生成:2026年7月22日 02:22

READING THE BOARD

先把榜单读对

总榜是档位,不是伪精确排名

按 10 轮平均分划档:S≥60,A=50–59.99,B=40–49.99,C=30–39.99,D=20–29.99,E<20。同一档内的细小均分差不被包装成确定名次。

平均分必须配合中位数和范围

每个模型只有 10 个任务。平均分反映总产出,中位数反映典型轮次,最高/最低分和低尾次数用来暴露“偶尔极强、偶尔不可交付”的波动。

质量榜与性价比榜回答不同问题

质量榜只看产物;性价比榜再引入现金成本、墙钟、调用数和 token 排名。低价或快不能替代质量,高分也不会自动等于高性价比。

QUALITY DISTRIBUTION

16 个模型的质量分布

档位模型平均分中位数10 轮范围≥70<10失败槽位平均耗时调用数10 任务成本
SGPT-5.6 Sol69.9582.711.3898.827/101/100/106.26175估算 ¥86.606
第一方标准价估算
SClaude Fable 562.3971.473.7698.886/101/100/108.58207估算 ¥188.394
第一方标准价估算
AQwen 3.8 Max Preview53.2349.3412.7889.864/100/100/1016.91292订阅制,无法折现
订阅制,未定价
AKimi K350.7147.5312.0095.453/100/100/1013.09225¥37.995
官方直连价
BClaude Opus 4.842.5537.277.3988.122/101/100/106.51178估算 ¥82.736
第一方标准价估算
BGLM 5.241.4223.1412.8887.222/100/100/1012.64239¥31.192
官方直连价
CHunyuan Hy336.9337.030.0080.151/102/100/103.70165¥3.103
官方直连价
CMiniMax M335.5525.660.0091.741/101/100/106.97161¥4.568
官方直连价
CQwen 3.7 Max31.4332.400.0092.891/101/100/108.73235¥29.312
官方直连价
CLongCat 2.030.3822.520.0081.671/101/100/107.02229¥2.847
官方直连价
CGrok 4.530.0818.8817.5097.531/100/100/103.4959¥12.025
官方直连价
DDeepSeek V4 Pro28.0718.756.0974.621/102/100/1010.32291¥3.819
官方直连价
DMiMo V2.5 Pro25.6426.230.0048.560/101/100/106.97171¥2.646
官方直连价
DDoubao Seed Evolving24.9217.9610.6054.790/100/100/105.31192¥11.889
官方直连价
DStep 3.7 Flash21.6628.362.7335.710/103/100/107.54372¥10.034
官方直连价
EERNIE 5.16.582.730.0039.270/109/104/1010.4090¥37.674
官方直连价

S 档领先,但低尾仍然存在

GPT-5.6 Sol 均分 69.95、中位数 82.71Claude Fable 5 均分 62.39、中位数 71.47。两者的中位数都高于均分,说明典型轮次很强,但各有一个低于 10 分的尾部任务。

A 档是两种不同的波动

Qwen 3.8 Max Preview 均分 53.23,10 轮范围 12.7889.86Kimi K3 均分 50.71,范围 12.0095.45。二者都没有失败槽位,但都不是“每轮稳定同分”的模型。

B 档均分接近,典型轮次差异明显

Claude Opus 4.8GLM 5.2 均分只差 1.13,但中位数分别是 37.2723.14。只看均分会漏掉 GLM 更明显的高分拉升效应。

失败不会从榜单里消失

当前 160 个槽位中有 4 个 runner 失败,全部来自 ERNIE 5.1。这些槽位按 0 分保留,已经产生的调用、token、耗时和费用同样进入工程消耗;这也是 E 档结果的一部分,而不是需要从平均值里剔除的异常点。

CROSS-RUN READ

四强差距已经从能力面移到时间面

“全面落后”已经不成立

把 Kimi K3、Qwen 3.8 与 Sol、Fable 的最新对照批及历史轨迹放在一起看,四者在算法、数据一致性、搜索、筛选和空间布局上已经互有胜负。真正还拉开样本权重的,是巅峰表现能否跨批复现、一次调用能完成多少工作,以及接近满分交付是否足够确定。

本节是跨批补充观察,不改动上方当前正式榜;不同模型取各自已审计的最新有效批次,所有对照仍来自 scorer 3.1 的 score.json。

01 · 巅峰一致性

“每次都在头部”与“最近一次很强”不是同一种证据

GPT-5.6 Sol69.95 → 64.36 → 61.00

三批都在 S 档

Claude Fable 562.39 → 57.86 → 51.60

三批都在 50 分以上

Kimi K341.94 → 50.71 → 54.55

从 B 档爬到头部

Qwen 3.848.70 → 53.23 → 69.33

最新批次才登顶

02 · 单步效率

Sol / Fable 步子更大,K3 的慢是体验级短板

同题 full2 对照里,Sol、Fable、K3、Qwen 分别用了 147、226、248、245 次调用。Sol 用最少往返完成最多工作;K3 约 23 tok/s,只有 Sol、Fable 正常速度的一半左右,能力已经进第一梯队,交付体感仍在后排。

03 · 上限确定性

闭源头部仍更容易重复交出近满分轮

Sol 与 Fable 在历史批次里都不止一次出现 97+ 的近满分轮;K3 也能触到 95.9–97.4,但更像偶发上限。差距不是“能不能做到”,而是下一次是否还敢预期它做到。

ALREADY COMPETITIVE

已经不能再说落后的五个分项

评分项Kimi K3Qwen 3.8Fable 5GPT-5.6 Sol
算法 / 数据层90–100%98–100%80–100%100%
搜索状态69%90%90%78%
节点详情56%80%50%33%
类型筛选60%70%40%67%
空间可读性63%80%52%73%

Qwen 3.8 的最新批在搜索状态、节点详情和空间可读性上已经是四强最高;这恰好是它早期最容易出现交互漂移与布局坍缩的区域,也说明 Preview 期快速迭代既能补短板,也会让“当前测到的是哪个版本”成为额外变量。

Kimi K3

高上限但双峰明显。主要死法是视觉持续抖动和空白画布;还欠“渲染稳定性 + 速度”两个补丁。

Qwen 3.8

同类渲染事故更少,最新批灾难率降到 10%。补短板最快,但 Preview 版本漂移让跨日复现需要更谨慎。

Claude Fable 5

跨批地板更可信;命门集中在画布空白与关系未渲染,本质上是渲染管线偶发断链。

GPT-5.6 Sol

单步效率与近满分复现最好;软肋是边堆叠、毛球布局和节点详情,不是能力面的全面碾压。

SCORER 3.1

100 分是怎样得到的

评分器不是看截图打印象分,而是在浏览器中验证冻结图谱身份、真实关系渲染、可读布局、交互状态、算法正确性、离线运行和稳定性。11 项基础分合计 100 分:

数据

加载数据身份

12

节点、边与端点是否与冻结输入一致

图谱

关系渲染

14

关系线是否真实、完整且可见

视觉

空间可读性

11

冷启动布局、画布占用与节点分布

交互

搜索状态转换

9

搜索、定位与清除是否改变状态

交互

节点详情与邻居

11

点击节点后的字段与邻接关系

交互

类型筛选

7

筛选控件、状态变化与恢复

交互

缩放、平移与重置

7

视口操作及重置后的完整恢复

稳定性

离线运行

5

外部请求、运行错误与资源失败

算法

最短路径正确性

10

固定路径用例的真实计算结果

数据

统计准确性

6

顶部、类型与关系统计是否正确

视觉

视觉稳定性

8

收敛时间、抖动峰值与最终稳定

基础分之后还有可交付性乘数

页面打不开、画布空白、加载的图谱身份不一致、关系几乎没有渲染、依赖外网、主线程失去响应、持续抖动或布局退化,都会触发乘数或上限。例如入口不可加载 ×0.25、空白图谱 ×0.35、身份不一致 ×0.65、关系缺失 ×0.55、关系不完整 ×0.82。评分器按上游根因处理同源失败,避免把一个加载失败重复惩罚多次。

VALUE INDEX

性价比榜及其边界

综合消耗排名

成本排名 × 40% + 耗时排名 × 25% + 调用数排名 × 20% + token 排名 × 15%;性价比指数 = 质量均分 ÷ 综合消耗排名,指数越高越好。

当前结果

Hunyuan Hy39.98 位居性价比榜首。Grok 4.5 同时拥有最短平均墙钟(3.49 分钟)和最少调用(59 次)。

排名模型性价比指数平均分平均耗时调用数10 任务成本
1Hunyuan Hy39.9836.933.70165¥3.103
2Grok 4.57.9230.083.4959¥12.025
3GPT-5.6 Sol7.9069.956.26175估算 ¥86.606
4MiniMax M37.8135.556.97161¥4.568
5Claude Fable 55.3662.398.58207估算 ¥188.394
6MiMo V2.5 Pro5.3425.646.97171¥2.646
7Claude Opus 4.84.9542.556.51178估算 ¥82.736
8Doubao Seed Evolving4.5724.925.31192¥11.889
9Kimi K34.5550.7113.09225¥37.995
10LongCat 2.04.4730.387.02229¥2.847
11GLM 5.23.5741.4212.64239¥31.192
12DeepSeek V4 Pro2.9528.0710.32291¥3.819
13Qwen 3.7 Max2.9431.438.73235¥29.312
14Step 3.7 Flash2.1921.667.54372¥10.034
15ERNIE 5.10.746.5810.4090¥37.674

Qwen 3.8 只有 Token Plan 订阅信息,没有公开且可换算的按 token API 单价,因此不参与现金成本和性价比排名。Fable、Opus、Sol 的数据库成本字段为 0,本榜统一按各自第一方官方 API 标准价做反事实估算,不等同于代理账单实扣。

AUDIT TRAIL

替换、原始产物与审计边界

最终选用 attempt

当前榜采用第一轮修正后的 16×10 槽位。Opus、Kimi、Qwen 3.8 使用已确认替换轮,Sol 使用首次完整有效轮;旧 attempt 保留在全量审计数据中,但没有混入当前平均分。

原始产物不被网页改写

每个槽位提供完整 raw.tar.gz,保留原目录、文件和符号链接;网页 viewer 只是另行生成的路径兼容副本。源目录与归档各自记录 SHA-256,可独立验证。

时间与成本口径

墙钟来自每个槽位的 startedAt→endedAt,包含模型、工具、本地读写与 harness 开销。价格基准日为 2026-07-22,美元按 1 USD = ¥6.8 折算;缓存与 reasoning 依各模型公开规则计价。

发布包规模

当前发布包含 160 个槽位、4,656 个原始文件、150.7 MB 源数据与 26.4 MB 压缩归档;上一轮 80 个产物完整保存在旧榜单。

LIMITATIONS

这份榜单不能证明什么

  • • 结果只代表本次 Web4 复杂个人知识图谱网站任务,不可外推为通用编程、推理或写作能力排名。
  • • 每个模型只有 10 个任务,服务更新、随机性和 agent 路径都会影响分布;均分小差距不等于稳定优劣。
  • • 最新替换批次没有覆盖完全一致的人工视觉判定,因此当前正式榜只采用所有 160 个槽位共有的 scorer 3.1 自动检查口径。
  • • 调用数是 OpenCode assistant message 数,接近 API 往返次数但不是 HTTP 抓包;在 assistant message 形成前失败的请求可能不可见。
  • • 价格不含税、汇率波动、代理加价、订阅沉没成本、工具服务费和人工复核成本;性价比指数应当与质量分布一起阅读。

版本:web4-graph-v2-first-official · graph-v2-first-official-schema-1.3 · graph-v2-scorer-3.1-first-official · 页面生成 2026年7月22日 02:58