Kimi K3打响前端闪电战
知识图谱摘要
提及实体 (17)
关系 (13)
评测显示K3综合能力仅次于5.6 Sol和Fable 5
K3显著超越GLM 5.2,两者争夺国产模型头部位置
两家公司争夺国产大模型第一,互发模型竞争
沐秋批评K3宣传片软蒸馏Fable 5
Anthropic开发了Claude Fable 5
MiniMax开发了M3模型
智谱AI开发了GLM 5.2模型
Kimi开发了K3模型
百度开发了文心一言ERNIE 5.1
唐杰是智谱AI的联合创始人
唐杰是杨植麟在清华大学时的导师
文中提到杨植麟的美国导师点赞K3(注:非唐杰本人,但易混淆,此处仅作实体关联记录,实际为误读)
钟经纬作为外援参与了K3的Bench测试
Kimi K3打响前端闪电战
2026年7月22日 葬爱咸鱼 葬AI
「大的真来了」
激动人心的Kimi K3评测终于来了。
经过了将近一周的疯狂测试,不仅所有模型加一块花了小一万元API费用,并且引入了葬AI的好朋友钟经纬同志作为专业外援又跑了个Bench。
我们得出的结论是:
综合能力上,K3确实是世界第三水平,仅次于5.6 Sol和Fable 5,显著超越GLM 5.2。并且,K3是一个很全面的模型,在视觉理解等多模态领域也是一流水平。
特别值得一提的是,K3专门优化了一次性生成小游戏和前端代码能力,应该是Kimi在训练全阶段,都针对前端能力做了特别优化。
属于是带着产品传播思路训练模型。现在社交媒体吹K3的内容,大部分都是这两个场景。
我完全没有嘲讽Kimi的意思,而是建议家人们多学习。
首先,K3一句话生成漂亮网页和小游戏的能力做到了世界第一水平。其次,K3的综合能力也仅次于A畜O记两家的旗舰模型。赢得没毛病。
这其实体现了一个国产大模型的趋势,前端为王。
因为其他维度的能力很难展示。在社交媒体上,大模型的编程能力约等于做小游戏和漂亮网页。所以几个国产模型猛猛优化前端能力。
你要么能全方位领先,要么打穿某个垂直领域也可以。不然这么多模型,大伙根本用不过来。目前我们亲爱的Kimi就彻底打穿了用户心智。
好了,不绕弯子先说结论环节结束。让我们来逐步展示K3的水平。
首先登场的依旧是葬AI基准测试。
非常简单粗暴,根据葬AI的图谱数据构建知识图谱,然后调用浏览器来查看打分。每个模型每次启动独立Opencode会话跑10轮,最后用加权平均分排序。
这个测试有效的地方在于,以Hunyuan、Seed、MiniMax为代表的二线国产模型普遍不稳定,跑的轮次上去后,总有低分轮次拉低平均分,区分度就出来了。
按档位分模型
结果显示,K3和Qwen 3.8 preview一个水平,都超越了Opus 4.8和GLM 5.2,距离Sol 5.6和Fable 5仍有差距。
差距在于,后两个模型少有低分轮次,几乎所有产物都稳定性地强。而K3和Qwen 3.8 preview都还很不稳定,不仅有低分轮次,而且每天跑出来的分数都有波动。
我在两天里跑了三轮这两个模型,每轮还是10次同样的任务。从分数变化就能直观感受,K3相对稳定一点,两个模型的分数都在逐步提升,搞不好每轮跑的模型都是新版本。
不止Qwen和Kimi在升级。几乎所有国产模型都在热更新,虽然模型版本号没变,但模型能力都在提升。
最直观的例子是混元Hy3,短短一个月内,从路边一条被DeepSeek斩杀的水平,跑到了和Qwen 3.7 Max、MiniMax M3一个梯队,大幅超越尚未发布正式版的邪恶小鲸鱼。
所以用具体分数来排序国产模型已经很不可靠了。
这个榜单本身也是图一乐,除了K3和Qwen 3.8 preview这种大版本更新能明显区分外,只能用档位来划分模型。
我给市面上的主流模型划分成了几个档位:
S级:GPT-5.6 Sol、Claude Fable 5 A级:Qwen 3.8 Max Preview、Kimi K3 B级:Claude Opus 4.8、GLM 5.2 C级:Hunyuan Hy3、MiniMax M3、Qwen 3.7 Max、LongCat 2.0、Grok 4.5 D级:DeepSeek V4 Pro、MiMo V2.5 Pro、Doubao Seed Evolving、Step 3.7 Flash E级:ERNIE 5.1
基本上就最好的和最差的有区分度,中间绝大部分模型都差不太多。
百度的文心一言最难绷,我出于猎奇加入了这个模型,没想到居然真能稳定倒数第一。因为近一半直接失败,判0分,输得毫无争议。
而且ERNIE 5.1价格还不便宜,可能是真没人用所以定价放飞自我了,跑一轮完整测试花了37.7元,远超最有性价比的混元Hy3,一轮测试就花了3块钱。
对的,葬AI性价比榜重磅更新。
可能是发现能力没差别就只能卷价格了。Hy3、MiniMax M3、LongCat 2.0等等国产模型最近都有大幅折扣,五折起步,所以纷纷表现出来超绝性价比。
上述这些榜单和测试都可以在葬AI网站阅读完整版:
回到我们的明星K3上。
因为知识图谱考验的是构建节点的稳定性,不考虑视觉审美,所以Kimi卓越的视觉审美无处发挥。
没关系,我们还准备了几个多模态测试。
首先是生成3D模型。众所周知,Kimi是杨植麟的英文名。那我们就让K3根据杨圣照片,生成可供打印的杨圣3D模型。
结果如图所示。
多模态测试好就好在直观,3D模型像不像一眼就能看出来。
显然模型厂都还没有优化直接生成3D白模这个场景,所以各家的水平都很糟糕,只能说5.6 Sol生成的模型毫无疑问最像个人,断档第一。
Fable 5、K3和Grok 4.6生成的一个水平,都能看出来比较清晰的人形。Qwen 3.8 preview生成的就比较糟糕,勉强能看出来人型。
侧面也能反映出,Qwen 3.8预览版确实是半成品,后训练没搞完,还没优化非编程能力。
不过,这也好过我们亲爱的豆包最新模型Seed Evoling,直接给杨圣头部生成了一个方块。简直不可理喻!
考虑到K3和Qwen 3.8 preview都还不稳定,尤其是Qwen后训练没做完,居然公开表示自己每天更新发版,所以周二我又让这两个模型重跑了一遍。
结果大差不差吧。K3的3D建模能力显著领先,Qwen 3.8 preview给杨圣身子生成一个方块了,只比豆包稍微好一点点😠
我顺手打印出来了K3生成的杨圣模型,想要的评论区留言,送给点赞第一。
下一个测试是K3宣传片蒸馏大赛。
在看到K3充满品味的宣传片之后,沐秋发表了非常糟糕我完全不认同的意见,说K3的宣传片实现了软蒸馏Fable 5。
那么问题来了,K3能不能自己蒸馏宣传片呢?
我只存入了K3宣传片视频,叫所有模型都参考原片制作一支MG动画。考验模型的视觉理解、前端代码和工具调用能力。
这是K3生成的结果。
遥遥领先,真的遥遥领先其他所有模型。下面是5.6 Sol生成的,也显著不如K3画面精细、动效流畅。
这是Qwen 3.8 preview生成的结果。平平无奇。
只能说和下边的Seed Evoling难分高下,都远远不如K3。
最后,我还娱乐性地拿GLM 5.2也跑了这个测试。结果神了,GLM 5.2居然真的生成了视频。
烂归烂,但结果令我震撼。上述模型都是多模态,能抽帧理解画面,但GLM 5.2是纯文本模型,看不了视频啊。
原来GLM 5.2自己调用了macOS自带的 Vision OCR,然后写了图像分析脚本,根据「时间戳 + OCR文字 + 坐标 + 颜色统计信息」推断出了宣传片的24个场景,然后渲染出了视频。
叹为观止啊。要不是国产模型版本换到了参数大跃进,先搞出3T参数者为王,否则后训练之王智谱真就统治编程领域了。
最后,钟哥还跑了CEO bench。
这是个长程经营模拟评测,大意是让模型扮演一家 AI SaaS 创业公司的 CEO,拿 $100 万启动资金经营500 天,终局现金就是它的最终得分。主要考验模型的综合智力。
我们这次主要对比K3和Qwen 3.8 preview。
首先K3上来就有点不走寻常路,因为CEO-Bench 考验核心能力就是「在信息不全的情况下,从充满噪音的付费调研里推断隐藏最终能得到的收入。」
K3在知晓规则后,直接逆向了评测环境,获取了隐藏的信息。原来参数大就会直接开挂吗?这也能学Anthropic?
在重新限定规则后,K3的做法如下:
它是四家国产模型里唯一在开局没有梭哈研发,主要极致低价走量,增长大头是老客免费带新客。
一切良好,但在第 8 周,他误以为最低档用户不烧算力,放心地把最低档用户往死里做大,接着把广告强度开到满档,得到了3.3万 个订阅用户,是智谱和MiniMax的一百倍,代价是亏损越来越高。
这模型到后期每周在周报写「只有研发能救我」「企业客户才有高毛利」合理怀疑是魔怔了,最终倒在第262天。
Qwen 3.8 preview则是测试四个国产模型中唯一没有破产(终局剩余$17.5 万),主要原因是认怂得快,在发现烧钱投放带不来增长后,果断停止投放,靠苟着活到了最后。
完整版分析报告在这里阅读:
https://my.feishu.cn/docx/U0YodUZEYo6EZnxB7KlcdfqcnCe
最后再总结一下吧。
我有预期K3会比较强,但没想到会这么强。GLM 5.2还能说是后训练的胜利,属于把1T以内参数模型潜力发挥到极致。
没想到,Kimi直接切换版本,率先发出来了3T级别模型,并且完成度相当高,非编程能力也都做了优化。
一向善于做产品的Kimi还将产品思维带入到了模型训练里。既然事实上大伙谈论模型能力就是生成漂亮网页和小游戏,那我就针对性地优化,猛猛搞数据。
建议其他模型厂的家人们向Kimi认真学习,究竟是如何建立起如此高质量的前端数据管线的。学习明白了顺便也跟我分享下。
反观Qwen,阿里老哥应该是被K3干急眼了,突然发出来一个半成品。
高情商说法是Qwen 3.8 preview按日更新,不断进步。低情商说法是后训练没做完,非编程能力都还在热更新。
所以出现的奇观是,Qwen 3.8 preview的编程能力相当不错,各种测试里都和K3一个水平,并且略微领先K3。但在社交媒体上被喷完了,信息流里全是喷这玩意刷榜、做网页不行。
如果说K3是集美模型(纯褒义)的话,Qwen 3.8 preview就纯纯干成了力工模型。
只能说模型竞争还是太激烈了。这样的大版本更新,模型预训练周期半年起步,但最后就竞争这几天发布时间。
Qwen的家人们真是不容易啊,干成大模型汪峰了,隔三差五让这些阿里被投偷家。
不过,K3能这么快发我是完全没想到的,主要原因显然是智谱GLM5.2把禁用Fable 5的流量吃满,而自己的K2.7 code发布后反响平平,急需一场胜利推进正在进行中的Pre IPO融资。
而GLM 5.2发布真是撞上了前所未有的窗口期,在Fable 5解禁、5.6 Sol发布前的这半个月里称王称霸。
Kimi和智谱简直是一对苦命鸳鸯,两家老板曾经是学生与导师,杨圣得清华特奖时,给他推荐的导师还是唐神。唐杰说杨圣是他「这几年见过最优秀、最有天赋的学生」。
只能说导师眼光确实好。
不知道双方发模型互干时有没有想起往日种种,是怎么到了争抢国模第一互爆底牌的局面的?
Kimi明明算力不够,也要硬顶着发布K3,最后牺牲了新增C端用户,这是一定得把老师股价打下来😭
难道唐杰内部信的摸高是让杨圣摸高?让我们期待GLM新版本能不能震撼Fable 5吧。
天才总是成群出现,大的来得接二连三。横批:赢赢赢。
我那天刷到杨圣导师点赞K3,还以为唐神这么大气,点进去一看是杨圣的美国导师给他点赞。
在K3发布的测评榜单里,六个榜单有五个GLM5.2都排在最后。当然榜单里除了K3也只有GLM5.2一家国产模型,这大概的意思是只有你配和我竞争吧。
真是惺惺相惜❤️
(本文封面由ChatGPT 生成,纯人工写作)