速来网吧线下真实所有大模型

2026-08-14|沐秋|12 个实体|7 条关系

知识图谱摘要

提及实体 (12)
关系 (7)
正阳合作钟十六

两人共同推出懂模帝产品

Qoder集成懂模帝

建议使用Qoder作为构建懂模帝bench的Harness工具

千问办公集成懂模帝

建议使用千问办公作为构建懂模帝bench的Harness工具

Qwen相关懂模帝

Qwen赞助活动并设立Qwen选择奖以收录优质bench

梁圣就职DeepSeek

文中将梁圣与DeepSeek强关联,指代其商业化行为

正阳参与懂模帝

正阳参与推出了懂模帝产品

钟十六参与懂模帝

钟经纬参与推出了懂模帝产品

速来网吧线下真实所有大模型

2026年8月14日 沐秋 葬AI


最近,葬AI和我们的朋友钟经纬、正阳一起,推出了懂模帝这个产品,现在任何人都可以登陆 fuckai.md 去看各种各样的benchmark。

之所以推出这款产品,是因为我们判断 bench 这件事正在大众化。

过去大伙看模型,主要看模型厂发布会和公开榜单。

但现在一套大而全的榜单已经不够用了。大伙关心的是这个模型到底适不适合我的任务,在哪些场景稳定,在哪些场景会歇菜。

每个人都有自己的工作/生活场景,在他们的优势领域,就是拥有对每个模型能力的定义权。

中国人都能飞✈️

所以仅有AI应用公司参与还远远不够,我们希望找到更多有bench构建能力、重度使用Agent的人来狠狠地真实这波大模型公司。

于是,我们几个又想到了葬AI的祖传活动,网吧黑客松。

我在此宣布,第一届懂模帝Bench黑客松将在北京网吧举办。本次活动由Qwen和葬AI联合举办。

依旧30个小时,依旧泡面无限、依旧无烟。

唯一要可惜的是,由于网吧禁止未成年进入,我们可能要错失AI圈天才少年了😭

本场活动分为两大赛道:

第一个是有用赛道,你可以将你在生活和工作中,遇到的问题,拿来考考模型。

尤其是那些,你之前使用各家「吹的很猛」,但实际纯是一坨的场景。我们希望题目对模型越难越好。

可以是生活上的日程规划、待办整理、旅游攻略、租房寻找、炒股咨询;也可以是看板构建、数据分析、发票整理等等。

我们尤其期待游戏开发和视频剪辑的题目。

当然,如果你非常喜欢上班,你也可以着重测试模型在Coding(真实Bug修复、祖传代码考古改写、准备一座屎山代码看什么模型能解决等)、Cowork方面的专业能力。

第二个是整活赛道,你可以发挥自己的想象力,构建一些吸引人眼球的、好玩的评测集,来考察模型的底层能力。

比如,让Agent扮演一名北漂青年进行生存、玩《文明》或《相亲模拟器》、进行狼人杀或扑克比赛、进行Minecraft 雷电将军还原比赛等。

扮演北漂青年

让Agent玩文明

比赛环节有两个:

第一个环节是构建一个bench。bench由一定题目数量组成,并说明为什么有效、考验模型什么能力、评分标准是什么。

对这个比赛来说,质量远胜于数量,通常不需要超过15题。在特定类型和质量下,哪怕只有1题,也能获得很好高的得分。

这个bench,可以是一个让Agent当CEO经营公司的环境,或是进行某场游戏对局的工具,或是一些由程序和模型自动打分的题目。

第二个环节是跑bench。选手需要使用包括Claude Opus5、GPT5.6 Sol、Qwen3.8 Max、K3、Deepseek V4 Pro 在内的5个模型,跑自己做出来的评测集,并提交模型结果、分析报告和评分过程。

我们会有详细的操作指南给到你。

可以想见这两个环节都需要耗费大量的Token,而目前Token已经进入大涨价时代。

先不提Claude和GPT的原生价,连DeepSeek梁圣都化身牢梁开始收割了。咸鱼现在跑一次葬AI Bench就要花两千块。

这里就要感谢Qwen、Kimi的赞助支持了。

在构建bench场景,我们建议用Qoder和千问办公作为主力Harness,当然你爱用别的也行;

在跑bench环节中,他们也为每个选手提供了足额的API额度来测试特定模型。

如果你对如何构建bench一无所知,但有明确的工作场景希望进行测评,也非常欢迎参加我们的bench 黑客松。

Evolvent AI 是一家专业构建bench的数据公司,他们会在现场告诉大家该如何从0到1做出一款好bench。

真格基金和我们也为参赛选手准备了包括拓竹、大疆、影石在内的实用产品,并购买了一台Mac mini作为大奖。

Qwen还额外开设了Qwen选择奖,如果你的bench测到了Qwen内部评测都没覆盖到的能力盲区,可以获得Qwen提供的一台大疆无人机,还有机会被正式收录进Qwen官方测评集。

选手产生的优质 bench,我们也将在之后录入懂模帝精选推荐,并专门介绍传播。

除此以外,我们也在现场安排了学习环节,定向邀请 AI 应用团队、模型使用者、评测相关从业者来讲讲自己的 bench 是怎么构建的?为什么最后选择某个模型?哪些能力是公开榜单看不出来、但在真实业务里非常关键的。

我们尤其欢迎各位在校学生来参与本次活动,表现优异的朋友也许会在现场被「BOSS 直聘」。

本次活动注意事项:

1、网吧的机位有限,只能优先提供给选手,每位选手也建议自带电脑来,除非你的bench只跑国内模型。

2、为了防止又一次网吧里出现黑客把选手号盗了的情况,上机的每位选手必须自带身份证、离开网吧后必须挂机😭

如果你对我们的活动感兴趣,可以扫描海报上的二维码报名。

时间:8月22日12:00 至8月23日18:00

地点:北京市 报名通过后通知

活动名额先到先得,报满为止。通过Substack渠道报名有一定优先机会。

再次感谢Qwen、Kimi、真格基金、Evolvent AI对本次活动的大力支持。