整个AI圈都在斩杀,Qwen却算了一笔长期账

0 评论 430 浏览 0 收藏 16 分钟

英伟达把"每一美元能买多少智能"立成行业新尺子,千问一个月四次迭代交卷。Qwen3.8-Flash 提前放出为 Qwen4 准备的 Next 架构,把下一代地基交给开源社区先跑,友商却锁在发布会前。这场长期账,算的是架构开放与生态耐心。

上个月,英伟达发了篇论文,提了个概念,intelligence per dollar,每一美元能买到多少智能。

以前行业比谁脑子大、参数多,往后得比每一美元买到多少智能;这个尺子立起来刚一个月,千问就把答案交了。

模型迭代的节奏也确实变了,以前几个月憋一个重磅,现在几乎每天来一波。

不信你看 Qwen3.8,8 月 3 日 Max,12 日开放权重,14 日 27B 开源,昨晚 Flash,一个月四次,消息一个接一个,多得有点看不过来。

这也不只是 Qwen 一家在赶。

最近模型厂商都卷起了轻量便宜的 Flash 模型,先是 DeepSeek 给 V4 Flash 加上了多模态,紧接着这周,智谱和 Qwen 前后脚扔出了 GLM-5.3-Flash 和 Qwen3.8-Flash。

大伙儿都在想办法,用更少的钱把前沿模型的能力打下来,不过Qwen这次新模型,最值钱的是它把架构换了。

Qwen3.8-Flash 是 Qwen4 的雏形,阿里把下一代的地基提前扒出来,扔给全球开源社区先跑一遍;友商把下一代架构锁在保险柜里等发布会,它反手公开。

那Qwen到底凭什么敢这么做呢?

我认为,地基这东西平时没人注意,可它决定楼能盖多高。Qwen这次动的,就是地基。

这块地基叫 Next 架构,专门为 Qwen4 准备,先拿到 Flash 上试跑;最直接的一个数字,总参数 125B,每跑一步只激活 6B。

这什么概念呢?我举个例子:

一家 125 人的公司,每天只有 6 个人上班,业绩干翻了千人大厂,人力成本只有人家的零头;以前比人多,现在比人少。

新旧地基的差距,全在这个效率差里。

过去几年,大家几乎全在用 MOE 架构,长在一棵树上,改来改去只能修修边幅。

Qwen 把树给换了,改枝叶的公司还在比谁的叶子多,换树的公司已经在新树杈上结果了。这么说够清晰吧?

架构要动,就得动在最贵的地方,我翻了翻技术报告,这次技术动作有三处。

第一点,注意力。

老架构读长文章,前面读过的内容得重新翻一遍,越长越费劲,新架构把两种新机制叠在一起,一种把历史压成固定大小的状态,读再长也不膨胀;另一种按重要程度挑着读,该细看的细看,该扫过的扫过。

1M tokens 的长场景,处理速度最快能到 8 倍上下。你想想,这差不多是整部《三体》三部曲的体量。

这种量级的材料,人得啃好几天。一个律师把整本卷宗丢进去,模型从头读到尾,重点一个不落。

Agent 场景天天跟长文本打交道,上下文越长,老架构越贵,这一处动下去,省下的都是真金白银。长文本从奢侈品变成日用品,Agent 时代才起得来。

第二点,信息通道。

老架构里,信息在模型内部只有一条主路,所有知识挤在一起过,新架构把一条主路拆成四条,读写各走各的,堵车少了,训练也更稳。

第三点,记忆。

模型记东西靠参数硬背,参数越多越贵,Qwen 在模型边上挂了一张 51B 的「速查手册」,答案查表就能找到,平时不占计算,要用时一翻就有。

别人靠死记硬背,它随身带工具书。

好,三点动完,账本就变了,训练花的钱,只有上一代 Qwen3.7-Plus 的九分之一;官方口径是成本降了近 90%,按九分之一记更直观。

这代模型跟市面其他模型,差别就在这;别人卷参数,在旧楼上加层,它省成本,直接在地基上重新盖。

……

重新盖到底能省多少钱?我把账本儿摊开给你看看:

现在每百万 Tokens 输入 0.8 元,输出 2.7 元;Claude 的 Opus 系列旗舰,从 4.6 到刚发布的 Opus 5,都是 5 美元和 25 美元,Qwen3.8-Flash 连它的 3% 都不到。

看到这,大部分人都会认为真便宜。

不过别着急,这年头便宜模型多了去了,便宜还能打的,不多。能不能打,全看智能。

我看了下,SWE-bench Pro 62.5 分,比 Opus4.6 高出 9.1 分,编程这一关不光没缩水,还反超了;而且 Flash 不止编程能打,多模态也站在第一梯队。

模拟手机操作的 AndroidWorld 评测,它比 Opus4.6 高出 22.5 分。手机上的智能体,一边看屏幕一边操作,这最像 Agent 的干活方式。

聪明没输,价格差出 30 多倍,这才叫斩杀线。

斩杀线这词的意思,性能比你强、价格还比你低,直接把你的生存空间划走。

背景我再提一句。

DeepSeek 8 月 17 日刚调完价,V4-Flash 忙时输出涨到 9 元。千问输出 2.7 元,正好是它忙时价格的三分之一。

别人刚涨完,它反手把线又压下去一截,斩杀线这东西,一天之内又往下挪了一格。

对了,同一天晚上,智谱的 Flash 也发了,参数比 Qwen 大一倍,320B 对 125B,价格却贴着打。

参数大这么多还卖同一个价,这笔账算下来是亏的;算力家底也没这么厚,这个价据说是限时两周。

Qwen 这边不一样,阿里云自己养着算力,0.8 元、2.7 元是长期价。同样斩杀线,一个拿补贴,一个拿家底;谁划得久,比谁划得低更值得看。

img

我担心你对数字不敏感,换个场景就更直观了。

说真的,做一次 PPT,从资料搜集到排版调整,背后要触发几十次模型调用;按一次任务五十次调用、每次几千 token 算,用 Opus,这一单下来好几美元。用 Flash,几毛钱,甚至几分钱。

同样的活,成本差了四十倍,一个 AI 助手根本用不起的场景,便宜到能当日常消耗品,这就是把 3% 换成人民币之后的样子。

这还是按最费钱的场景算的账,实际跑起来,缓存命中的价才 0.1 元,还能更省;这个价差长期挂着,不是促销,你的应用每跑一次,成本都是别人的零头。

AI 应用的人心里都有本账,这个差距是生存问题。

这笔便宜,最大的赢家是 Agent。Agent 干活和聊天不一样,一项任务背后几十次调用,调用越多,对单价越敏感。

而且,性能趋同之后,模型要落地到各行各业,绕不开 Agent 这一层。

Agent 在模型和真实任务之间搬货,搬运工最怕运费太贵,这两年各家模型能力拉不开差距,Agent 是模型走到真实任务面前的最后一公里。

我今天早上打开千问办公时,发现Qwen3.8-Flash已经接入了,讲真的,日常那些活儿,这一款模型就够了。

img

企业为任务付费,模型和Agent 搭着卖,这笔账就通了;当然,直接接 API 按 token 算账的开发者也有,两条路都有人走。

打包了 Agent,企业就多了一个选择,按任务付钱。

算一笔企业的账。

一份行业研报,外包团队做,几万块起步,要等一周;带着 Agent 做,几小时出初稿,成本是零头。企业只关心活干没干完。

Token 的成本,被 Agent 打包进了任务价里,这就是模型和 Agent 绑在一起卖的底气。

今天查资料,我还翻到一份有意思的实测:

杰富瑞,华尔街的投行,拿八款主流 Agent 真刀真枪跑了一遍办公任务,千问办公综合得分第一,所有维度里唯一一个都上 90 分的。

能用又便宜,Agent 才敢放开手脚用。便宜这步棋的落点很清楚,让 Agent 把模型当日常消耗品。

……

价格是入场券,开源才是重头戏。

昨天晚上 11 点,Flash-Next 的权重在 Hugging Face 和魔搭同步放出,还带一个 FP8 量化版,开发者和企业当场就能拿。

SGLang 第一时间给了 Day 0 支持,vLLM、Transformers、TokenSpeed 全部配好,开发者拿到权重就能跑,不用等适配。

讲真的,开源见得多了,开源到自己还没正式发布、就让全行业先把工具链铺好的,少见。

这个动作的潜在动机很清晰,等 Qwen4 正式落地那天,工具链已经在上面跑顺了,不需要任何人重新学。

推理框架就那么几家主流的,谁的架构先被接进来,谁就先一步进了开发者的生产环境,Day 0 支持,不用我说了吧,这是抢滩。

Qwen3.8-Flash 发布后,我看 X 上有不少开发者火速跑起来了。

有个叫 Alexey 的用户,他一句话让 Qwen3.8-Flash 做了一个射击游戏,回车之后人就走了,几个小时后回来翻日志,发现模型在自动截图、看自己游戏的画面、发现不对就回去改,全程没人盯着。

一个 prompt,五个多小时,自己把游戏做完了,拿到权重的人,就这么玩。

img

过去半年,Qwen 家族全球下载超 30 亿次,衍生模型 30 万个;同期 Google 的开源家族 4.18 亿,Meta 2.27 亿,不是一个量级。

OpenRouter 上中国模型的调用占比,一年前 11%,现在 46.4%,全球模型调用快一半是中国模型在处理。

Qwen 在开源这件事上的家底就摆在这,全球开源第一梯队的位置是实打实的,中国厂商已经从参与者,变成了规则制定者之一。

这时候会有人嘀咕:

开源做这么大,图什么?权重都放出去了,别人拿去改一版更好的,用户凭什么留在你这里?

好问题,这个说法有一定的道理,不过漏了一件事,适配本身就要成本;对开发者来说,换模型是搬家,框架要重新适配,量化也要重新做,线上的验证都得重新跑一遍。

这一整套下来,不是一两天能解决的。

大厂换模型更要排期,生产环境里跑着的东西,不是说换就换的,适配得越深,离开的成本越高,生态先手最实在的地方,就在这。

Qwen 这边,生态本身就扎得深。

阿里云上的 AI 收入,今年一季度 89.71 亿,占外部客户收入三成,年底 ARR 奔着 300 亿去,模型开源是引流,算力才是生意,这套生意,跑得通。

可引流也不是做慈善,线画在哪,千问模型团队心里门清。

Flash-Next 的权重放出来了,自己用、自己部署,随便折腾;可要想拿它当生意做,把模型包成服务往外卖,那就得坐下来,单独找阿里谈。

这个风向不止千问一家,摩根士丹利 8 月的研报就提过:开源授权正从宽松往收紧走,大厂都在给商用划边界。

开源免费,免费不是无界的,许可这事,正在悄悄收紧。

苹果那边,千问已经拿下国行 Apple Intelligence,双方联合训练的专属模型也在路上,这是国内的一条线。

海外那边,QwenWork 也在公测,接Slack、Notion 这些,内外两条线一起铺,这种生态终端入口,不是花钱能买到的。

所以,回到开头那个问题,都在卷模型,千问凭什么?

我认为,当模型便宜到不再是约束条件,决定胜负的是谁让生态先跑起来。先跑起来的那个,把路先占了,后面人再追,成本完全不一样。

Qwen4 还在路上,具体时间我还没拿到,但这步棋的意图已经很明确,它把底牌提前掀了出来,接下来就看谁来跟。

数据参考:

[1].模型参数、性能与成本数据来自Qwen3.8-Flash技术报告;定价来自千问与 Anthropic 官网;生态数据来自 Hugging Face《State of Open Models》与 OpenRouter 平台

本文由人人都是产品经理作者【王智远】,微信公众号:【王智远】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!