悄咪咪发布、但在假期三天屠榜的 Space Bunny,到底是什么来头?
匿名模型 Space Bunny 在假期三天冲上 OpenRouter 与 OpenCode 调用量日榜第一,流量前五的应用全是 Coding Agent。作者实测后判断它速度快、能力优于 GLM-5.3 Flash,大概率出自中国厂商。

中秋假期第一天,大部分人还在高速上堵着,AI 圈子里又炸了:
一个叫 Space Bunny 的匿名模型,悄咪咪出现在 OpenRouter 和 OpenCode。然后三天之内,它冲上了双平台调用量日榜第一。
自从年初 Pony Alpha 开了匿名发布的先河,这种“匿名发布再认领”的玩法已经见怪不怪了,最近一次使用这种玩法的还是牛来模型。
不过,当我们看到数据的时候,还是被吓到了:
Space Bunny 从发布的第二天,就在 OpenCode 模型调用量第一,并且连续五天均保持领先。

OpenRouter 模型在一天的调用量,约等于 Deepseek v4.1 Flash 加上 GLM-5.3-Flash。并且流量前五的应用全部是 Coding Agent,Claude Code 等主流工具的开发者都在用它。

于是,这个炸裂的模型又引起了社区里一轮新的猜测:
有人开玩笑说这是 SpaceX 旗下的模型,毕竟名字里带个 Space。有人说这是 Kimi K3.1,理由是:bunny 是兔子,中秋节月亮上有兔子,月之暗面顺理成章。
还有人说这是 MiniMax 3.1,理由是上个月 MiniMax CEO 在月底的业绩会上确认 M3.1「已接近完成」,以及最近 MiniMax 确实推出了一个 preview 模型。
我们也带着这个好奇实测了一下这个模型,有些发现值得聊聊。
01 一线实测后,大家怎么说
在动手测试之前,我先去翻了一圈海外社区的反馈:Space Bunny,在 X 上的讨论热度很高。
@exploraX_ 让 Space Bunny 根据他的作品页链接做了一个作品集网站,几分钟就完成了,他说这是用过的最快的模型。

最夸张的是 @Nimesh,他用一句话让它在 Blender 里搭了一个赛车模型,精细度非常高。

由于它的速度过快,@Xudong07452910 认为它应该是 Flash 模型。

@BlockInsight214 认为新的模型体感上好于 MiMo2.6、Glm-5.3 Flash。

Raddit 上 @Writingarm 也发表了类似的看法:

总的来说,根据社区的反馈,目前大概能判断出的一些信息是:它的速度快,能力整体优于现在的斩杀线 Glm-5.3-Flash,适合当执行层,大概率是中国厂商推出的 Flash 模型。

带着这些预期,我开始自己上手实测。
02 模型能力实测
过中秋节,家里人打麻将五多一,由于牌技太菜,导致我只能帮他们端茶倒水、看他们玩。
我突然想到:能不能让 Space Bunny 帮我做一个 3D 自动麻将机的小程序,让我可以在电脑上玩一下子呢。
我是在 Claude Code 里接入了这个模型,我想想看看它在零上下文的情况下能做到什么程度,所以给的提示词只有一句话:“帮我手搓一个自动麻将机的 3D 小程序!”。
然后它反问了我三个问题和选项:做成什么形态?我选择本地 npm 工程;「自动」到哪一步?我选择自动牌桌物理 + 手动出牌;用哪套麻将规则?我选择国标麻将。
然后,它就开始自己设计、开发和测试,它的速度确实很快,直接选择了 Three.js 来做 3D 渲染,最后用不到 3000 行代码完成了整个程序:并且它一次运行就跑通了。
Space Bunny 在这类“从零开始搭建一个完整小应用”的场景上,确实表现出了很强的工程直觉:

令我震惊的是,它自动生成了麻将桌面、牌面纹理、发牌动画,甚至还做了一个自动托管功能。
这个效果真的没谁了,我都不知道 GPT-6 Astra 和 Opus5.5 能不能做出来…
接着,我想用它做一个快讯写作 Agent,最近 Manus 发布新品,人工编辑想要在短时间内把信息传达给读者,总是手忙脚乱,我们想要通过 Agent 辅助的方式,看能否快速输出对应的快讯内容。提示词如下:
帮我做一个可以一键完成内容的 agent:content-agent,就是给你一个输入,你可以生成一个专业的编辑出的稿子。你可以参考我的所有内容、工具:比如输入是这些:/Downloads/content 下面的视频内容,输出内容是这个目录下的参考文章:/Downloads/article 下面的视频内容
它参考了项目里各种 Agent 的最佳实践,还设计了独立的内容评审:

整个界面的 UI,甚至不输 Kimi3 的审美:

我拿最近 Manus 发布的最近宣传片做了个尝试,发现效果也很不错:
它不仅会调用本地的模型来解析 Manus 的宣传片文案,还能联网搜索 Manus 社媒上最新的图片:

然后生成一篇针对的快讯文章,效果十分不错:

接着测试接着舞,有了快讯写作 Agent,接下来我需要解决选题的问题:
每天发布那么多的产品和模型,如何判断哪个产品值得写呢?
我想到了参考几百位同行发布的内容(排名不分先后):根据大家账号的影响力和发布内容的属性以及时间,看看哪些模型或者产品热议的多。

说干就干,这次,我给到它的提示词更复杂了一些:
帮我做一个前端程序,我想做一个大模型热度榜,根据这几十个影响力最高的 AI 公众号和他们对于某些大模型的文章撰写,根据一定的算法、语义分析来计算大模型或者产品的热度,并进行前端界面的排序。需要进行监控的清单是:accounts.txt,可以使用的大模型:https://openrouter.ai/api的stealth/space-bunny-alpha,key是这个:sk-or-v1-…b46d786
我拿一个月前大家发布的内容做了下回归测试,发现效果很棒:

为了更客观地评估它的能力边界,我拉了几个同级别的 Flash 模型做了一组横评。
我选的是最近最热门的几款模型,DeepSeek V4.1 Flash、Qwen3.8 Flash 和 GLM-5.3 Flash,测试内容是同一个 3D 场景的生成:桃花源记。
结果很有意思:
DeepSeek V4.1 Flash 做的有点抽象派,整体还是美的:

GLM-5.3 Flash 的精深做的很好看,但水面倒影不符合逻辑,生成速度明显慢了一截。

Qwen3.8 Flash 的效果中规中矩。

Space Bunny 则做出了一个世外桃源的感觉,樱花飞舞,栩栩如生:
从体感上说,Space Bunny 和 GLM-5.3 二者的审美比较接近,而 Space Bunny 在速度上的优势非常明显。
同样的任务,它的首字延迟大概在 400 毫秒左右,输出吞吐稳定在 90 token/秒以上。
03 为什么最近每家都在做 Flash 模型
过去两个月,几乎每家大模型公司都在密集发布 Flash 版本:
DeepSeek 出了 V4.1 Flash,智谱出了 GLM-5.3 Flash,阿里出了 Qwen3.8 Flash,现在又多了一个 Space Bunny。
从技术原理上说,Flash 模型通常是在完整模型基础上做了蒸馏或者参数裁剪,保留核心能力的同时大幅降低推理成本。
各家的策略很一致:用旗舰模型提供天花板级别的能力,用 Flash 模型提供更快的速度、更低的价格、更高的吞吐量。
而在测试 Space Bunny 过程中,我最大的感触其实是深刻感受到:Flash 模型这个品类正在发生质变。
以前 Flash 版本和完整版本之间可能差一个档次,现在这个差距在很多实用场景里已经感知不到了:
Space Bunny 就是一个典型的例子。
对于编程和日常工作中 95% 的场景,其实根本不需要旗舰模型,Space Bunny 可以秒杀日常的编程任务。它在编码场景下的表现甚至已经非常接近旗舰级模型。
而速度和成本优势又让它在代理工作流里更受欢迎:多个独立测试显示,Space Bunny 的流式吞吐在 74 到 94 token/秒之间,首字延迟最低可以做到 380 毫秒。这个数据放在 Flash 模型里也是第一梯队的水平。
对于 Claude Code 这些工具来说,它们需要的不仅仅是一个「最聪明」的模型,更是一个「快速」的模型,而 Space Bunny 恰好满足了这两点,唯一不能确定的就是价格。
如果 Space Bunny 可以做到 GLM-5.3-flash 的价格,那么我将单方面宣布: Space Bunny 你是我的神。
04 如何根据匿名模型推断发布方?
聊完能力,让我们回到最有悬念的问题:Space Bunny 到底是谁家的?
社区里推断匿名模型身份已经形成了一套比较成熟的方法论。
简单说有几个主要方式。
第一个是分词器指纹比对。不同厂商的分词器在词表设计和合并规则上存在系统性差异,同一段文本在不同分词器下会被切成不同数量的 token。通过构造一组精心设计的探针文本,比对匿名模型和已知模型的 token 计数,就能判断它们是否共用同一个分词器家族。
第二个是 API 服务层痕迹。不同厂商的 API 网关在错误消息格式、参数校验逻辑上都有自己的习惯。比如之前 Ox Alpha(后来被确认为智谱 GLM-5.3 Flash)就是因为返回了一条格式很像智谱风格的错误信息而暴露的。
第三个是行为指纹。让模型回答一些特定问题,比如「随机选一个 1 到 100 之间的数字」,不同模型因为训练数据的偏差会表现出不同的分布特征。这个方法成本极低,大概 200 个请求就能完成一次完整的指纹采集。
第四个是模型分类器:这个方式最简单粗暴,训练一个单独的模型,输入是文本,输出是模型厂商的分类。准确度有 80%-90% 左右。
那 Space Bunny 的指纹具体指向谁呢?
独立研究者用 stealthprint 工具包做了一组端到端的取证:在 24 组探针文本上,Space Bunny 的 token 计数与 MiniMax 词汇表 24/24 完全匹配,同批次测试中,Kimi 只匹配了 13/24,GLM 更是只有 7/24。
另外两组独立研究者分别从文本分词器和视觉分词器两个维度做了验证,结论一致:都指向 MiniMax。
MiniMax M3 本身就是一个 4280 亿总参数、230 亿激活参数的 MoE 模型。如果 M3.1 Flash 能在编码场景上做到接近旗舰级的水平,同时速度快到 90+ token/秒,那它的性价比会非常恐怖。
等免费预览期结束、正式定价公布之后,它很可能会给 Flash 模型赛道带来一条新的斩杀线:
使用 Claude Code + Space Bunny,相当于人人都以极低的成本雇了一个五年经验的超级程序员。
我们正在进入 Flash 模型带来的新时代。
在我眼里,这样的时代,才是真正的 AGI。
Space Bunny 目前在 OpenRouter 和 OpenCode 上都可以免费使用。
按照之前 Ox Alpha 的经验,从匿名上线到官方揭晓通常是一到两周的时间,因此免费期应该还会持续几天,建议大家国庆节可以深度体验一下这个模型的快乐!
内容编辑丨特工小师 特工小天 内容审核丨特工少女
本文由人人都是产品经理作者【特工宇宙】,微信公众号:【特工宇宙】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自作者提供

起点课堂会员权益





调用量屠榜当然猛,但流量前五全是 Coding Agent,也可能有免费和匿名尝鲜的加成。开发者对新鲜模型本来就爱扎堆,短期调用量高不等于长期留存好。真正能说明问题的是免费期结束后,还有多少 Claude Code 用户愿意把它留在默认配置里。