本文基于 WorkBuddy 模型面板里新出现的匿名模型 Space-Bunny 做一次技术向观察。它倍率 0.03x、正在限时折扣,上线十天登顶全球调用量榜首,却至今无人认领。我们按「背景、问题、实操、结论」的顺序,把它的数据、身份猜测、实测口碑和正确用法拆开讲清楚,重点落在「模型选型是一道算术题」这件事上。
背景
这两天我打开 WorkBuddy,模型面板里多了一个名字,Space-Bunny。标着「限时折扣」,倍率 0.03x。它自我介绍那一栏写的是「匿名」,没有发布会,没有技术报告,没有跑分海报。
9 月 23 日上线那天,OpenRouter 上就这么挂着,价格是零。然后三天之后,它登顶了。
9 月 27 号单日,它在 OpenRouter 上被调用了约 3.99 万亿 token,在 OpenCode 上约 8.3 万亿,两个平台同时第一。到 10 月 2 号,OpenRouter 周榜上它以 33.5 万亿排第一,把 DeepSeek V4.1 Flash、腾讯自家的 Hy4 preview、GPT-5.6 Luna 全压在身后。一周之前它还是个查不到的东西。
为什么这件事值得写,得先说倍率表。9 月底我给一帮特教老师上线下课讲选模型,把倍率一个个念过。
| 模型 | 倍率 | 我的称呼 |
|---|---|---|
| 混元 3 | 0 | 初中生 |
| DeepSeek V4.1 Flash | 0.03 | 大学生 |
| GLM 5.3 Flash | 0.06 | 大学生 |
| Kimi K3 | 1.62 | 教授 |
那堂课我还强调了一句,千万别用自动,自动消耗积分厉害。然后 10 月 2 日,我的面板里多了 0.03 这一档,它旁边还有另一个 0.03。
不是最便宜那一档独享便宜,是最便宜那一档,开始有并列了。
0.03 和 1.62 之间差了 54 倍。这个数字决定你一天跟 AI 说话要花多少钱。这不是一个「哪个模型更强」的问题,这是一个「你打算让 AI 干多重的活」的问题。
问题
它到底是谁家的
这个我不敢下结论。四种说法我全摆出来,你自己判断。
线索最多的是分词器。有人拿 50 组字符串比对切分结果,说它跟 MiniMax 家族完全吻合,其他厂商一个都对不上;有人用中文问它是谁家的,它自称 MiniMax;還有人在 MiniMax 开源仓库里提前五天翻到 M3.1 的配置,1M 上下文、三档推理,全对得上,9 月 28 号官方上线的 M3.1-Flash-Preview 规格也能对上。
第二种更浪漫。名字里有「太空」又有「兔子」,还赶上中秋,有人说这是月之暗面。
第三种,腾讯混元。有网友猜是 Hy4 正式版,也有人反驳,说腾讯以前都是直接上,没这个躲躲藏藏的习惯。
第四种纯粹开玩笑。太空加兔子,有人说是不是 SpaceX。
这四种我一个都不排除,也一个都不认定,因为截至今天没有任何一方认领。
上一个这么干的我有印象。8 月有个叫 Ox Alpha 的,免费六天,8 月 26 日揭晓是智谱的 GLM-5.3-Flash,然后立刻转收费。剧本有先例,先匿名免费跑真实数据,跑量够了再公布身份,然后收钱。
好话差话都得说
有测评博主出九道题对比同档快模型,评价是「速度挺快,交付可以,长程调度也还不错」;有人丢给它四个活儿同时布置,第一轮全跑通。
差话同样真实。有博主在 OpenCode 上测六道题,指令遵循、SVG 动画、浏览器里的操作系统、3D 赛车、Trello 看板,道道差评。最扎心一条是中文提的需求,交出来是英文界面。还有人说这几天升级之后它不太好用了。
同一道游戏题,它跑完 1 分 51 秒,同档另一个 4 分钟。快是真快,但快出来的是基础版,页面完整性不如那一个。工具调用错误率 3.45%。
所以我的判断是,它是一个合格的「底座」,还不是一个合格的「交付器」。
对一个上线才十天的模型,这评价已经不低了。
实操
规格与怎么找到它
规格先看明白。上下文 1M,能一次塞进一整个代码仓库加一堆文档。能读文字、图片、视频,但只输出文字,它不生成图。思考强度五档,默认就是开的。
你把这几个数字连起来读,它的人设就出来了,一个跑得很快、读得很多、但只肯动嘴不伸手的家伙。
找它有个坑最容易卡住。我看到好几个人问「我面板里怎么没有」。官方文档写得很清楚,任务的第一句话发出去之后,模型选择才会显现。所以你在空着的输入框里翻下拉列表是翻不到的。
更新到最新版,新建一个任务随便发一句话,然后点输入框里那个模型名,比如默认的 Auto,面板弹出来找到 Space-Bunny,看到「限时折扣」选它,再把思考强度拉到极致。
验证点是这句,卡片描述行写着「推理速度极快,编码能力强劲,并支持原生多模态输入的匿名大模型」,下面一行是「10月2日-10月7日,享限时折扣」。看到这个就对了。压根没有这个条目的话,先确认你用的是云上模式,模型选择目前只支持云上。
四组可直接抄的提示词
我教了 13 年 AI,见过太多人打开对话框就问「你好」,然后怪它答得不好。它不知道你要干什么,当然只能瞎答。这三句我反复在用,可以直抄。
派活模板,写清楚这活儿给谁干、做成什么样、什么算完成。
我要你帮我做一件事,先别动手
这件事是,给我们县城的五家门店做一个能用的点单小程序
我要的结果是,选菜、选数量、下单这三步能在手机上走通
做完你自己检查一遍,卡住的地方直接告诉我,不要假装能用
它大概率会反问你一堆东西,门店收不收费、配送多远、要不要能改价。你照实答,它反问是在替你把需求想细,这一步别跳。
修改模板,不满意的时候特别好用。
第一版整体能用,但有两个地方要改
一是价格不能写死,我要能随时自己改
二是别给我加我没提的功能,我只要这三个功能
改完把改了什么列成三条给我
「别给我加我没提的功能」,对这种便宜快的模型特别重要。它输出是克制的,但任务描述一模糊它就自己发挥。
喂长文档模板,1M 上下文的意思不是「它会记住你所有的话」,是「你一次能塞很多」。
我等下发给你一份材料,你先别总结
先把跟我业务有关的判断、和不相关的部分分开列
只列判断,每条后面标出在第几页
你塞三百页不告诉它要什么,它就给你三百页摘要。你要的是清单。
界面纠错模板,我第一次派活也遇到过页面出来是英文的,补一句就行。
界面全部改成中文,现在
所有你自己加的、你没经过我确认的内容,全部删掉
把改动列成清单给我看
这句「删掉你没经过我确认的内容」,是我现在派活必加的。
派活清单
哪些活该派给它,哪些不该,这比上面所有操作都重要。
该派三类。重复性、要跑很多遍的活,批量改名整理改格式,跑十遍的成本可能比跑一遍旗舰模型还低。图和视频变成能跑的东西,有人丢给它一张手绘草图,不到五分钟拿到能转能点的 3D 网页,有人喂一段游戏录屏,它复刻出飞船、风暴和音效,画面都是它写的代码跑出来的。长文档结构化整理,一整本书转成知识图谱,它还能区分哪些是原文明确的、哪些是它推断的。
不该派三类。需要交付完整成品的活,人工补的活往往比省下的钱多。涉密的东西,合同、客户资料、没公开的代码、员工信息,一个都别丢。无人值守的自动化,工具调用错误率 3.45%,聊天时你感觉不到,跑长流程就是每二十多次错一次。
结论
9 月 28 号,一位温州制造业老板给我打电话。他开口第一句不是「AI 有什么用」,是「你现在用的是哪些产品、什么模型?」我意识到,老板对 AI 的兴趣正在从「这东西能不能用」转到「这东西我该用哪个」。
过去两年我们学 AI,学的是「怎么让 AI 干活」。接下来要学的是「怎么给一群 AI 派活」。你手上有五六个模型,性能不一样、价格差几十倍、任务还不一样,这跟你带团队是一回事,你不会让同一个实习生既写代码又写文案还跟客户吵架。
一个来路不明、没人认领、正在打折的模型,你敢把活派给它吗。我的答案是敢,但只派公开的活。打活动的模型就是临时工,不是你的基础设施。
它在 WorkBuddy 上的折扣到 10 月 7 日,OpenRouter 的免费入口 10 月 5 号就关了。8 月那个模型也是这么干的,免费六天,揭晓身份是另一家的,然后转收费。
趁现在,把你手上一直拖着的活,挑一件不敏感的扔给它跑一遍。别光看别人晒的 demo,你自己跑一遍更实在。倍率差 54 倍,任务类型不同,最优解就不同。模型选型的本质,不是找到最强的那个,是找到「这个活最划算的那个」。
想,全是问题。干,就对了。