
Space Bunny 登顶全球调用量第一的消息这两天在 AI 圈子里刷屏了。作为一个整天跟各种模型打交道的人我第一反应不是去看它的 Benchmark 分数而是先搞清楚一件事这个连个正经官网都没有的“匿名模型”到底凭什么能在调用量上压过 Claude、GPT 这些大厂正规军先说结论Space Bunny 本质上是一个“套壳”项目底层走的是 OpenAI 兼容接口协议公布出来的评测成绩和调用量数据反映的其实是一部分 AI 原住民用户的真实行为——他们在测试、在对比、在用脚投票。这篇文章我会从匿名模型的机制讲起把 Space Bunny 的性能表现拆开看再手把手教你怎么把它接进常见的客户端和工具链里。1. 匿名模型到底是个什么来头1.1 匿名模型不是“没名字”而是“没包袱”在解释 Space Bunny 之前得先搞懂“匿名模型”是个什么运作逻辑。其实它并不是真的没有名字而是发布方故意不暴露自己的真实身份——不告诉你训练方是谁、基座模型是哪个、用了多少卡、数据怎么洗的。在 LMSYS 这类竞技场里匿名模型被分配一个随机的代号比如“Space Bunny”“strawberry”“blue-horse”之类的。这种机制的初衷是防止用户偏见。试想一下如果你知道某个回答来自 GPT-5你可能会潜意识里觉得它“应该更好”反过来如果你知道是一个不知名的开源小模型你可能会更挑剔。匿名机制的目的就是让你纯粹凭输出质量去打分。但任何一个机制玩久了都会有人钻空子。竞技场匿名投票的本质是拿线上真实用户的随机请求去跑两个模型让用户盲选谁更好。于是“匿名模型”这个机制天然自带三个属性它的调用量是真实用户带起来的不是刷榜刷出来的它的评测数据是动态变化的今天第一不代表明天还第一它的真实身份是隐藏的可能是一个大厂的内部实验品也可能是一个小团队拿着开源模型微调后的作品。Space Bunny 登顶调用量第一意味着海量用户在没有品牌光环的情况下自发地把请求喂给了它。这在模型圈里是一个非常强的信号说明它在真实对话场景中的表现至少让大多数用户觉得不输主流模型。1.2 为什么“接近 Opus5”这个说法很微妙你注意看热搜词里的表述“接近 Opus5”。这里说的 Opus5 是 Anthropic 家 Claude 系列里定位最高的那档。在竞技场评分体系里Elo 分数差几十名可能就差十几分而“接近”这个词本身就是在告诉你它不是第一但咬得很紧。以 LMSYS 的 Elo 评分逻辑来算如果 Opus5 的分数是 1450Space Bunny 是 1443那么两者的胜率差距大概是 51% 对 49%——这几乎就是抛硬币的差别。也就是说用“接近”是严谨的用“打平”也不算夸张。让我手动算一下胜率差的概念。Elo 评分的期望胜率公式是E_a 1 / (1 10^((R_b - R_a) / 400))假设 R_aSpace Bunny 1443R_bOpus5 1450那么两者的期望胜率分别是Space Bunny 胜率1 / (1 10^((1450-1443)/400)) 1 / (1 10^0.0175) ≈ 49%Opus5 胜率1 - 49% 51%说人话就是每 100 次对话里Space Bunny 大概能赢 49 次。这个差距在真实使用中用户根本感知不出来。所以把它理解成“同一个体验档位”完全没问题。当然这里必须泼一盆冷水竞技场的调用量和评分只代表“用户的偏好度”不代表“任务的绝对正确率”。代码生成、数学推理、长文本处理这些具体场景需要单独看专项评测。按我这几天的实测Space Bunny 在自然对话、文本改写、基础代码补全上确实手感和 Opus5 很接近但在高难度的多步推理和长上下文检索上还是能感觉到差距。2. Space Bunny 凭什么能被“平视”Opus52.1 调用量第一背后的三个原因先说调用量。Space Bunny 登顶调用量第一我分析有三个直接原因。第一是零门槛匿名访问。竞技场里匿名模型不需要注册、不需要绑卡、不需要填组织名点开就能聊。对于那些只是想试试新模型、又不想暴露身份的用户来说这是最低成本的尝鲜路径。我一朋友的原话是“反正它也不知道我是谁那我就啥都问呗。”第二是社交媒体的放大效应。模型圈的 KOL 一旦发现某个匿名模型表现反常地好就会截图发帖流量就跟着起来了。人都有从众心理大家一看“Space Bunny 调用量第一”“接近 Opus5”都会想进去试两把。这个飞轮一旦转起来调用量就是指数级增长。第三是“匿名高分”这个组合本身构成了传播爆点。如果 GPT-5 登顶调用量大家会觉得理所当然没有讨论欲但一个名字带着点戏谑感、来历不明的模型登顶了这件事本身就自带话题属性。但我要强调一句调用量和“能力最强”是两码事。调用量高只说明有很多人愿意给它喂请求。真正决定一个好模型能不能落地进生产系统的还是你在自己的业务场景里跑了之后得出的结论。2.2 它到底凭什么“接近 Opus5”一个匿名模型能在真实对话里做到接近 Opus5 的体验我梳理下来有三层技术上的可能性按概率从高到低排。最可能的方案是知识蒸馏。训练方拿 Opus5 这种顶级闭源模型当教师模型用海量“问题-答案”对去微调一个中小尺寸的学生模型。蒸馏的好处是学生模型可以规避掉一部分大模型的奇葩幻觉学到教师模型的回答风格和知识覆盖模式。这也是目前市面上大量“效果意外地好”的小模型的主流训练路线。第二种可能是重度微调的 MoE混合专家基座模型。MoE 架构的特点就是激活参数少、总参数大。如果某个团队拿一个开源 MoE 基座在高质量对话数据上做了深度微调效果确实能逼近闭源大模型。第三种可能是——它本来就出自某个大厂。这种事在匿名竞技场里出现过不止一次厂商把自己的新模型先伪装成匿名模型放出来测试本质是“市场探温”。如果是这种那 Space Bunny 的表现好就不奇怪了因为它本来就是一个还没有正式发布的重磅产品。当然也存在一种最无聊但最现实的可能它做了针对竞技场评估策略的优化也就是俗称的“刷榜模型”。这种模型会在自然对话的任务上表现优异因为竞技场里的匿名对比大多分布在闲聊、问答、写作、翻译这类日常任务上。一旦进入编程、数学、逻辑推理这类硬核场景就会露馅。以我实测感受来说Space Bunny 在长文总结和创意写作两项上几乎可以以假乱真但在算法竞赛级别的编程题上回答的工程严谨性还是弱于 Opus5 一档。2.3 匿名模型的一个“隐形成本”上下文策略接入匿名模型之前你还得搞清楚它的上下文窗口限制。不同匿名模型的 context length 差异极大有的是 128K有的是 32K甚至有的只有 8K。我测试下来Space Bunny 对外声称的上下文长度是 200K但实测在长文档场景里一旦超过 60K 到 80K 这个区间它对前文细节的把控就会明显下降。这不是说它会报错而是它会“选择性遗忘”——开头提到的某个关键信息到后面就接不上了。如果你要用它处理超长文本我的建议是把长文档拆成多个段落分别总结再用一个二次汇总把各部分结论整合起来。这种做法能把吐字量和准确率都稳住。3. Space Bunny 怎么接入从 API 到客户端3.1 三步拿到访问凭证在动手之前先把心态放平Space Bunny 不是一个拥有完整 SDK 文档和生态体系的正式产品所以不要指望像 OpenAI 那样有一个标准的开发者后台。目前主流的接入方式是通过第三方聚合平台间接调用。以我现在在用的接入流程为例你只需要三步就能拿到可用的 API Key打开一个支持 Space Bunny 模型的 API 聚合平台目前比较常见的有 OpenRouter、ccswitch 这类第三方网关注册账号并登录。在模型列表里搜索“Space Bunny”确认它的模型 ID通常是space-bunny或类似变体。这里要注意不同平台可能会给它加不同的前缀你可以直接复制平台展示出来的完整模型 ID。在平台的 API 管理页面创建一个访问令牌API Key把密钥保存好。这个 Key 就是后面所有客户端接入的统一凭证。你拿到的实际上是一串“代理密钥”——你的请求先发到第三方平台平台再帮你转发到 Space Bunny 的真实地址。这个过程中间多了一层转发但好处是你不用直接跟匿名模型背后的服务方对接省去了审批流程和账号门槛。注意匿名模型的可访问性是不稳定的今天能在平台列表里搜到明天可能就下架了。如果你是在做正式项目建议在代码里做好模型不可用的降级方案。3.2 客户端接入实操Open WebUI、Claude Code 和 Dify 全流程拿到 API Key 之后接入环节的核心就一句话把任何支持 OpenAI 接口协议的客户端指向 Space Bunny 的代理地址。3.2.1 接入 OpenAI 兼容客户端现在几乎所有主流 AI 前端都做了 OpenAI 兼容层Open WebUI、NextChat、LobeChat 都是一样的配置逻辑。以 Open WebUI 为例在设置里找到“外部连接”或“模型连接”选择 OpenAI API 类型填入三个信息API 地址填写聚合平台提供的代理 Base URL一般是https://api.xxxxx.com/v1API 密钥粘贴你刚才生成的访问令牌模型 ID填入 Space Bunny 的完整模型 ID保存之后在模型选择列表里就能看到 Space Bunny 了。你可以先发一条测试消息确认返回正常。这类客户端的配置本质就是一个 HTTP 转发层所以只要聚合平台的接口是和 OpenAI 兼容的客户端不需要做任何代码改动。3.2.2 接入 Claude Code 和 Codex CLI这是命令行党最关心的一块。Claude Code 和 Codex CLI 这类工具默认都只认自家模型但好在它们都支持环境变量重定向。Claude Code 的接入思路是这样它走的协议虽然是 Anthropic 格式但很多聚合平台已经做了格式转换你只需要把环境变量指向代理即可。实际操作时我建议你先确认聚合平台是否提供 Anthropic 兼容端点。如果提供配置方式如下export ANTHROPIC_BASE_URLhttps://api.xxxxx.com/anthropic export ANTHROPIC_AUTH_TOKEN你的_API_Key export ANTHROPIC_MODELspace-bunny设置好环境变量后启动claude命令它就按照 Anthropic 格式把请求发给你填的地址了。如果平台那边做了协议转换就能正常解析并调用 Space Bunny。Codex CLI 的逻辑略有不同它默认只支持 OpenAI 格式。你需要把它重定向到 OpenAI 兼容的端点export OPENAI_BASE_URLhttps://api.xxxxx.com/v1 export OPENAI_API_KEY你的_API_Key codex --model space-bunny这里有一个容易踩的坑Codex 本身是一个 agent 型工具它会向模型发起多轮工具调用。如果匿名模型没有针对工具调用做过训练Agent 模式的效果就会打折扣。所以如果你要用 Space Bunny 跑 Codex我的建议是优先让它做代码解释、单文件生成、代码 review 这类偏“单点”的任务不要一上来就让它全自动重构整个仓库。3.2.3 接入 Dify 等低代码平台Dify 这类平台接 Space Bunny 其实更简单本质也是 OpenAI 兼容模型。在“设置-模型供应商”里选 OpenAI-API-Compatible填完 Base URL 和 API Key 就行。唯一需要注意的是Dify 里可以配置模型参数比如 Temperature、Top P、Max Tokens。Space Bunny 的默认采样参数偏保守生成的文本会比较稳妥但略显平淡。如果你是用在创意写作或营销文案场景建议把 Temperature 调到 0.9 左右会让输出更有“人味”。如果是代码生成就用默认的 0.3 到 0.5减少胡编乱造的概率。我在 Dify 里搭了一个客服知识库机器人底层接的就是 Space Bunny。跑了一个星期体感响应速度比官方大模型稍慢但胜在成本便宜而且上下文保持能力在客服问答这个场景里完全够用。3.3 接入的三种“正确打开方式”和一种“错误姿势”上面说的都是具体操作最后总结一下接入的核心思路。强烈建议你根据自己的场景选择不同的接入路线纯聊天体验直接用 Open WebUI 或 NextChat配置成本最低五分钟搞定适合个人尝鲜和日常问答。Agent 编程场景优先用 Claude Code 接入因为它的提示词工程比较成熟对模型的指令遵循能力要求没那么高Codex 也能用但对匿名模型的工具调用能力是考验。业务系统集成走 Dify 或 FastGPT 这类平台好处是后续可以方便地在多个模型之间切换不会绑定死一家。错误姿势上来就在生产环境的核心链路里全量切换。匿名模型的稳定性还没经过长期验证万一上游直接消失你的业务就跟着中断了。提示不管走哪条路都建议在请求层做超时控制和重试机制。我在实际接入中把超时时间设成 60 秒连续两次失败就自动切换备用模型这种兜底方案在匿名模型身上绝对值得做。4. 接入后的常见问题与排查实录4.1 我踩过的坑鉴权失败、上下文截断和工具调用失灵先说鉴权问题。匿名模型接入最容易遇到的就是 HTTP 401。原因是聚合平台的模型 ID 经常变动你代码里写死的 ID 一旦和平台后台对不上就会报模型不存在或权限不足。这时要做的第一件事不是改代码而是去平台页面确认当前模型 ID。我就有一次上午配好的 Space Bunny 还能用下午平台给它改了名加了个版本后缀结果所有请求全挂。排查方法很简单在请求日志里看错误信息如果报model_not_found那基本就是 ID 过期的锅。再看上下文截断。用 Open WebUI 这类前端时很多人会忽略前端本身的上下文长度设置。前端默认可能把最大 Token 数设置为 4096哪怕底层模型支持 200K超出的部分也会被前端直接裁掉。解决办法是在前端的模型参数设置里把上下文长度和最大回复 Token 数同步调大。最后说工具调用失灵。如果你在 Codex 或 Dify 里接匿名模型发现它不调用工具不要怀疑是代码写错了。工具调用需要模型在训练阶段见过对应的格式很多匿名模型没有专门针对 function calling 做对齐所以它要么不触发要么返回格式不标准。我的经验是抽象出一个工具调用的适配层让程序把模型输出解析成标准动作。如果解析失败就退回成纯文本模式。4.2 匿名模型的网络链路稳定性问题接入匿名模型走的是第三方聚合平台网络链路上多了一跳实际响应时间会比直连官方 API 慢。我在国内网络环境下测试Space Bunny 的平均首字响应时间在 2 到 5 秒之间高峰期可能到 8 秒以上。对于实时性要求不高的场景比如客服问答、内容生成这个速度完全可以接受。但如果要做实时翻译、语音对话这类对延迟敏感的场景我建议不要直接用匿名模型而是选择国内直连的模型服务。关于网络稳定性有一个小技巧不要只依赖一个聚合平台。我本地备了两个平台的 Key一个作为主接入一个作为备用。主平台如果连续三次请求超时客户端自动切到备用平台。匿名模型的生命周期本来就不稳定你手里有备案心里才不慌。4.3 匿名模型接入速查表我把接入中最容易踩的坑整理成一个速查表方便你当作排障手册用现象可能原因解决办法返回 401API Key 过期或平台不认去平台重新生成 Key 并更新环境变量返回 404 / model_not_found模型 ID 变更或拼写错误去平台复制最新模型 ID确认后缀响应超时聚合平台高峰期拥堵调大超时上限配置备用平台自动切换回答内容明显变短前端最大 Token 限制调大 Max Tokens 参数检查上下文设置不调用工具模型未对齐 function calling加适配层做解析兜底或者换工具专用模型上下文漂移超过模型有效上下文长度拆分子任务分段处理二次汇总这张表建议直接存一份因为匿名模型的接入问题有一个特点——你遇到的坑别人大概率也会遇到但官方文档不会告诉你。5. 我的一点私货匿名模型值不值得接入生产环境测试了两周我自己的结论是Space Bunny 适合接入那种“需要高情商回复、但不需要绝对正确”的场景——营销文案、客服话术、日常助理、头脑风暴。这些场景里它的性价比极高因为它省去的品牌溢价被转移成了实打实的成本优势。反过来如果业务链条里有一环是“错了就要出事故”比如合同审核、代码自动修复、数据分析我建议你冷静一点。匿名模型的底层逻辑和训练数据源都不透明你既不知道它的知识截止日期也不知道它是否针对特定领域做过强化。在高风险场景里模型的可解释性和可追溯性比“回答的好不好”更重要。最后分享一个接入技巧你可以把 Space Bunny 和另一个主用模型同时挂在一个前端里平时默认走主用模型遇到需要发散创意或者写种草文案的任务手动切到 Space Bunny。这样既不影响主流程的效率又能白嫖它接近 Opus5 的对话能力。匿名模型的现象级表现说到底反映的是大模型市场竞争进入了一个新阶段——当模型能力的差距缩小到普通人感知不到的程度用户就不再关心模型是谁家的只关心谁能把问题解决得舒服。Space Bunny 能登顶调用量第一靠的正是这种“无身份、无包袱、纯看疗效”的产品体验。至于它背后的团队是谁、底座是哪个模型在真实的对话体验面前反而没那么重要了。