}



8 月 20 日,AI 模型聚合平台 OpenRouter 发布推文,宣布上线一款代号为 Ox Alpha 的匿名新模型。官方没有透露模型开发方,只将其描述为一款面向编码、长时间智能体任务和实际生产环境的前沿模型。

模型参数信息不多:Ox Alpha 的上下文窗口约为 104.8 万 token,最大输出长度为 13.1 万 token,同时支持文本、图像和视频输入,预览期间可以免费调用。开源终端编程智能体 OpenCode 也在当天宣布接入这款模型,并表示为其准备了每天 100 万亿 token 的调用容量。

上线数小时后,Ox Alpha 迅速吸引了社区注意力,多位开发者对其展开密集测试。独立研究员本·戴维斯(Ben Davis)选取软件工程基准 DeepSWE 中的 10 个子任务进行测试,Ox Alpha 的通过率约为 80%,高于 Claude Fable 5 的 65%、GLM-5.3 和 Grok 4.6 的 62%,以及 GPT-5.6 Sol 的 52%。不过,这组结果来自戴维斯的个人测试,DeepSWE 官方排行榜目前尚未收录 Ox Alpha。


(来源:X@davis7)

对一款刚上线不到 12 小时的匿名模型,这样的数据足以引发集体好奇:Ox Alpha 到底是谁家的?

社区的讨论猜测主要集中在四个方向。

最早是小米 MiMo。8 月 18 日,小米集团 CFO 林世伟刚刚透露,新一代 MiMo 模型正在训练,很快会发布。更巧的是,小米此前已经在 OpenRouter 上这么做过:今年 3 月,MiMo-V2-Pro 曾以 Hunter Alpha 的名字匿名测试。

第二种可能指向智谱 AI(现已更名 Z.ai)。Ox Alpha 的 100 万 token 上下文、多模态输入和智能体定位,都与智谱近来的模型路线比较接近。智谱也有匿名测试的先例,今年 2 月上线 OpenRouter 的 Pony Alpha,后来被证实就是 GLM-5。

第三个方向是腾讯混元,有 Reddit 用户直接猜测是“HY 4”,理由之一是能撑起如此大规模免费调用的厂商并不多;第四个方向是 Google Gemini,依据是百万上下文加原生视频输入的组合此前更常见于 Gemini 系列,甚至有测试者试图从 Ox Alpha 口中“套话”,问及身份时,它自称为 Gemini。

四个方向各有支撑,也各有漏洞,最后一种最容易被证伪:模型可能从训练数据、系统提示或对话上下文里生成一个看起来合理却完全失实的答案,同一个模型在不同问法下,给出的答案也可能反复横跳。

随着讨论持续发酵,一系列技术分析陆续出现,Ox Alpha 的身份也逐渐浮出水面。

猜模型,变成了一门技术

匿名可以隐藏模型的品牌和开发方,但很难完全掩盖它在工程实现上的特征。

几轮匿名模型测试下来,社区判断模型身份的方式也越来越技术化。开发者不再只凭回答风格和使用体验猜测,而是开始比较分词器、视觉编码方式、特殊 token 反应等特征,并通过多个维度相互验证。

第一个方法是分词器(tokenizer)指纹匹配。每一款大语言模型在处理输入文本时,都会先经过分词器把字符串切分成 token。不同厂商训练的分词器有各自的词表和切分策略,即面对同一段文本,切出的 token 数量往往并不相同,隐藏难度极高。

一位分析者用 25 组不同提示词分别测试 Ox Alpha 和 GLM-5.3,发现两者的原始 token 数完全一致,只是 Ox Alpha 每次都会固定多出 75 个 token。这一规律也被认为是它可能来自智谱 GLM 系列的又一项证据。

第二个方法是视觉编码器(vision encoder)的 token 预算指纹。多模态模型处理视频输入时,会用一个视觉编码器把画面帧转化为 token 送入语言模型,这一步消耗的 token 数由采样帧率、时长缩放系数、分辨率处理策略等多个独立设计决定。

有人构造了四段用 ffmpeg 生成、参数固定的测试视频,依次发送给 Ox Alpha 和各个候选模型,然后用总 token 数减去纯文本基线,得到视觉编码器的净消耗。结果显示,Ox Alpha 在四段视频上的消耗与智谱的 GLM-5V-Turbo 完全一致,且同时匹配三个独立的编码器设计选择:帧率无关的采样、约每秒 147 token 的时长缩放、逐帧的分辨率缩放。作为对照,小米 MiMo v2.5、通义 Qwen 3.8 Max、GLM-4.6V 的编码器签名与 Ox Alpha 差异显著。


图 | 近乎实锤(来源:ox alpha evidence production)

第三个方法是脏 token(dirty token)碰撞。即语言模型训练时,某些 token 由于在数据里出现频率低或分布异常,会成为模型的敏感点,遇到时容易触发异常输出。不同模型家族的脏 token 分布并不相同。

有测试者观察到,Ox Alpha 在同一批对抗字符串上的反应模式与 GLM-5.3 高度重合,但与 Gemini、DeepSeek、Kimi 的匹配度仅为 18%~22%。

第四个方法是行为风格与工作节奏。有分析者统计了 Ox Alpha 在输出综合性回答时的 emoji 密度,约为每千字符 1.3 个,这正是 GLM 系和 Qwen 系模型的典型风格特征(章节 emoji、红黄绿三色状态点、勾选列表),Claude、GPT-5.6 和 Grok 在同类任务上的密度接近于零。

此外,DeepSWE 跑分显示,Ox Alpha 平均每个任务执行 117 个智能体步骤,与 GLM-5.3 的排行榜数据(124 步)几乎一致。作为对比,GPT-5.6 Sol 通常只用 61 步、Claude 系是 88~99 步。

第五个方法是排除法。小米 MiMo 虽然参数规模相近、也有匿名发布的先例,但 MiMo V2.5 的一个标志性能力是原生音频输入,反观 Ox Alpha,其在音频请求上的拒绝方式与 GLM-5V 完全一致。更别提通常不绕弯子、直接开源权重的 DeepSeek。进一步缩小范围,通义 Qwen 3.8 刚刚公开发布,编码器签名对不上;xAI、OpenAI、Anthropic、Gemini 等则在分词器、风格、编码器等特征上不匹配。

综合以上证据,本·戴维斯推测,Ox Alpha有约 99% 的概率属于智谱 GLM-5.x 系列,具体而言,可能是多模态旗舰 GLM-5.3V(视觉版)或下一代 GLM-5.5。另一份独立分析对这一判断给出的置信度是 90% 左右。

匿名通道成了中国模型的出海标配?

Ox Alpha 是 OpenRouter 上线的第五款“Stealth Model”(匿名模型)。在这一机制下,模型厂商可以暂不公开身份,将模型接入 OpenRouter 的统一 API,开发者则可以像调用普通模型一样进行测试。等到测试告一段落后,厂商再选择是否公开模型身份。

值得注意的是,此前几款最终公开身份的 OpenRouter 匿名模型,背后都来自中国团队。今年 2 月,代号 Pony Alpha 的匿名模型上线,首日调用量达到 400 亿 token,5 天后公布身份,确认为智谱 GLM-5。3 月 11 日,Hunter Alpha 上线,同样具备万亿参数级规模和 100 万 token 上下文,一度被外界猜测为 DeepSeek V4,随后小米确认其为 MiMo-V2-Pro。

4 月,主打效率的文本模型 Elephant Alpha 上线,约两周后由蚂蚁集团旗下 Inclusion AI 公布身份。4 月底,主打智能体和工具调用能力的 Owl Alpha 出现,直到 6 月 30 日才正式确认来自美团,对应模型为 LongCat-2.0。

顺着这个线索再看,Ox Alpha 也多了一点指向智谱的巧合:上次的马甲是“马”,这次是牛,无论从分类学还是从“牛马”的隐喻来看,都很合理。


(来源:openrouter)

为什么中国厂商出海时偏爱“假面舞会”?

匿名发布的好处,首先是减少品牌本身对测试结果的影响。开发者不知道模型来自哪家公司,更容易直接根据实际表现作出判断。对于希望进入海外开发者市场的中国模型厂商来说,这种方式也能降低新品发布时的品牌门槛。

除了 DeepSeek 和通义 Qwen,很多中国模型在海外开发者中的品牌认知度仍然有限。相比直接以公司和产品名上线,匿名模型更容易激发社区的测试和讨论。等到模型积累一定关注后再公布身份,也相当于形成了两轮传播:先讨论模型本身,再讨论背后的厂商。

匿名测试还有一个更实际的价值,就是获得真实使用环境下的反馈。开发者会把模型接入不同的编程工具、智能体框架和代码仓库,用它处理远比公开 benchmark 更复杂的任务。长上下文是否稳定、工具调用是否可靠、连续执行几十甚至上百步后还能不能保持目标,这些问题往往只有在大规模真实调用中才能暴露出来。

OpenCode 此次宣称为 Ox Alpha 准备了每天 100 万亿 token 的服务容量,也说明这轮测试规模并不小。对模型厂商来说,这部分投入既可以理解为推广成本,也可以看作一次面向真实用户的大规模压力测试。

按照此前几款匿名模型的发布节奏,Ox Alpha 的免费测试可能在 8 月 27 日前后结束。现有技术分析普遍将它指向智谱 GLM 系列,更具体的猜测包括尚未发布的多模态旗舰模型,但在官方公布之前,这一判断仍然只能算是推测。

参考内容:

https://openrouter.ai/stealth/ox-alpha

https://x.com/OpenRouter/status/2090544970923184269

https://ox-alpha-evidence-production.up.railway.app/

https://x.com/aitrackerbot/status/2090547594556494221

https://x.com/i/trending/2090647410486001976

https://daily.dev/posts/ox-alpha-fully-tested-so-this-is-glm-5-5-it-s-crazy--edurbt7mj

https://cryptobriefing.com/ox-alpha-stealth-ai-model-1m-context/

https://www.cnbc.com/2026/07/07/chinese-ai-models-costs-us-openai-anthropic.html

https://www.bloomberg.com/news/articles/2026-08-16/stripe-nears-deal-to-buy-ai-firm-openrouter-for-over-7-billion