神秘“牛来”大模型冲榜第一,4万亿Token调用量引爆全球

8月20日晚,全球最大AI模型聚合平台OpenRouter的模型目录里悄然多了一个条目:stealth/Ox-Alpha。没有公司名,没有官方公告,只有一个简单的描述——“来自一家暂时保持匿名的第三方提供商”。

Ox就是“牛”,加上近期一部名为《牛来》的抽象电影梗火遍全网,国内网友干脆给它起了个亲切的昵称:“牛来”大模型。

上线之后,这头“牛”迅速把AI圈搅了个天翻地覆。

OpenRouter官方信息显示,Ox Alpha拥有约104.8万token的上下文窗口,最大输出长度13.1万token,支持文本、图像和视频三种输入格式,同时支持工具调用和JSON结构化输出。在预览期间,模型完全免费开放。OpenCode平台随后也宣布接入该模型,并称其背后提供方每天拥有100万亿token级别的服务容量。

调用量迅速攀升。OpenRouter最新数据显示,仅Hermes Agent、Claude Code等前五大应用对Ox Alpha的累计调用就已超过4万亿token。模型上线首日即登顶平台调用量榜首,刷新了OpenRouter的单日模型用量历史纪录。在OpenCode平台,它终结了DeepSeek长达56天的榜首位置。上线仅四天,Ox Alpha的周调用量已达11.6万亿token,冲至全球第二。目前免费期预计在8月27日前后结束。

真正引发广泛关注的,是模型的能力表现

独立研究员Ben Davis从DeepSWE软件工程基准测试中抽取10项任务对Ox Alpha进行测试——这套测试要求模型阅读代码仓库、定位bug、修改代码、运行测试,再根据报错继续修复。结果显示,Ox Alpha完成了其中8项,通过率达到80%。对比之下,Claude Fable 5为65%,GLM-5.3和Grok 4.6均为62%,GPT-5.6 Sol为52%。Davis评价称,Ox Alpha的语音能力比Claude和GPT都好,能很好地理解用户的意图,长周期复杂任务也接得住。

不过,10项任务的样本量较小。后续其他开发者在不同DeepSWE子集上的测试结果约为63%,两次测试的任务范围和运行配置并不完全相同。Ox Alpha目前尚未被列入DeepSWE官方排行榜。

性能之外,最让整个社区坐立不安的问题是:这到底是谁家的模型?

目前流传最广的猜测指向两个方向:智谱和谷歌

支持“智谱说”的一方拿出了相当详细的技术证据。有测试者使用25组不同提示词进行分词器指纹分析,发现Ox Alpha与GLM-5.3的token计数呈现高度一致的关系,仅存在恒定的75个token包装层偏差。更关键的是视频编码器——研究者制作了4段受控测试视频,分别交给Ox Alpha和几款多模态模型对比,发现Ox Alpha与GLM-5V-Turbo在视频token消耗模式上高度相似,包括帧率变化后的采样策略、时长增加时token增长速度、分辨率变化对应的缩放方式等。此外,Ox Alpha拒绝处理音频输入的行为与GLM-5V的路由方式相同,API服务层的错误码和参数限制也与智谱相关服务高度相似。Ben Davis表示自己有99%的把握认为它属于GLM-5.x系列。智谱此前曾用“Pony Alpha”的代号匿名测试GLM-5,具备相同的操作先例。

支持“谷歌说”的一方,主要依据是多名谷歌DeepMind研究员的公开表态。DeepMind研究员Evan Otero先发了一个词“Gemini”,随后又补了一句“万一Ox Alpha就是我们一路遇到的朋友呢”。同在DeepMind的Vamsi Batchu也跟了一句“谷歌回来了,相信流程”。这些暗示让Ox Alpha与谷歌尚未正式露面的Gemini新版之间的猜测快速升温。但社区以分词器指纹与报错码取证的分析,更多指向了GLM系列。

也有更抽象的说法在流传:有人猜测是Cursor拿开源GLM自己训练后套了个“马甲”。Max For AI则称Ox Alpha是100%的中国模型,作者是一个“会让大家都意外的团队”。

截至目前,OpenRouter、智谱、谷歌均未对Ox Alpha的身份做出正式回应。

这场“猜谜游戏”还在继续。但无论最终答案是什么,Ox Alpha已经在短短几天内完成了一次教科书级别的“匿名发布”——用实打实的代码能力和近乎无限的免费调用额度,让全球开发者心甘情愿地充当了测试员。OpenRouter联合创始人Alex Atallah在X上形容这是“近期首次Stealth发布”,并预期模型表现可达SOTA级别。

对于整个AI行业而言,这件事的意义或许超出了“谁家模型”的身份之争。当一个匿名模型可以在几天内吸引4万亿token的真实工作流调用、让硅谷半壁大佬亲自下场测试,它说明的不仅是某个技术团队的能力,更是全球开发者对高质量、低成本推理模型的饥渴程度。正如一位开发者所说:如果“牛来”真的只是一个小模型,那全世界的推理账单都得重算。

(素材来自:OpenRouter 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。