“牛来”闯入AI圈!神秘大模型爆火,谁在背后放大招?
产联社编辑 |沈潇

“牛来”闯入AI圈!
8月20日,一个顶着神秘代号Ox Alpha的大模型,悄无声息地出现在模型聚合平台OpenRouter和编程工具OpenCode上,没有发布会,没有技术报告,官方介绍只有一句话:
面向高效编程、长时间智能体任务和真实生产环境的前沿模型。
因为“Ox”在英文里正是“牛”的意思,又恰好撞上动画电影《牛来》刷屏全网的热梗,中国网友很快给它安排了一个接地气的昵称:“牛来大模型”。
但很快,网友发现,Ox Alpha不只是名字牛,实力也很牛。
凭借免费使用、超长上下文和出色的编程能力,Ox Alpha上线仅一天,就冲上OpenRouter调用量榜首,刷新平台单日模型用量纪录,连支付巨头Stripe CEO都亲自上手,留下四个字:“相当惊艳”。
但比性能更令人好奇的,是Ox Alpha的身世。一夜之间,AI圈集体变身侦探:这是智谱又藏了一手,还是谷歌憋了个大招?
一、“牛”在哪儿?免费且能打
Ox Alpha之所以能在一天之内冲上榜首,首先靠的是一套相当有吸引力的组合:免费、超长上下文,以及针对编程和智能体任务的能力。
根据OpenRouter披露的信息,Ox Alpha拥有约104.86万token的超长上下文窗口,最大能一口气输出13.1万token,同时支持文本、图片和视频输入,还能调用外部工具。
这有多厉害呢?简单来说,它单次能够读入的内容,足以覆盖一个大型代码仓库,或者数百页文档。对于需要长时间运行的编程智能体来说,这意味着模型不会频繁忘记前文,也不需要开发者频繁挑选上下文。
而这恰好就是Ox Alpha瞄准的场景。
OpenRouter给它的官方定位是面向编程、持续运行的智能体任务和生产环境。OpenCode也在Ox Alpha上线后迅速接入,并宣称其服务每天可以承载100万亿token的调用量。
说白了,Ox Alpha从一开始就是来干活的,而不是用来闲聊的。
紧接着,让这款“牛来大模型”迅速出圈的,是一波接一波的实测。
独立研究员Ben Davis从软件工程测试基准DeepSWE里抽了10道真实任务,结果Ox Alpha通过了其中8道,通过率80%。
同一批题目里,Claude Fable 5的通过率是65%,GLM-5.3和Grok 4.6都是62%,GPT-5.6 Sol只有52%,“匿名模型吊打一众旗舰”的说法迅速传遍全网。
随后,DeepSWE一作Wenqi Huang用完整的113项官方测试重新跑了一遍,Ox Alpha的通过率回落到约63%左右,跟顶级闭源模型比,大概只比Grok 4.6稍逊一筹。
而比跑分更有说服力的,是硅谷一众大佬的亲身背书。
支付巨头Stripe的CEO亲自上手体验后,留下“相当惊艳”四个字;智能体产品Hermes Agent的创始人则表示,Ox Alpha的表现超过了公司内部此前的评估标准;OpenRouter、T3 Chat等公司的CEO也纷纷跟进转发。
开发者们还顺手做了一些有趣的测试。有人让Ox Alpha接入游戏智能体操作《青蛙过河》,模型不仅完成了任务,还自行加入了新的游戏元素;也有人让Ox Alpha制作个人主页,一次生成多套不同风格的设计。
类似案例未必能替代严格的专业评测,却能让人更直观地看到它的多模态理解、工具调用和代码执行能力。
截至8月24日,Ox Alpha仍然稳坐OpenRouter调用量榜首。

也就是说,Ox Alpha不是单纯靠一个漂亮的榜单数字出圈,而是把免费使用、百万token级上下文、编程能力和智能体执行能力组合在了一起。
二、全网探秘“牛来大模型”的身份
“牛来大模型”是匿名上线,身份自然成了最大的悬念。
一开始,猜测五花八门。有人猜是小米MiMo,毕竟小米CFO刚公开说过新一代MiMo正在训练,还有过用“Hunter Alpha”匿名测试的先例;有人猜是腾讯混元,理由是能支撑如此大规模免费调用的厂商,本来就没几家。
随着讨论升温,网友们很快进入了“找证据”环节。
一批开发者开始像做模型取证一样,去寻找Ox Alpha在处理文字、图片、视频以及调用API时留下的各种“工程指纹”。
简单来说,就是不同模型在底层实现上会留下的一些细微习惯。比如同一段文字如何被切分成token,API如何处理参数,遇到错误时会返回什么提示,以及面对图片、视频时如何计算输入长度。
而从Ox Alpha测试出来的线索,逐渐指向了智谱的GLM。
有开发者拿25组提示词分别测试Ox Alpha和智谱GLM-5.3,发现两者的token切分结果高度一致。随后,又有人针对视频输入进行测试,发现Ox Alpha的处理规律与智谱此前公开的GLM-5V-Turbo存在较高相似度,而换成小米、通义千问等其他模型后,结果明显不同。
后续的黑盒测试进一步强化了这一判断。有研究者通过tokenizer、API参数、错误信息以及多轮工具调用等多个维度进行比对,发现Ox Alpha与智谱GLM-5系列在多个底层特征上高度吻合。其中一项最新测试甚至在25组tokenizer测试中几乎全部匹配。
更有意思的是,智谱此前上线的匿名模型代号叫Pony(小马),这次换成了Ox(牛),网友热评:“无论从生肖分类还是‘牛马’的隐喻来看,这个组合都很合理。”
就在“智谱说”越传越广的时候,谷歌反倒下场凑起了热闹。
谷歌DeepMind研究人员在社交平台上先后提到“Gemini”,还留下“万一Ox Alpha就是我们一路上遇到的老朋友呢”之类意味深长的暗示。话说得含糊,既没有正式认领,也没有明确否认,让这场猜谜游戏多了一层悬念。

截至目前,Ox Alpha仍然没有被任何一方认领,谜底大概率要等到免费测试期结束才会揭晓。
而类似的匿名大模型“解谜”游戏,其实早已不是第一次上演。
三、大模型厂商,纷纷匿名上线
Ox Alpha是OpenRouter近年来上线的第五款匿名模型(Stealth Model)。
回看此前几款匿名模型的“揭面”经历,就会发现,这已经逐渐成为模型厂商测试新模型的一种新玩法。
今年2月上线的Pony Alpha,首日调用量突破400亿Token,5天后由智谱正式确认身份,对应GLM系列模型。
3月11日上线的Hunter Alpha,参数规模达到万亿级别,一度被外界猜测是DeepSeek的新模型,最终由小米认领,对应MiMo-V2-Pro。
此后,4月上线的Elephant Alpha,大约两周后由蚂蚁集团旗下Inclusion AI公布身份;4月底出现的Owl Alpha,则一直到6月30日才被证实来自美团,对应LongCat-2.0。
而目前已经揭晓身份的四款匿名模型,均来自中国团队。那么,模型厂商们为何不约而同地选择匿名上线?
首先,匿名能够最大程度降低品牌带来的先入为主。开发者不知道模型背后是谁,只能根据实际体验判断模型好不好,这种真实反馈对于厂商来说,本身就是一轮低成本的市场测试。
比起厂商自己设计的跑分基准,把模型丢进真实的代码仓库和智能体框架里,让开发者连续调用几十甚至上百步,处理数小时的复杂任务,更容易暴露出长上下文是否稳定、工具调用是否可靠等问题,相当于一次大规模的“压力测试”。
这种玩法也是一种进可攻退可守的现实策略。模型表现足够好,就可以在热度最高的时候摘下面具,把测试成绩转化成一次正式发布;如果表现没有达到预期,也可以在不影响品牌声誉的情况下悄悄结束测试。
而对正在出海的中国模型厂商来说,匿名还有额外的好处。
比起DeepSeek、通义这些在海外开发者圈拥有一定知名度的产品,很多国产模型仍然需要时间建立认知。
先用匿名模型进入海外开发者社区,获得真实使用反馈,等测试出成绩了再摘下面具,等于是把一次发布拆成了两轮传播,热度更持久。
正因如此,匿名模型往往能够在短时间内制造出一种特殊的传播效果:开发者负责测试,网友负责炒热话题,而厂商则站在幕后观察模型究竟能不能打动用户。
按照此前几款匿名模型的发布节奏,Ox Alpha的免费测试窗口大概率会在8月27日前后结束。它到底是智谱藏了一手的新模型、还是谷歌尚未公开的Gemini版本,又或者来自此前未被猜到的玩家?答案或许很快就会揭晓。
参考资料:
《神秘「牛来」模型刷屏,还抢了DeepSeek头条,实测到底牛不牛》,APPSO;
《真是牛市啊,"牛来"跑了5万亿Token...》,AI深度科技;
《神秘「牛来」大模型刷屏,限时免费》,机器之心;
《神秘"牛来大模型"火爆外网,部分测试超过Fable、GPT-5.6》,DeepTech深科技;
《神秘「牛来」掀翻硅谷!谷歌抢着认领被全网笑惨》,新智元;
《匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的》,量子位;
《调用量登顶!神秘牛来大模型是谁家的?》,东方财富网;
《神秘新模型"Ox Alpha"突袭OpenRouter,性能超过Fable 5?全网盲猜智谱或小米》,InfoQ。
商务合作/报料,请联系微信号:18801065284
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。



