最近,海外开发者圈又被一个没有名字的模型刷屏了。

8 月 20 日,OpenRouter 上多了一个叫 Ox Alpha 的模型,100 万 token 上下文、支持图片和视频输入、能调用工具、免费。随后,它被接进 OpenCode、Hermes 等编程 Agent。有人拿它修代码,有人用它跑软件工程基准,还有人盯着 tokenizer 和报错信息,试图猜出它到底是谁家的。

目前,Ox Alpha 的身份还没有得到官方确认。社区最 流行的猜测是,它与智谱 GLM-5.x 系列关系很近;依据是 tokenizer、推理模式报错和部分输出习惯的相似性。但这还只是技术分析,智谱官方目前还没有认领。

从 Ox Alpha 爆火,可以看到一个越来越常见的出海打法:模型先匿名上线,让海外开发者替它做第 一轮测试、传播和身份鉴定。

01

从 HappyHorse 到 Ox Alpha

Ox Alpha 并不是第 一个蒙着脸跑出来的模型。

往前翻四个月,阿里的 HappyHorse(欢乐马)也是这个路数—— 没有发布会,没有公司名,直接空降到 AI 评测平台 Artificial Analysis 的 Video Arena 榜单上,一度把字节 Seedance 2.0 和快手可灵 3.0 挤到身后,登顶榜一。讨论热度起来几天后,阿里确认,HappyHorse 来自 ATH 创新团队。

今年以来,OpenRouter 上接连出现了一批「Alpha」模型。

2 月,Pony Alpha 上线,后来被 OpenRouter 标注为 GLM-5 的早期测试版本;3 月,Hunter Alpha 被小米认领为 MiMo-V2-Pro 的早期测试版本;4 月,Elephant Alpha 上线后揭晓为蚂蚁 Inclusion AI 的 Ling-2.6-flash。Pony Alpha、Hunter Alpha、Elephant Alpha 的模型页上,如今都留下了这段「前身」记录。

匿名测试本来就是 OpenRouter 长期存在的机制,OpenAI、xAI、NVIDIA 等团队都曾用过类似方式。只是从 HappyHorse、Pony Alpha 到 Ox Alpha,中国团队越来越熟练地把海外开发者平台当成新品的第 一站。

这背后的逻辑不难理解。

大模型出海,厂商真正要争取的并不只是一次新闻曝光,而是进入开发者的日常工作。DeepSeek 和 Qwen 已经在海外社区积累了不少认知,但更多中国团队仍处在「听过,但没用过」的阶段。直接挂着公司名发布,开发者未必会专门去试;一个神秘代号,加上免费、长上下文、Agent 这些关键词,更容易让人点开。

它们也选对了地方。

HappyHorse 去的是视频模型盲测榜单,排名变动本身就会成为话题;Ox Alpha 进入的是 OpenRouter 和 OpenCode。前者是开发者选模型、比价格的入口,后者直接连着编程 Agent。用户不需要下载新软件,也不用重新学习一套工作方式,换个模型就能让它开始读代码、跑任务。

这和过去的发布会逻辑不太一样。以前,厂商先告诉市场「我很强」,再等待用户来验证;现在,模型先被扔进开发者的工作流,用户用几天就会给出答案。

渠道选对了,匿名本身就成了一种营销。

02

匿名上线,开发者一边测能力,

一边给它「验明正身」

Ox Alpha 上线后,海外社区很快出现了两种不太一样的声音。

一边是惊喜。社区流传的一组 DeepSWE 测试中,Ox Alpha 在 10 个软件工程任务里通过了约 8 个,成绩高过同场测试的几款知名模型。对一款刚上线、连开发者是谁都不知道的模型来说,这个结果足够吸引注意力。

但另一边,质疑也来得很快。10 个任务只是很小的样本,每多过或少过一道题,分数都会变化 10 个百分点。后来出现的更大样本社区复测,结果回落到约 63%。这个数字同样不是官方审计榜单,只能作为参考。它至少说明,匿名模型上线初期,最容易被放大的往往是小样本里的惊喜。

还有研究者拿 Ox Alpha 跑更偏抽象推理的 INDUCTION 基准,得到的结论也没那么乐观:它的成绩落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash;为了得到 87 个可评估结果,测试者调用了 551 次 API,期间多次遇到空回答和接口错误。他自己也无法确认,这些问题究竟主要来自模型,还是来自 OpenRouter 的接入链路。

这些结果并不必然互相矛盾。今天的 Agent 模型,很难只靠一张 benchmark 表判断好坏,模型、推理档位、工具调用、网关和具体任务,都会改变最终结果。它答对一道题,和它能不能在一个真实代码库里连续工作两个小时,是两件不同的事。开发者真正关心的是,它能不能理解项目结构,工具调用会不会出错,任务做到一半会不会停住,失败后能不能自己恢复,上下文拉长后还记不记得最初目标。

开发者也在试图找出它是谁。由于厂商没有公开说明,社区只能从模型的行为里找线索:一句话被切成多少 token,错误参数会返回什么提示,把 temperature 调到 0 后会怎样组织答案,甚至中文提示词下会不会露出某种习惯。

目前最 流行的猜测是,Ox Alpha 与智谱 Z.ai 的 GLM-5.x 系列关系很近。社区发现,它的 tokenizer、推理档位报错,以及部分固定条件下的输出习惯,都和 GLM-5.3 很接近;Ox Alpha 又支持图片和视频输入,而公开的 GLM-5.3 主打文本能力,这也让不少人猜测它可能是一个尚未发布的多模态变体。

这个过程本身说明了匿名发布的一个特点:匿名模型一上线,开发者社区很快就会接手后面的工作:有人跑测试,有人拆参数,有人翻报错,有人顺着 token 计数一路猜到模型可能出自哪家。

开发者一边当公测用户,一边也做了媒体、分析师和测试工程师的活。

03

匿名能带来真实反馈,

也把更多问题留给了用户

如果模型一开始就挂着 OpenAI、Google、阿里或智谱的名字,用户很难完全摆脱预期。有人会因为品牌愿意多给它几次机会,也有人会因为对某家公司的印象,连试都不想试。匿名以后,开发者先看到的是结果:代码写得怎么样,工具会不会调错,长任务能不能做完,价格值不值得。

OpenRouter 联合创始人 Alex Atallah 此前回顾 Quasar Alpha 的匿名测试时提到,平台和模型团队想看的,是用户在不知道模型开发者是谁的情况下,会怎样使用和评价它。对模型团队来说,这能减少品牌带来的预设,也能更快拿到真实反馈。

这也是为什么匿名模型总能迅速调动开发者社区。

厂商放出一个代号,用户就会开始跑 benchmark、接入 Agent、对比输出,甚至研究 tokenizer 和报错信息。HappyHorse、Pony Alpha 到 Ox Alpha,都是同一个过程:模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播。

从厂商角度看,这笔账很好算。实验室里的 benchmark 能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标,高峰期服务稳不稳定——这些问题,只有真实用户拿项目去撞,才能撞出来。

匿名测试还有一个更直接的好处:免费期里留下的使用数据,会帮助厂商判断模型应该卖给谁、该怎么定价、哪些能力值得继续投入。对还在找产品定位的新模型来说,这比提前写好一套发布会话术更有价值。

但这场盲测并不完全对等。

厂商和平台知道模型是谁、服务跑在哪里、哪些信息会被记录;用户拿到的往往只有一个代号和一段有限的说明。Reddit 上就有开发者提到,匿名模型很难进入严肃的企业评估流程:公司内部的 benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。对个人开发者来说,这是一份免费的惊喜;对企业来说,更像一份没有署名、也没有完整说明书的试用品。

Ox Alpha 把这个问题放大得更明显。OpenRouter 的页面写明,提示词和输出会由上游提供商保留,但不会用于训练;OpenCode 的相关说明则强调零数据留存。两种说法并不完全一致。对只是试玩的用户,这可能只是条款差异;对准备上传代码和业务文档的团队来说,它直接决定了能不能接入。

还有一个容易被忽略的问题:真实公测测出来的,从来不只是一款模型的能力。

研究者 Serafim Batzoglou 在 INDUCTION 基准上测试 Ox Alpha 时,遇到了大量空回答和 API 错误。为了获得 87 个可评估结果,他一共调用了 551 次 API。他的困惑很有代表性:问题究竟出在模型,还是出在 OpenRouter 的接入链路?对最终用户来说,这个问题其实没有那么重要——模型能不能稳定工作,本来就是产品能力的一部分。

匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。

最新快讯

2026年08月25日

09:08
鼓狮财经8月25日电,国内商品期货开盘涨跌不一,乙二醇、沥青涨超2%,对二甲苯、燃料油、20号胶涨超1%。跌幅方面,鸡蛋、苹果、菜油、原油跌超1%。
08:57
打开团购网站,你会发现深圳的科幻程度,已经远超你我的想象了。AI能实现的人类愿景,恐怕马斯克来了都直呼“牛来”。AI不止在电脑里大杀四方,把程序员、美工、演员们逼得灰头土脸,就连技师们的手艺活,AI也把手从电脑屏幕里伸出来,一把揽了过来。AI按摩,AI足疗、AI艾灸、AI美容……如果你觉得到这儿已经很魔幻了,那么你把AI结节调理、AI前列腺...
08:57
《奥特曼天降正义,小嘴抹毒暗讽A社“反人类”》!!这个标题有没有港媒内味儿了(doge),您先别笑,这还真是奥特曼在最新采访里的大致意思。虽然没有点名,但话里话外就差直接报Dario Amodei的身份证号了。谈到AI风险,奥特曼批评行业里有些人天天把两个数字挂在嘴边:AI有25%的概率毁灭世界,未来很快会有50%的工作消失。(划重点,这两...
08:57
据鼓狮财经8月25日报道,美东时间周一,摩根大通在研报中重申了对今年剩余时间美股走势的乐观态度。该行认为,市场上涨动力将主要源自板块轮动,而非普涨式的猛烈拉升。 **看好板块轮动,聚焦优质成长股** 小摩策略师法比奥·巴西在报告中指出,对年底前的行情持建设性看法,预计市场将稳步上行,行情主线将是板块轮动,而非全面普涨。近期半导体板块的反弹,标志着市场风险偏好...
08:57
经过2026年7月的调整,当前美股半导体设备板块的配置价值愈发显著。我们预计,在人工智能的驱动下,本轮设备上行周期至少将持续至2028年。此外,市场对于2027至2028年下游大客户资本开支的预期存在一定差异。在产能供应方面,半导体设备厂商及其上游正在积极按订单扩产,我们认为设备交付有望得到保障。基于此,我们建议关注细分环节份额提升、存储敞口更大以及具备独特...
08:57
据路透社报道,一份公开的财务披露文件显示,美国总统特朗普在6月向SpaceX投资了高达5万美元,从而持有了一家重要政府承包商的股份。该公司由特朗普的前顾问埃隆·马斯克领导。 根据特朗普于8月12日签署、并于8月22日公开的文件,他在6月23日购入了价值1.5万至5万美元的SpaceX股票。这是特朗普在6月份完成的逾千笔股票交易之一。目前尚不清楚具体的成交价格...
08:57
**美伊博弈升级:贝森特启动“经济诺曼底”行动** 美国财政部长贝森特发起了所谓的“经济诺曼底”行动,宣布对伊朗实施多项制裁措施。这一行动旨在切断伊朗在数字资产、技术、黄金、航空及航运这五大经济命脉方面的联系。此外,美国还对近60个实体、个人及船只实施了制裁,并警告任何与伊朗合作的国家或个人将面临二级制裁。面对这一高压态势,伊朗最高领袖顾问穆赫贝尔强硬表态,...
08:25
这一消息震撼业界。就在刚刚,英伟达正式公布了 Vera Rubin NVL72 的首批实测数据,并携手 DeepSeek-V4-Pro 模型进行了真实「智能体编码」任务的测试。结果令人咋舌:对比当前的主力机皇 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高提升了 30 倍,Token 成本最高降低了 35 倍。有人感叹:「我连骗投资人的 P...
08:25
在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:“多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们V4的后续版本会支持原生的多模态。”梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 ...
08:24
美伊冲突正逐渐演变为一场全面的经济战。当地时间8月24日,美国财政部长贝森特在华盛顿举行新闻发布会,正式宣布了一系列针对伊朗的经济制裁措施。这场代号为“经济诺曼底”的行动,被美方标榜为“有史以来规模最大的金融攻势”,旨在彻底切断伊朗与全球经济的联系。受此消息影响,当天国际油价应声下跌,布伦特原油期货和WTI原油期货均收跌约2.4%。 此次制裁是在美伊冲突持续...
08:24
据市场消息,一位不愿具名的执政党官员透露,美国方面要求韩国在美投资建设存储芯片生产线,并致力于保障芯片供应的稳定。在韩国产业部长近期赴华盛顿开展投资谈判期间,双方就此议题进行了深入磋商。 报道指出,美方私下对韩国计划投入800万亿韩元打造湖南半导体产业集群一事表达了不满。美方认为,韩国政府虽然大力扶持本土芯片投资,但对推动半导体企业赴美投资的态度却较为保守。...
08:24
美国财政部长贝森特24日下午召开新闻发布会,宣布启动针对伊朗的新一轮“经济孤立”制裁措施,旨在进一步加大施压力度。制裁范围扩大至航空、数字资产、黄金、航运及技术等五个领域,涉及约60个伊朗相关实体、个人及船只。特朗普正在与各国领导人沟通,要求停止与伊朗的商业往来。伊朗最高领袖顾问穆赫贝尔24日晚在社交媒体上表示,面对美方威胁,伊朗将比以往更加坚决。他指出,美...