副标题:从 1M 上下文、免费 API、工具调用到社区 80% 小样本测试,拆清 Ox Alpha 的真实能力、使用入口与四种身份猜测
一款没有公开开发团队、没有技术报告、甚至没有正式厂商品牌的模型,突然出现在 OpenRouter,并迅速成为 AI 开发者社区的热门话题。它叫 Ox Alpha,模型 ID 为 stealth/ox-alpha。
与普通新品发布不同,Ox Alpha 先让开发者实际调用,再等待身份揭晓。OpenRouter 将其定位为面向编程、长周期 Agent 与生产任务的推理模型。官方页面显示,它支持文本、图片与视频输入,提供 1,048,576 Token 上下文和 131,072 Token 最大输出;预览阶段输入与输出价格均显示为免费。

一、Ox Alpha 是什么?先分清已经确认与尚未确认的信息

目前能够确认的是:Ox Alpha 并非 OpenRouter 自研。OpenRouter 负责提供统一 API 与请求路由,模型由选择匿名的第三方提供商开发和运行。因此,“来自小米、腾讯、Google 或智谱”都只是社区推测,在官方揭晓前不应写成结论。

| 项目 | 已公开信息 |
|---|---|
| 模型 ID | stealth/ox-alpha |
| 定位 | Coding、持续 Agent 工作、复杂推理与生产负载 |
| 输入 | 文本、图片、视频 |
| 输出 | 文本 |
| 上下文 | 1,048,576 Token |
| 最大输出 | 131,072 Token |
| 预览价格 | 当前显示免费,后续可能变化 |

二、百万上下文意味着什么?重点不只是“能塞更多文字”
百万级上下文让模型有机会一次读取较大的代码仓库、长时间积累的 Agent 执行记录,以及文本、截图和视频共同组成的任务材料。但上下文上限并不等于有效记忆,更不代表把整个仓库无差别塞进去就能得到更好的答案。

在真实软件工程中,更重要的是模型能否持续保持目标:先理解需求,再读取文件、调用工具、修改代码、执行测试、分析错误并重试。如果任务运行数小时后开始遗忘约束,即便单次代码补全很强,也难以稳定进入生产流程。


多模态输入同样很实用。开发者可以让模型结合 UI 截图排查前端问题、阅读架构图、理解视频内容或分析视觉测试结果。不过,当前输出仍以文本为主,它不会直接生成图片或视频文件。
三、工具调用与结构化输出:它更像 Coding Agent 的执行模型

Ox Alpha 页面给出的能力信息表明,它面向工具调用、可控输出和持续 Agent 任务。对 Coding Agent 来说,这比“会不会写一个函数”更关键:模型需要正确选择工具、组织参数、读取返回结果,并在失败后重新规划。
需要注意的是,结构化输出并不等于所有场景都能严格遵守复杂 JSON Schema。接入生产系统时,仍应在应用侧增加格式校验、重试与降级逻辑,尤其不能让模型未经确认直接执行删除文件、付款、发信或修改线上数据库等高风险动作。

四、性能怎么看?实时速度会变,稳定性比单个数字更重要
模型刚上线时,吞吐、首 Token 延迟与可用率会随着地区、流量、供应商容量和采样窗口不断变化。因此,某一时刻看到的速度只能作为快照,不能直接等同于长期体验。

更可靠的判断方法,是把它放进自己的任务集:固定提示词、仓库版本、工具权限和超时规则,连续运行多轮,记录成功率、总耗时、Token 消耗、返工次数以及人工接管次数。对于 Agent 来说,完成率和可恢复性通常比瞬时 TPS 更重要。

五、为什么免费?这是体验福利,也是一次公开压力测试
预览阶段的免费 API 是 Ox Alpha 迅速扩散的核心原因。百万上下文、多模态输入与 Agent 能力同时免费并不常见,但这不等于永久定价。匿名模型的免费期通常承担着收集真实任务反馈、观察失败模式和验证基础设施的作用。


开发者贡献的不只是调用量,还包括真实工作负载:依赖冲突、混乱代码、跨文件修改、终端操作、浏览器任务和长时间重试。相比厂商自建 Benchmark,这些任务更容易暴露模型在工具选择、上下文遗忘与错误恢复上的薄弱点。


六、社区实测:SVG 能完成,但最高推理档可能“想太多”
一组广泛传播的“鹈鹕骑自行车 SVG”测试,把同一任务分别运行在 low、high 和 max 推理档位。结果显示,模型多数时候能画出鹈鹕、自行车和骑行动作,说明它对代码生成与空间关系具有一定稳定性。


但细看仍有脚没有踩在踏板上、车架结构不完整、身体与车把连接不合理等问题。更值得注意的是,max 档的推理字符与耗时显著上升,主要增加了云朵、太阳、头盔和速度线等装饰,核心结构却没有同比改善。

这说明“更多推理”并不必然带来等比例质量提升。实际使用时,可以先用 low 或 high 完成多数任务,只在复杂规划、难定位的 Bug 或关键决策上启用最高档,并通过自动测试判断是否真的改善结果。
七、10 项任务拿到 80%:值得关注,但不能据此宣布击败 Fable 5

另一组社区测试让 Ox Alpha 跑了 10 个任务,最终通过 8 个,得到 80% 的表面通过率;同一图表中,Fable 5 为 65%、GLM-5.3 与 Grok-4.6 为 62%、GPT-5.6 Sol 为 52%。
这个结果有参考意义,但证据强度有限:Ox Alpha 每项只测试一次,其他模型的运行次数不同;任务数量只有 10 个,提示词、推理预算、失败判定和工具环境也未必完全一致。更准确的结论是:Ox Alpha 展现出竞争力,值得扩大样本复测,而不是已经全面超过前沿模型。



八、Ox Alpha 到底是谁?四种猜测逐一拆解
猜测一:小米 MiMo V3
小米方向的猜测热度较高,原因包括发布时间接近、模型定位同样聚焦 Coding 与 Agent,以及小米过去曾通过 OpenRouter 匿名测试模型。不过,这些都只是行为与产品路线上的相似性,并非技术证据。

猜测二:腾讯混元 HY 4
另一派认为,大规模免费调用需要雄厚的推理基础设施,腾讯具备相应条件,也可能希望在正式发布前收集真实 Agent 数据。但目前没有 OpenRouter、腾讯或独立评测机构确认二者存在关联。


猜测三:Google Gemini 系列
百万上下文和视频输入容易让人联想到 Gemini,但这些能力正在被更多模型采用。让模型“自报家门”也不能作为证据:系统提示、训练数据和上下文都可能诱导它生成不同身份。

猜测四:智谱 GLM-5.3
智谱方向的推测主要来自分词模式、API 指纹和输出风格的相似性。有人声称在多组提示与对抗字符串测试中,Ox Alpha 与 GLM-5.3 的匹配度更高。这类“模型指纹”比单纯自述更有价值,但仍不足以确认归属。

九、匿名模型正在改变大模型发布方式
传统发布流程是先公布品牌和技术报告,再展示 Benchmark,最后开放 API。Stealth Model 则反过来:先匿名进入真实环境,让开发者在没有品牌光环的情况下使用,再根据表现和反馈决定后续发布节奏。
这种机制能减少品牌先入为主,也能为模型厂商提供更接近生产环境的灰度测试;但用户要承担更高的不确定性,包括身份未知、能力波动、隐私条款和免费额度随时调整。
十、Ox Alpha 怎么用?建议从低风险任务开始
- 进入站内整理好的 OpenRouter 导航页面,再前往官方网站。
- 在模型页面搜索
stealth/ox-alpha,先用 Playground 做小任务测试。 - 准备 API Key 后,将模型 ID 接入兼容 OpenAI 接口的工具或自建 Agent。
- 先测试公开代码、个人实验项目和可回滚任务,不要直接提交敏感数据。
- 记录成功率、总耗时、Token、重试与人工接管次数,再决定是否进入生产工作流。
推荐的三类测试任务
- 仓库理解:让模型梳理目录、依赖与关键数据流,不立即修改文件。
- 受控修复:选择有自动测试的小型 Bug,限制可写目录和工具权限。
- 多模态排错:提供界面截图和相关代码,检查它能否将视觉问题定位到组件与样式。
十一、延伸阅读:把一次热度变成可复用的评测方法
如果你关心 Fable 5 的传闻与稳定性,可继续阅读《Claude Fable 5.1灰度测试传闻升温》;想判断“某个 Skill 或新模型是否真的超过 Fable 5”,可参考J-Space 争议复盘;关于 Token 成本与模型选择,还可以查看Codex 与 Claude Fable 5 额度战及五款 Agent 模型横评。
结论:Ox Alpha 已确认的亮点是百万上下文、多模态输入、长输出、面向 Agent 的定位和预览期免费;社区测试显示它具备竞争力,但样本仍小,身份也未揭晓。现在最合适的做法不是押注它来自哪家公司,而是用可重复的真实任务测出它在你的工作流里是否稳定、是否省时间,以及失败时是否容易恢复。






