暂无菜单项

Ox Alpha是什么?OpenRouter匿名模型免费开放,百万上下文与Agent实测全解析

发布于
104

副标题:从 1M 上下文、免费 API、工具调用到社区 80% 小样本测试,拆清 Ox Alpha 的真实能力、使用入口与四种身份猜测

一款没有公开开发团队、没有技术报告、甚至没有正式厂商品牌的模型,突然出现在 OpenRouter,并迅速成为 AI 开发者社区的热门话题。它叫 Ox Alpha,模型 ID 为 stealth/ox-alpha

与普通新品发布不同,Ox Alpha 先让开发者实际调用,再等待身份揭晓。OpenRouter 将其定位为面向编程、长周期 Agent 与生产任务的推理模型。官方页面显示,它支持文本、图片与视频输入,提供 1,048,576 Token 上下文和 131,072 Token 最大输出;预览阶段输入与输出价格均显示为免费。

Ox Alpha 在 OpenRouter 上线的宣传画面
Ox Alpha 以匿名预览模型的方式进入 OpenRouter

一、Ox Alpha 是什么?先分清已经确认与尚未确认的信息

OpenRouter 发布 Ox Alpha 的页面与忍者图标

目前能够确认的是:Ox Alpha 并非 OpenRouter 自研。OpenRouter 负责提供统一 API 与请求路由,模型由选择匿名的第三方提供商开发和运行。因此,“来自小米、腾讯、Google 或智谱”都只是社区推测,在官方揭晓前不应写成结论。

社区围绕 Ox Alpha 身份展开讨论
项目 已公开信息
模型 ID stealth/ox-alpha
定位 Coding、持续 Agent 工作、复杂推理与生产负载
输入 文本、图片、视频
输出 文本
上下文 1,048,576 Token
最大输出 131,072 Token
预览价格 当前显示免费,后续可能变化
Ox Alpha 模型标识 stealth ox alpha

二、百万上下文意味着什么?重点不只是“能塞更多文字”

百万级上下文让模型有机会一次读取较大的代码仓库、长时间积累的 Agent 执行记录,以及文本、截图和视频共同组成的任务材料。但上下文上限并不等于有效记忆,更不代表把整个仓库无差别塞进去就能得到更好的答案。

Ox Alpha 百万 Token 上下文规格

在真实软件工程中,更重要的是模型能否持续保持目标:先理解需求,再读取文件、调用工具、修改代码、执行测试、分析错误并重试。如果任务运行数小时后开始遗忘约束,即便单次代码补全很强,也难以稳定进入生产流程。

Ox Alpha 长输出与 Agent 任务信息
Ox Alpha 支持文本图片和视频输入

多模态输入同样很实用。开发者可以让模型结合 UI 截图排查前端问题、阅读架构图、理解视频内容或分析视觉测试结果。不过,当前输出仍以文本为主,它不会直接生成图片或视频文件。

三、工具调用与结构化输出:它更像 Coding Agent 的执行模型

Ox Alpha 工具调用与结构化输出说明

Ox Alpha 页面给出的能力信息表明,它面向工具调用、可控输出和持续 Agent 任务。对 Coding Agent 来说,这比“会不会写一个函数”更关键:模型需要正确选择工具、组织参数、读取返回结果,并在失败后重新规划。

需要注意的是,结构化输出并不等于所有场景都能严格遵守复杂 JSON Schema。接入生产系统时,仍应在应用侧增加格式校验、重试与降级逻辑,尤其不能让模型未经确认直接执行删除文件、付款、发信或修改线上数据库等高风险动作。

Ox Alpha 在 OpenRouter 上的工具能力页面

四、性能怎么看?实时速度会变,稳定性比单个数字更重要

模型刚上线时,吞吐、首 Token 延迟与可用率会随着地区、流量、供应商容量和采样窗口不断变化。因此,某一时刻看到的速度只能作为快照,不能直接等同于长期体验。

Ox Alpha 延迟吞吐和可用率数据

更可靠的判断方法,是把它放进自己的任务集:固定提示词、仓库版本、工具权限和超时规则,连续运行多轮,记录成功率、总耗时、Token 消耗、返工次数以及人工接管次数。对于 Agent 来说,完成率和可恢复性通常比瞬时 TPS 更重要

Ox Alpha 模型实时性能趋势

五、为什么免费?这是体验福利,也是一次公开压力测试

预览阶段的免费 API 是 Ox Alpha 迅速扩散的核心原因。百万上下文、多模态输入与 Agent 能力同时免费并不常见,但这不等于永久定价。匿名模型的免费期通常承担着收集真实任务反馈、观察失败模式和验证基础设施的作用。

Ox Alpha 免费使用页面
OpenRouter 上 Ox Alpha 输入输出价格为零

开发者贡献的不只是调用量,还包括真实工作负载:依赖冲突、混乱代码、跨文件修改、终端操作、浏览器任务和长时间重试。相比厂商自建 Benchmark,这些任务更容易暴露模型在工具选择、上下文遗忘与错误恢复上的薄弱点。

OpenCode 宣布开放 Ox Alpha 免费体验
隐私提醒:OpenRouter 页面明确提示,Ox Alpha 的提示词和生成结果会由第三方提供商保留,虽然声明不用于训练,但匿名预览期仍不适合提交商业机密、未公开代码、个人信息或客户数据。
Ox Alpha 大规模 Token 测试与社区讨论

六、社区实测:SVG 能完成,但最高推理档可能“想太多”

一组广泛传播的“鹈鹕骑自行车 SVG”测试,把同一任务分别运行在 low、high 和 max 推理档位。结果显示,模型多数时候能画出鹈鹕、自行车和骑行动作,说明它对代码生成与空间关系具有一定稳定性。

用户评价 Ox Alpha 编程与推理表现
鹈鹕骑自行车 SVG 测试结果

但细看仍有脚没有踩在踏板上、车架结构不完整、身体与车把连接不合理等问题。更值得注意的是,max 档的推理字符与耗时显著上升,主要增加了云朵、太阳、头盔和速度线等装饰,核心结构却没有同比改善。

Ox Alpha 不同推理档位生成结果对比

这说明“更多推理”并不必然带来等比例质量提升。实际使用时,可以先用 low 或 high 完成多数任务,只在复杂规划、难定位的 Bug 或关键决策上启用最高档,并通过自动测试判断是否真的改善结果。

七、10 项任务拿到 80%:值得关注,但不能据此宣布击败 Fable 5

Ox Alpha 社区十项任务对比测试

另一组社区测试让 Ox Alpha 跑了 10 个任务,最终通过 8 个,得到 80% 的表面通过率;同一图表中,Fable 5 为 65%、GLM-5.3 与 Grok-4.6 为 62%、GPT-5.6 Sol 为 52%。

这个结果有参考意义,但证据强度有限:Ox Alpha 每项只测试一次,其他模型的运行次数不同;任务数量只有 10 个,提示词、推理预算、失败判定和工具环境也未必完全一致。更准确的结论是:Ox Alpha 展现出竞争力,值得扩大样本复测,而不是已经全面超过前沿模型。

Ox Alpha 与 Fable 5 等模型的通过率表格
社区评论 Ox Alpha 与 Fable 5 的表现
用户根据测试结果猜测 Ox Alpha 身份

八、Ox Alpha 到底是谁?四种猜测逐一拆解

猜测一:小米 MiMo V3

小米方向的猜测热度较高,原因包括发布时间接近、模型定位同样聚焦 Coding 与 Agent,以及小米过去曾通过 OpenRouter 匿名测试模型。不过,这些都只是行为与产品路线上的相似性,并非技术证据。

社区猜测 Ox Alpha 可能来自小米 MiMo

猜测二:腾讯混元 HY 4

另一派认为,大规模免费调用需要雄厚的推理基础设施,腾讯具备相应条件,也可能希望在正式发布前收集真实 Agent 数据。但目前没有 OpenRouter、腾讯或独立评测机构确认二者存在关联。

社区猜测 Ox Alpha 可能来自腾讯混元
关于腾讯混元身份猜测的讨论

猜测三:Google Gemini 系列

百万上下文和视频输入容易让人联想到 Gemini,但这些能力正在被更多模型采用。让模型“自报家门”也不能作为证据:系统提示、训练数据和上下文都可能诱导它生成不同身份。

Ox Alpha 自称 Gemini 的社区截图

猜测四:智谱 GLM-5.3

智谱方向的推测主要来自分词模式、API 指纹和输出风格的相似性。有人声称在多组提示与对抗字符串测试中,Ox Alpha 与 GLM-5.3 的匹配度更高。这类“模型指纹”比单纯自述更有价值,但仍不足以确认归属。

社区根据分词器和 API 指纹猜测 Ox Alpha 与 GLM 系列有关

九、匿名模型正在改变大模型发布方式

传统发布流程是先公布品牌和技术报告,再展示 Benchmark,最后开放 API。Stealth Model 则反过来:先匿名进入真实环境,让开发者在没有品牌光环的情况下使用,再根据表现和反馈决定后续发布节奏。

这种机制能减少品牌先入为主,也能为模型厂商提供更接近生产环境的灰度测试;但用户要承担更高的不确定性,包括身份未知、能力波动、隐私条款和免费额度随时调整。

十、Ox Alpha 怎么用?建议从低风险任务开始

  1. 进入站内整理好的 OpenRouter 导航页面,再前往官方网站。
  2. 在模型页面搜索 stealth/ox-alpha,先用 Playground 做小任务测试。
  3. 准备 API Key 后,将模型 ID 接入兼容 OpenAI 接口的工具或自建 Agent。
  4. 先测试公开代码、个人实验项目和可回滚任务,不要直接提交敏感数据。
  5. 记录成功率、总耗时、Token、重试与人工接管次数,再决定是否进入生产工作流。

推荐的三类测试任务

  • 仓库理解:让模型梳理目录、依赖与关键数据流,不立即修改文件。
  • 受控修复:选择有自动测试的小型 Bug,限制可写目录和工具权限。
  • 多模态排错:提供界面截图和相关代码,检查它能否将视觉问题定位到组件与样式。

十一、延伸阅读:把一次热度变成可复用的评测方法

如果你关心 Fable 5 的传闻与稳定性,可继续阅读《Claude Fable 5.1灰度测试传闻升温》;想判断“某个 Skill 或新模型是否真的超过 Fable 5”,可参考J-Space 争议复盘;关于 Token 成本与模型选择,还可以查看Codex 与 Claude Fable 5 额度战五款 Agent 模型横评

结论:Ox Alpha 已确认的亮点是百万上下文、多模态输入、长输出、面向 Agent 的定位和预览期免费;社区测试显示它具备竞争力,但样本仍小,身份也未揭晓。现在最合适的做法不是押注它来自哪家公司,而是用可重复的真实任务测出它在你的工作流里是否稳定、是否省时间,以及失败时是否容易恢复。

常见问题(FAQ)

Ox Alpha 是什么模型?
Ox Alpha 是通过 OpenRouter 提供的匿名预览推理模型,模型 ID 为 stealth/ox-alpha,主要面向编程、长周期 Agent、复杂推理和多模态工作流。
Ox Alpha 现在免费吗?
OpenRouter 页面目前显示输入和输出价格均为零,但这是预览阶段状态,额度、速率与长期定价可能随时变化。
Ox Alpha 支持多长上下文?
官方页面显示上下文窗口为 1,048,576 Token,最大输出为 131,072 Token。
Ox Alpha 是小米、腾讯、Google 还是智谱的模型?
截至目前,模型提供商仍保持匿名。MiMo、混元、Gemini 和 GLM 等说法都来自社区推测,尚无官方确认。
Ox Alpha 适合直接用于生产环境吗?
建议先用于低风险、可回滚并带自动测试的任务。匿名预览模型存在身份、稳定性、定价和隐私不确定性,不宜提交敏感代码或个人数据。
0 点赞
0 收藏
分享
0 讨论
反馈
近期热门