从99.9% ARC-AGI-3、Critical级网络安全到每百万Token 10/50美元:一次看懂Astra的能力、价格、开放范围与“AGI”争议
OpenAI正式发布下一代旗舰模型GPT-6 Astra。它面向复杂推理、软件工程、计算机操作、科学研究和专业办公,官方给出的模型规格包括105万Token上下文窗口、最高12.8万Token输出,以及网页搜索、文件搜索、Hosted Shell、Computer Use、MCP和Skills等工具支持。
但“模型很强”和“人类已经进入AGI时代”不是同一个结论。OpenAI把Astra称为其最智能、对齐程度最高的模型;公司高管在发布活动中表达了对AGI里程碑的个人判断。由于AGI没有全球统一的定义和单一认证标准,本文将把可核验的产品事实、官方评测与观点性判断分开说明。


GPT-6 Astra是什么?先看6个确定信息
- 定位:OpenAI当前面向高难度端到端工作的旗舰模型。
- 重点能力:复杂推理、编程、浏览、计算机操作、研究和文档生产。
- 上下文:1,050,000 Token,最大输出128,000 Token。
- API价格:输入10美元、缓存输入1美元、输出50美元/百万Token。
- 接入方式:ChatGPT分批开放,并通过OpenAI API和AWS提供。
- 安全等级:成为OpenAI首个达到网络安全Critical能力阈值的广泛部署模型。
想查看完整规格、API示例和使用步骤,可进入本站整理的GPT-6 Astra导航与使用教程。


跑分接近“饱和”,但不等于所有真实任务都已解决
OpenAI公布的重点结果包括ARC-AGI-3达到99.9%、FrontierMath Tier 4约98%、ExploitBench达到100%。这些成绩说明Astra在陌生互动任务、高难数学和网络安全评测上取得明显跃升,也表明传统榜单越来越难拉开顶级模型差距。
阅读基准成绩时仍需注意三个边界:第一,成绩依赖具体评测版本、工具配置和推理预算;第二,接近满分可能意味着测试集需要升级,不代表现实世界问题已经“全部解决”;第三,模型在受控任务中的能力无法自动转化为法律、医疗、金融或安全场景中的可靠决策。





编程升级:重点从“写代码”转向“完成工程”
Astra被定位为端到端软件工程模型。官方数据中,Terminal-Bench 4.0为57.7%,DeepSWE v1.1为74.1%,内部数据库迁移任务也比前代明显提升。更重要的变化并不只是单次代码生成,而是它能在终端、代码库、测试系统和外部工具之间持续推进任务。
在长任务中,模型需要记住早期决策、失败尝试、用户约束与工具输出。Astra强化了跨上下文的信息管理,可以保存关键笔记并在需要时检索历史。这类能力会直接影响大型重构、迁移、调试和多代理协作的稳定性。





计算机使用成为Astra最关键的代际升级
GPT-6 Astra能够通过工具操作浏览器、桌面应用和专业软件。OpenAI展示了它在KiCad中完成PCB布局、填写税表、整理法律文件、制作Power BI报表和执行网站前端QA等任务。
在Agents’ Last Exam中,Astra获得59.3%;OSWorld 2.0中从上一代的65.7%提升到72.6%,官方演示的平均任务时间也明显缩短。它的价值在于把语言推理与界面操作连接起来,让Agent不只给建议,还能在受控环境中执行工作流。
企业部署时仍应把权限控制放在首位。模型可以操作电脑,并不代表它应该默认拥有邮箱、支付、客户数据、生产服务器或删除权限。可靠的Agent系统需要最小权限、隔离环境、操作日志和关键动作人工确认。






文档、表格、PPT和CAD:从回答问题走向交付成果
Astra接受了面向专业环境的针对性训练,可以生成结构化文档、电子表格、演示文稿、网站和3D内容。在AutomationBench中,Astra达到41.4%;BenchCAD工具配置下达到95.9%的几何重合度。
对于真实团队,这种能力比普通聊天更接近生产环节:给定已有模板、品牌风格和业务数据,模型可以延续版式与叙事结构,并把多步骤任务组合成一次交付。实际使用时,最好先提供样例、受众、交付格式和验收标准,再让模型执行。








更会判断何时继续、何时询问
复杂Agent经常在两个极端之间摇摆:要么遇到细节就停下来问,降低效率;要么擅自扩大任务范围,带来风险。Astra强化了对用户意图和任务边界的判断:常规缺口可结合上下文补齐;足以改变结果的关键信息,则提出聚焦问题。
在Codex等异步环境中,模型还可以在等待答复时继续处理不依赖答案的部分。这个改进看似不如跑分醒目,却会显著影响长时间工程任务的体验。

首个Critical级网络安全模型,为什么需要分级开放?
OpenAI表示,Astra达到其Preparedness Framework中的网络安全Critical阈值:在合适工具和访问权限下,模型可能发现此前未知的安全缺陷,并发展新的利用方式。因此OpenAI加强了内部隔离、模型检查点加密、完整轨迹监控和上线前阻断式对齐评测。
这也解释了为什么最强能力没有立即无差别开放。Astra首先面向Trusted Access项目中的部分组织,ChatGPT Plus、Pro、Business、Enterprise与API访问将在随后数日逐步开放。涉及网络安全的高级能力还会受到更严格的资格、用途与监控限制。

价格与使用成本:单价高,任务成本要结合Token效率判断
| 项目 | 官方规格 |
|---|---|
| 输入 | 10美元/百万Token |
| 缓存输入 | 1美元/百万Token |
| 缓存写入 | 12.5美元/百万Token |
| 输出 | 50美元/百万Token |
| 长上下文 | 超过272K输入后整次请求采用更高费率 |
Astra的每Token单价显著高于轻量模型,但复杂任务的最终成本还取决于成功率、重试次数、工具调用和输出长度。批量分类、简单摘要或高频客服没有必要默认使用旗舰模型;跨系统Agent、复杂代码迁移和高价值研究更适合先小规模评测,再决定是否升级。
OpenAI真的宣布“AGI已经实现”了吗?
官方产品页面发布的是GPT-6 Astra及其能力、评测、安全和开放范围,并没有提供一个被学界与行业共同认可的“AGI认证”。发布活动中出现的“进入AGI时代”属于高管对模型能力拐点的判断,不能替代统一标准。
判断AGI至少涉及广泛任务迁移、持续学习、长期自主性、现实可靠性、安全边界和社会影响。Astra在多个基准中接近饱和,是重要的技术信号;但模型仍有可能犯错,也仍需要工具、权限、提示、监督和现实环境支持。更准确的表述是:Astra把通用Agent的能力边界向前推进了一大步。
普通用户和开发者怎么选?
- ChatGPT用户:等待账号分批开放,在复杂研究、编程和专业交付任务中使用Astra。
- API开发者:使用
gpt-6-astra和Responses API,从low或medium推理强度开始评测。 - 高频低成本任务:继续使用更便宜的模型,把Astra留给失败成本高、步骤多的工作。
- Agent系统:设置工具白名单、数据隔离、预算上限和高风险动作审批。
- 团队迁移:先建立真实任务评测集,再比较质量、延迟、Token消耗与总成本。
如果主要需求是日常对话与内容生产,可进入ChatGPT站内导航;需要端到端代码代理时,可查看Codex使用介绍。
结语:Astra最大的变化,是让模型更接近真正的工作执行者
GPT-6 Astra的意义不只在于数学和Agent榜单得分,而在于推理、长上下文、计算机操作、专业软件和工具调用开始形成统一工作流。它能够接收目标、进入软件环境、持续执行、处理反馈并交付成果。
这距离“无需监督的万能智能”仍有差距,但已经足以改变软件工程、研究、办公自动化和数字员工产品的设计方式。接下来真正值得观察的,是Astra在真实用户任务中的稳定性、单位任务成本、安全控制,以及分批开放后的长期表现。












