暂无菜单项

GPT-6 Astra发布:105万上下文、计算机使用跃升,OpenAI真的宣布AGI了吗?

发布于
8

从99.9% ARC-AGI-3、Critical级网络安全到每百万Token 10/50美元:一次看懂Astra的能力、价格、开放范围与“AGI”争议

OpenAI正式发布下一代旗舰模型GPT-6 Astra。它面向复杂推理、软件工程、计算机操作、科学研究和专业办公,官方给出的模型规格包括105万Token上下文窗口、最高12.8万Token输出,以及网页搜索、文件搜索、Hosted Shell、Computer Use、MCP和Skills等工具支持。

但“模型很强”和“人类已经进入AGI时代”不是同一个结论。OpenAI把Astra称为其最智能、对齐程度最高的模型;公司高管在发布活动中表达了对AGI里程碑的个人判断。由于AGI没有全球统一的定义和单一认证标准,本文将把可核验的产品事实、官方评测与观点性判断分开说明。

GPT-6 Astra GPT-6 Astra正式发布
GPT-6 Astra正式发布
GPT-6 Astra OpenAI展示GPT-6 Astra的核心能力
OpenAI展示GPT-6 Astra的核心能力

GPT-6 Astra是什么?先看6个确定信息

  • 定位:OpenAI当前面向高难度端到端工作的旗舰模型。
  • 重点能力:复杂推理、编程、浏览、计算机操作、研究和文档生产。
  • 上下文:1,050,000 Token,最大输出128,000 Token。
  • API价格:输入10美元、缓存输入1美元、输出50美元/百万Token。
  • 接入方式:ChatGPT分批开放,并通过OpenAI API和AWS提供。
  • 安全等级:成为OpenAI首个达到网络安全Critical能力阈值的广泛部署模型。

想查看完整规格、API示例和使用步骤,可进入本站整理的GPT-6 Astra导航与使用教程

GPT-6 Astra GPT-6 Astra主要评测概览
GPT-6 Astra主要评测概览
GPT-6 Astra GPT-6 Astra版本与开放节奏说明
GPT-6 Astra版本与开放节奏说明

跑分接近“饱和”,但不等于所有真实任务都已解决

OpenAI公布的重点结果包括ARC-AGI-3达到99.9%、FrontierMath Tier 4约98%、ExploitBench达到100%。这些成绩说明Astra在陌生互动任务、高难数学和网络安全评测上取得明显跃升,也表明传统榜单越来越难拉开顶级模型差距。

阅读基准成绩时仍需注意三个边界:第一,成绩依赖具体评测版本、工具配置和推理预算;第二,接近满分可能意味着测试集需要升级,不代表现实世界问题已经“全部解决”;第三,模型在受控任务中的能力无法自动转化为法律、医疗、金融或安全场景中的可靠决策。

GPT-6 Astra Astra在多项推理基准上的表现
Astra在多项推理基准上的表现
GPT-6 Astra ARC-AGI-3测试结果
ARC-AGI-3测试结果
GPT-6 Astra Astra在陌生交互任务中的表现
Astra在陌生交互任务中的表现
GPT-6 Astra FrontierMath与科学推理评测
FrontierMath与科学推理评测
GPT-6 Astra GPT-6 Astra数学能力数据
GPT-6 Astra数学能力数据

编程升级:重点从“写代码”转向“完成工程”

Astra被定位为端到端软件工程模型。官方数据中,Terminal-Bench 4.0为57.7%,DeepSWE v1.1为74.1%,内部数据库迁移任务也比前代明显提升。更重要的变化并不只是单次代码生成,而是它能在终端、代码库、测试系统和外部工具之间持续推进任务。

在长任务中,模型需要记住早期决策、失败尝试、用户约束与工具输出。Astra强化了跨上下文的信息管理,可以保存关键笔记并在需要时检索历史。这类能力会直接影响大型重构、迁移、调试和多代理协作的稳定性。

GPT-6 Astra GPT-6 Astra软件工程评测
GPT-6 Astra软件工程评测
GPT-6 Astra Astra与其他模型的编程能力比较
Astra与其他模型的编程能力比较
GPT-6 Astra GPT-6 Astra长任务上下文管理
GPT-6 Astra长任务上下文管理
GPT-6 Astra 跨上下文笔记与检索机制
跨上下文笔记与检索机制
GPT-6 Astra Codex中的长流程编程能力
Codex中的长流程编程能力

计算机使用成为Astra最关键的代际升级

GPT-6 Astra能够通过工具操作浏览器、桌面应用和专业软件。OpenAI展示了它在KiCad中完成PCB布局、填写税表、整理法律文件、制作Power BI报表和执行网站前端QA等任务。

在Agents’ Last Exam中,Astra获得59.3%;OSWorld 2.0中从上一代的65.7%提升到72.6%,官方演示的平均任务时间也明显缩短。它的价值在于把语言推理与界面操作连接起来,让Agent不只给建议,还能在受控环境中执行工作流。

企业部署时仍应把权限控制放在首位。模型可以操作电脑,并不代表它应该默认拥有邮箱、支付、客户数据、生产服务器或删除权限。可靠的Agent系统需要最小权限、隔离环境、操作日志和关键动作人工确认。

GPT-6 Astra Astra计算机操作演示
Astra计算机操作演示
GPT-6 Astra GPT-6 Astra在专业软件中执行任务
GPT-6 Astra在专业软件中执行任务
GPT-6 Astra Astra自动完成PCB设计流程
Astra自动完成PCB设计流程
GPT-6 Astra Astra在KiCad中的操作演示
Astra在KiCad中的操作演示
GPT-6 Astra 计算机使用模型对比
计算机使用模型对比
GPT-6 Astra OSWorld 2.0与网页任务数据
OSWorld 2.0与网页任务数据

文档、表格、PPT和CAD:从回答问题走向交付成果

Astra接受了面向专业环境的针对性训练,可以生成结构化文档、电子表格、演示文稿、网站和3D内容。在AutomationBench中,Astra达到41.4%;BenchCAD工具配置下达到95.9%的几何重合度。

对于真实团队,这种能力比普通聊天更接近生产环节:给定已有模板、品牌风格和业务数据,模型可以延续版式与叙事结构,并把多步骤任务组合成一次交付。实际使用时,最好先提供样例、受众、交付格式和验收标准,再让模型执行。

GPT-6 Astra GPT-6 Astra专业办公任务
GPT-6 Astra专业办公任务
GPT-6 Astra Astra生成文档和表格的演示
Astra生成文档和表格的演示
GPT-6 Astra Astra生成演示文稿的动态效果
Astra生成演示文稿的动态效果
GPT-6 Astra AutomationBench与专业任务评测
AutomationBench与专业任务评测
GPT-6 Astra BenchCAD三维重建结果
BenchCAD三维重建结果
GPT-6 Astra Astra延续企业模板与视觉风格
Astra延续企业模板与视觉风格
GPT-6 Astra Astra构建网站和应用的演示
Astra构建网站和应用的演示
GPT-6 Astra Astra在Blender与Unreal Engine流程中的表现
Astra在Blender与Unreal Engine流程中的表现

更会判断何时继续、何时询问

复杂Agent经常在两个极端之间摇摆:要么遇到细节就停下来问,降低效率;要么擅自扩大任务范围,带来风险。Astra强化了对用户意图和任务边界的判断:常规缺口可结合上下文补齐;足以改变结果的关键信息,则提出聚焦问题。

在Codex等异步环境中,模型还可以在等待答复时继续处理不依赖答案的部分。这个改进看似不如跑分醒目,却会显著影响长时间工程任务的体验。

GPT-6 Astra GPT-6 Astra对任务边界和澄清问题的处理
GPT-6 Astra对任务边界和澄清问题的处理

首个Critical级网络安全模型,为什么需要分级开放?

OpenAI表示,Astra达到其Preparedness Framework中的网络安全Critical阈值:在合适工具和访问权限下,模型可能发现此前未知的安全缺陷,并发展新的利用方式。因此OpenAI加强了内部隔离、模型检查点加密、完整轨迹监控和上线前阻断式对齐评测。

这也解释了为什么最强能力没有立即无差别开放。Astra首先面向Trusted Access项目中的部分组织,ChatGPT Plus、Pro、Business、Enterprise与API访问将在随后数日逐步开放。涉及网络安全的高级能力还会受到更严格的资格、用途与监控限制。

GPT-6 Astra GPT-6 Astra安全能力与分级开放
GPT-6 Astra安全能力与分级开放

价格与使用成本:单价高,任务成本要结合Token效率判断

项目 官方规格
输入 10美元/百万Token
缓存输入 1美元/百万Token
缓存写入 12.5美元/百万Token
输出 50美元/百万Token
长上下文 超过272K输入后整次请求采用更高费率

Astra的每Token单价显著高于轻量模型,但复杂任务的最终成本还取决于成功率、重试次数、工具调用和输出长度。批量分类、简单摘要或高频客服没有必要默认使用旗舰模型;跨系统Agent、复杂代码迁移和高价值研究更适合先小规模评测,再决定是否升级。

OpenAI真的宣布“AGI已经实现”了吗?

官方产品页面发布的是GPT-6 Astra及其能力、评测、安全和开放范围,并没有提供一个被学界与行业共同认可的“AGI认证”。发布活动中出现的“进入AGI时代”属于高管对模型能力拐点的判断,不能替代统一标准。

判断AGI至少涉及广泛任务迁移、持续学习、长期自主性、现实可靠性、安全边界和社会影响。Astra在多个基准中接近饱和,是重要的技术信号;但模型仍有可能犯错,也仍需要工具、权限、提示、监督和现实环境支持。更准确的表述是:Astra把通用Agent的能力边界向前推进了一大步。

普通用户和开发者怎么选?

  • ChatGPT用户:等待账号分批开放,在复杂研究、编程和专业交付任务中使用Astra。
  • API开发者:使用gpt-6-astra和Responses API,从low或medium推理强度开始评测。
  • 高频低成本任务:继续使用更便宜的模型,把Astra留给失败成本高、步骤多的工作。
  • Agent系统:设置工具白名单、数据隔离、预算上限和高风险动作审批。
  • 团队迁移:先建立真实任务评测集,再比较质量、延迟、Token消耗与总成本。

如果主要需求是日常对话与内容生产,可进入ChatGPT站内导航;需要端到端代码代理时,可查看Codex使用介绍

结语:Astra最大的变化,是让模型更接近真正的工作执行者

GPT-6 Astra的意义不只在于数学和Agent榜单得分,而在于推理、长上下文、计算机操作、专业软件和工具调用开始形成统一工作流。它能够接收目标、进入软件环境、持续执行、处理反馈并交付成果。

这距离“无需监督的万能智能”仍有差距,但已经足以改变软件工程、研究、办公自动化和数字员工产品的设计方式。接下来真正值得观察的,是Astra在真实用户任务中的稳定性、单位任务成本、安全控制,以及分批开放后的长期表现。

常见问题(FAQ)

GPT-6 Astra什么时候开放?
OpenAI正在分批开放,首先面向Trusted Access组织,随后数日逐步向ChatGPT Plus、Pro、Business、Enterprise和API用户提供。
GPT-6 Astra API价格是多少?
标准文本价格为输入10美元、缓存输入1美元、缓存写入12.5美元、输出50美元/百万Token;长上下文、Batch、Flex和Fast模式适用不同费率。
GPT-6 Astra上下文窗口多大?
官方模型文档标注为1,050,000 Token上下文窗口,最大输出128,000 Token。
GPT-6 Astra支持哪些工具?
Responses API支持网页搜索、文件搜索、代码解释器、Hosted Shell、Apply Patch、Skills、Computer Use、MCP和Tool Search等工具。
GPT-6 Astra已经实现AGI了吗?
不能仅凭基准成绩作出这一结论。AGI没有统一认证标准;Astra代表通用Agent能力的重要跃升,但仍存在错误、权限、安全和现实可靠性问题。
GPT-6 Astra为什么限制网络安全能力?
Astra达到OpenAI Preparedness Framework的网络安全Critical阈值,因此需要更严格的访问分级、隔离、监控和使用限制。
什么时候应该选择GPT-6 Astra?
适合复杂推理、长流程编程、计算机操作、研究和专业交付;简单高频任务可优先选择成本更低的模型。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材