GPT-6 Astra正式发布 OpenAI宣布AGI时代开启 Computer Use能力全面升级

Ai资讯54分钟前更新 大国Ai
17 0 0

摘要

2026年9月4日,OpenAI正式发布GPT-6 Astra及GPT-6 Astra Pro两款旗舰模型。OpenAI总裁Greg Brockman在发布会上宣布“欢迎来到AGI时代”。GPT-6 Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过10万块GPU完成预训练,也是OpenAI首款由前代模型深度参与训练监督的旗舰产品。该模型在ARC-AGI-3测试中获得99.9%、FrontierMath Tier 4 v2获得97.6%、ExploitBench获得满分,基准测试成绩接近饱和。API定价为输入10美元、输出50美元每百万token。目前Astra已向ChatGPT Plus、Pro、Business和Enterprise用户开放,免费用户暂需等待。


GPT-6 Astra发布 OpenAI单方面宣布AGI时代开幕

北京时间2026年9月4日凌晨,OpenAI正式发布万众期待的GPT-6 Astra和GPT-6 Astra Pro。

GPT-6 Astra正式发布 OpenAI宣布AGI时代开启 Computer Use能力全面升级

OpenAI官方对GPT-6 Astra的定义是:世界上最智能、最协调的模型,为Computer Use(电脑操作)、Browser Use(浏览器使用)、软件工程、网络安全、科学和专业工作树立了新的标杆。

发布会最后,OpenAI总裁Greg Brockman直接甩下一句:”Welcome to the AGI era(欢迎来到AGI时代)。”

Brockman表示,他个人认为世界已经进入AGI时代——也就是人工智能系统的综合智力超越人类。再过几年,当我们回头追问AGI究竟诞生于何时,答案很可能就是现在,而Astra或许就是那个起点。

有趣的是,就在GPT-6发布的同时,Claude、Grok、Cursor等多个AI产品疑似出现服务降级或掉线,GitHub也显示DEGRADED状态,被网友调侃为“Astra启动后扫描互联网,把地球上的LLM全灭了”。

训练规模史上最大 超10万块GPU投入预训练

据介绍,Astra是OpenAI历史上规模最大的训练任务,在得克萨斯州Stargate园区动用超过10万块GPU完成了预训练。

更值得关注的是,Astra还是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。这种“老带新”的递归式自我改进(RSI)模式,被业界视为AI能力持续加速的重要信号。

GPT-6 API定价公布 输入10美元输出50美元

GPT-6 Astra的API定价正式公布:

  • 输入:10美元/百万token
  • 输出:50美元/百万token

这一价格相当于GPT-5.6 Sol标准模式(输入4美元、输出20美元)的2.5倍,与Anthropic刚刚发布的Claude Fable 5.1持平。

从定价对比表看,GPT-6 Astra标准模式与Claude Fable 5.1、Claude Mythos 5.1完全一致;Fast模式下GPT-6 Astra为输入20美元、输出100美元。

OpenAI对此的解释是:相比每百万token多少钱,真正有意义的指标是完成一项任务需要多少钱。Brockman在发布会上谈到,一个模型单次调用更贵,但如果能减少返工、用更少步骤完成整项工作,总成本反而可能更低。

事实上,Astra在完成同等任务时的耗时大幅缩短:在OSWorld 2.0离线测试中,Astra完成单项任务平均需要约40分钟,而GPT-5.6 Sol需要约75分钟,耗时减少约47%。

基准测试成绩接近饱和 三项高分尤其扎眼

GPT-6 Astra最核心的变化,是从“回答问题”继续向“直接完成工作”推进。它不只能生成文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最终交付可直接使用的文档、表格、演示文稿、网站甚至工程项目。

成绩单上,三项成绩尤其突出:

  • FrontierMath Tier 4 v2(研究级数学):97.6%(上一代GPT-5.6 Sol为83.0%)
  • ARC-AGI-3(陌生环境推理):99.9%(GPT-5.6 Sol仅为7.8%)
  • ExploitBench(漏洞利用):100%满分

ARC-AGI-3得分99.9% 但需要注意测试条件

ARC-AGI-3是一项专门考验大模型适应陌生环境能力的测试:不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。这个分数意味着,面对从未见过、也没有现成解法的问题,Astra已经表现出很强的自主探索和规则学习能力。

不过需要说明的是,这一成绩使用了OpenAI自研的Responses API Harness运行框架。OpenAI称该框架调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。

编程能力对比Claude Fable 5.1全面领先

编程是Astra的重点升级方向:

  • Terminal-Bench 4.0:Astra取得57.7%,超过Claude Fable 5.1的55.8%和GPT-5.6 Sol的37.3%
  • DeepSWE v1.1:Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%
  • FrontierCode 1.1 Main:Astra为53.3%,Sol为47.5%

不过在某些单项上差距并不大:Artificial Analysis Coding Agent Index v1.4中,Astra得分67.0,仍略低于Claude Opus 5的68.1。

数学与科学:GPQA Diamond达96%

数学和科学方面,Astra同样拉出高分:FrontierMath Tier 4 v2拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。

不过在Humanity’s Last Exam(带工具)上,Astra的57.2%仍低于Claude Fable 5.1的65.0%。

Computer Use能力质的飞跃 从KiCad画电路板到Blender建模

Astra把代码能力与Computer Use结合起来:不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。

OSWorld 2.0准确率72.6% 耗时减少47%

在直接考察电脑操作能力的OSWorld 2.0离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%,Claude Opus 5为70.2%。

在真实办公流程的AutomationBench上,Astra的成绩从Sol的18.1%大幅提高到41.4%,也超过了Claude Fable 5.1的31%。这项测试不仅看任务完成度,还同时呈现完成任务所需的API成本——Astra在不同成本设置下的成绩都明显优于Sol。

真实应用演示:画电路板、建3D房屋、做赛车游戏

在电子工程演示中,Astra直接进入KiCad,根据电子原理图完成PCB布局:自己放置元器件、规划位置、连接铜线,最终得到一块可进入制造流程的电路板。

另一个直观案例:Astra先在Blender中建立房屋模型,再导入Unreal Engine 5,生成一个可以自由行走的三维空间。整个工作跨越不同软件和文件格式,模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤衔接。OpenAI还展示了Astra制作赛车游戏等案例。

专业办公:PPT和表格可以直接交付

在专业办公场景,Astra可以根据企业已有模板制作演示文稿,延续原模板的版式、视觉风格和叙事结构,而不是只输出一堆等待人类排版的文字。

搜索任务效率:2分54秒 vs 人类5小时

Astra还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。其中儿科医生搜索任务Astra仅用时2分54秒,而人类完成相同任务大约需要5小时。

Brockman的判断是:只要模型足够擅长Computer Use,它就能像人一样直接操作屏幕、鼠标和键盘这些为人类设计的通用接口,不必等待每一款软件为AI重新开发API和专用通道。人类不需要一直告诉它下一步点哪里,只需交代目标和边界,再检查最后结果。

网络安全:ExploitBench满分 还发现两个V8零日漏洞

Astra最特殊的能力在于网络安全。它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。

能力变强之后,OpenAI专门测试了它会不会为了完成任务而越界。在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,而Astra为0%。也就是说,Astra不仅更会找漏洞,也更清楚哪些系统不能碰。

Codex同步更新:长任务可以接着做下去

Computer Use解决的是“怎么动手”,Codex泄露的更新内容解决的则是“怎么把一件事持续做完”。

过去任务超过上下文窗口后,Codex通常通过compaction压缩此前的信息,但压缩可能漏掉关键细节。使用Astra后,Codex可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出,即使某项信息没有写入摘要也可以回头找到。

Astra还可以一边工作一边向用户补问信息:与答案无关的部分不会停下来等回复,只有涉及重要选择时才会暂停等待确认。此外,OpenAI更新了Codex的Computer Use运行框架,在Mind2Web测试中,新框架与Astra组合后的任务完成速度是当前GPT-5.6 Sol体验的1.9倍。

首批企业实测:法律文件核对与游戏原型生成

Astra目前尚未大范围推送,但第一批企业测试已经开始。

法律AI平台Legora使用Astra一次核对了41份财务文件,几分钟内4个预先埋入的错误全部被找出,其中包括收入附注中一处50万英镑的差额。单看这项工作,Astra比上一代模型快了近40%;不过放到Legora所有智能体任务里平均算,提升约3%。

游戏公司Playco让Astra直接进入Unity和Godot做游戏:同一份灰盒底稿,它一次生成3个不同主题的可玩原型,大部分第一版就能跑起来。Playco反馈,人工修补的活少了一半,空间推理、参考图还原、游戏内UI等方面也比上一代强不少。

开放范围与免费用户

按官方消息,Astra将向ChatGPT Plus、Pro、Business和Enterprise用户开放;Astra Pro则提供给Pro、Business和Enterprise用户。普通免费用户暂时还需等待。

这就算AGI了吗?

回顾历史,当初GPT-4发布后,微软科学家Sebastien Bubeck发表论文称“GPT-4是AGI的早期火花”,其中设计了用LaTeX绘图包TiKZ画独角兽的任务。后来一路到GPT-5.4,虽然画得越来越精致,但终归还是“简笔画范畴”。而到了GPT-6,如果不说,已经完全看不出来是用代码画出来的——说它比“AGI的早期火花”发生了质变,确实不为过。

OpenAI已经把牌桌抬到了这里,接下来Anthropic何时出手,就非常值得期待了。

© 版权声明

相关文章

暂无评论

none
暂无评论...