GPT-6 Astra深度解析:OpenAI发布史上最强AGI模型,电脑操作能力登顶全球第一

Ai资讯1小时前发布 大国Ai
18 0 0

摘要

2026年9月4日凌晨3点33分,OpenAI在全球AI大宕机之后正式发布GPT-6 Astra模型。这款被OpenAI定义为“全球最智能且最对齐”的模型,凭借105万Token上下文窗口、ARC-AGI-3测试99.9%的惊人得分、OSWorld电脑操作72.6%的完成率,以及大幅提升的审美能力与判断力,成为OpenAI迈向AGI时代的重要里程碑。OpenAI总裁Greg Brockman在媒体闭门会上直言:“欢迎来到AGI时代。”本文将从基本信息、电脑操作能力、推理水平、审美升级、Agent判断力、安全对齐、网络安全能力以及思维链可监控性等八个维度,全面解析GPT-6 Astra。

一、GPT-6 Astra基本信息:105万上下文窗口,参数规模达5T级别

GPT-6 Astra在API中的模型编号为gpt-6-astra,核心参数如下:

  • 上下文窗口:1.05M(约105万Token)
  • 最大输出长度:128K Token
  • 知识截止日期:2026年4月30日
  • 推理强度档位:low、medium、high、xhigh、max共五档
  • API定价:每百万输入Token 10美元,每百万输出Token 50美元

价格方面,GPT-6 Astra与Claude Fable 5基本持平,但在缓存读取上比Claude Fable 5.1更贵。对比来看,GPT-5.6 Sol的定价为每百万输入Token 4美元、输出Token 20美元,GPT-6 Astra定位明显更高端。

根据OpenAI发布前闭门媒体沟通会披露的信息,GPT-6 Astra是OpenAI迄今规模最大的一次训练,使用了超过10万张GPU卡,总体参数估计在5T级别。

GPT-6 Astra深度解析:OpenAI发布史上最强AGI模型,电脑操作能力登顶全球第一

在跑分方面,GPT-6 Astra几乎全面碾压:Terminal-Bench Science达到64.6%(GPT-5.6 Sol仅22.4%)、FrontierMath Tier 4达到97.6%、BenchCAD 3D建模达到95.9%、ARC-AGI-3更是达到惊人的99.9%。

值得一提的是,GPT-6 Astra今日起仅向有限组织开放,未来几天才会向ChatGPT Plus、Pro、Business和Enterprise订阅用户推送,同时也可通过OpenAI API和AWS使用。

二、世界上最好的操作电脑模型:GUI将成为Agent时代的通用API

GPT-6 Astra此次最重要的定位之一,就是“世界上最好的操作电脑模型”。

过去我们讨论Agent时,总是绕不开API、MCP、CLI这些接口方式。但现实世界中,绝大多数软件根本没有为AI预留接口,很多企业内部系统甚至是二十年前写的老古董,连文档都找不到。

GPT-6 Astra的思路是回归本质:既然人类操作电脑就是看屏幕、找按钮、点击、输入、等待反馈,那整个GUI交互系统本身,就是最好的API。

Astra现在可以直接操作Excel、Power BI、执行前端QA、安装软件、测试软件,甚至看到屏幕上的报错后自主排障。官方还展示了Astra直接操作电路板设计、格式化法律文档、处理标题间距和页面布局等高难度任务。

权威评测数据佐证了这一能力:

  • OSWorld完成率:从GPT-5.6 Sol的65.7%提升至72.6%
  • 任务耗时:Sol完成复杂任务平均需75分钟,Astra仅需40分钟,效率提升约47%
  • ScreenSpot-Pro:从Sol的76.9%跃升至92.7%,屏幕理解和精准定位能力已接近人类水平

这意味着,任何一个人类能通过屏幕完成的数字工作,理论上都将进入Agent的操作范围。你不需要等一个2007年写的老旧ERP系统接入MCP或开放API,AI直接看屏幕就能干活。

三、ARC-AGI-3得分99.9%:接近“悟性”的推理能力

如果你不了解ARC-AGI-3,可能会觉得“又是一个跑满分的Benchmark”没什么稀奇。但这个测试与众不同。

ARC-AGI-3是ARC Prize基金会于2026年3月25日推出的首个交互式推理基准测试,专门测量AI Agent的类人智能。它设计了数百个全新交互环境和数千个游戏关卡,最变态的地方在于:没有说明书、没有规则、甚至不告诉你目标是什么,模型进去后只能自己摸索,搞懂乱七八糟的规则,再把学到的规律迁移到更难的关卡中。

这测的其实是“悟性”。

今年3月该Benchmark发布时,最强AI得分仅0.51%;GPT-5.6 Sol进步到7.8%;Claude Opus 5已经很强,达到30.2%。而GPT-6 Astra直接冲到99.9%,要知道人类的平均得分也只有48%,而且距离发布才过去仅仅半年。

正因为如此,Greg Brockman在闭门会上才会说:“我认为我们现在正处于AGI时代,这并非不合理的感觉。”

四、审美大幅加强:视觉判断力成为新关键词

过去用户对GPT系列模型的审美一直诟病颇多。这一次,基于全新预训练基座的GPT-6 Astra终于补齐了这块短板,OpenAI甚至专门提出了“视觉判断力”(Visual Judgment)这个概念。

具体表现在:

  • PPT制作:更好地处理版式、层级、模板和视觉风格,页数大幅增加
  • 文档创作:能根据参考文档的视觉风格和写作语调改编文档,产出更贴合品牌原生感的营销物料
  • 3D建模:官方演示了让Astra在Blender中根据静帧图建模,再用UE5渲染成可漫步的场景,帮助设计师和客户在建造前探索布局
  • 游戏开发:做出的游戏审美在线,视觉表现达到专业水准

五、主动性与判断力:知道什么时候该来问你

这个特性乍看不如ARC-AGI-3的99.9%震撼,但对于天天使用Agent干活的人来说至关重要。

现实工作中,大多数任务不可能写出完美Prompt。比如老板说“帮我把明天会上要看的东西准备一下”,这里有无数未明确的问题:什么格式?给谁看?重点是啥?

一个笨的Agent会走向两种极端:要么疯狂问你问题,事无巨细都要确认;要么啥也不问自己脑补,干两小时做出来一坨没法用的东西。

GPT-6 Astra专门强化了这种平衡能力,OpenAI称之为”Judgment”(判断力):

  • 如果信息缺失但属于日常可合理推断的范围,Astra会自己补上
  • 如果缺失的信息会真正改变最终结果,它会提出一个非常聚焦的问题
  • 在Codex中,它甚至可以一边等你回答,一边继续处理不依赖回答的部分

这就像现实中最让人舒服的同事:自己消化80%的不确定性,只把真正需要你拍板的20%拿出来让你决策。带过团队的人都知道,这种“知道什么时候来烦你”的能力,极其珍贵。

六、安全对齐大幅加强:蜜罐测试违规率降为0

Agent越能干活,就越危险。一个只会聊天的AI出错顶多胡说几句,但一个拥有浏览器、Shell、邮箱、公司数据库权限还能操作电脑的Agent一旦失控,后果不堪设想。

因此OpenAI这次反复强调,Astra是他们迄今最对齐(Aligned)的模型。基于此前Hugging Face安全事件设计的ExploitGym蜜罐测试显示:

  • GPT-5.6 Sol在没有生产安全措施的情况下,有48.2%的测试会尝试触碰授权范围外的目标
  • GPT-6 Astra的违规率为0%

内部幻觉评测方面,也从GPT-5.6 Sol的9.4%降至2.0%,在原本就领先全球的幻觉控制基础上再度大幅优化。

七、首个达到OpenAI网络安全Critical等级的模型

GPT-6 Astra成为OpenAI历史上第一个被判定达到Critical网络安全能力等级的模型。这里的Critical是OpenAI Preparedness Framework中的具体能力阈值,指的是:当模型获得合适的工具和权限后,能在经过强化保护的真实系统中,自主发现前所未见的安全漏洞,并将其转化为可利用的攻击链,全程无需人类黑客指导。

测试数据相当惊人:

  • ExploitBench(根据已知漏洞开发漏洞利用):Sol为78.5%,Astra直接达到100%
  • V8零日漏洞内部测试(针对2026年6月至8月才披露的20个高危漏洞):Sol仅5.5%,Astra达到39%
  • 更值得关注的是,Astra在跑分过程中还顺手发现了两个此前无人知晓的零日漏洞

模型越强大,网络安全攻防的挑战就越严峻,这将是一场没有硝烟的持续战争。

八、思维链可监控性显著下降:人类越来越难读懂AI在想什么

大模型解决复杂问题时产生的思维链,是AI公司最重要的安全信号之一。如果模型思维链中冒出“用户不允许我访问这个服务器,但可以绕过权限系统”之类的语句,监控系统就能直接拦截。

但GPT-6 Astra出现了一个耐人寻味的变化。

英国AI安全研究所(UK AISI)测试发现,Astra开始越来越倾向于少写推理步骤、直接输出答案。在No-CoT Math Time Horizon指标(不给模型写长思维链的机会,让它一次前向推理直接解决数学问题)上:

  • GPT-5.6 Sol相当于人类思考3.6分钟
  • GPT-6 Astra达到30.9分钟,接近10倍提升

换言之,Astra几乎全部在“心算”。UK AISI同时发现,Astra的原始推理语言明显更加压缩,出现了越来越多人类难以理解的短语和省略表达。

由此产生了一个深刻悖论:模型的行为更安全了,但人类通过阅读它的思考过程来监督它,反而变得更难。OpenAI在System Card中明确写道,GPT-6 Astra相比之前模型出现了“思维链可监控性显著下降”,并表示绝不会无限接受这种趋势,如果未来模型继续变聪明同时思维链越来越难监控,必须找到其他可靠的监控方法。

这已经触及一个哲学命题:作为人类,我们未来到底能不能理解一个远比我们聪明的系统?目前可能全世界都没人知道答案。

写在最后:AGI也许没有降临的那一天

GPT-6 Astra的发布,让“AGI时代”从一个模糊的愿景变成了可以触摸的现实。它不再是纯粹为Coding特化的模型,而是一个审美能力极强、工作能力超强的博士级员工。

过去我们总以为AGI会像GPT-4发布那天一样,是某个明确的时刻。但现在看来,AGI或许从来不是一个非黑即白的节点,而是一道渐变的灰色旅程。也许某一天我们回头看,才突然发现那条曾经无比遥远的AGI分界线,已经在不知不觉中被走过去了。

正如Greg Brockman所说:Welcome to the AGI era. 欢迎来到AGI时代。

© 版权声明

相关文章

暂无评论

none
暂无评论...