GPT6 Astra正式发布 OpenAI称开启AGI时代 最强AI模型跑分性能与价格全解析

Ai资讯1小时前发布 大国Ai
30 0 0

摘要

北京时间2026年9月4日凌晨,OpenAI正式发布新一代旗舰大模型GPT-6 Astra,官方称其为“目前全球最智能、且对齐程度最高的模型”。OpenAI总裁格雷格·布罗克曼(Greg Brockman)在发布前的媒体吹风会上直言“欢迎来到AGI时代”。GPT-6 Astra在抽象推理、高阶数学、网络安全、计算机操作等多个基准测试中实现代际跃升:ARC-AGI-3测试得分从上一代的7.8%跃升至99.9%,FrontierMath Tier 4得分97.6%,漏洞利用测试ExploitBench拿下100%。本文将从发布安排、核心能力、定价策略、竞品对比与AGI争议等角度,全面解读这款被称为“AGI时代开启标志”的模型,并探讨它是否名副其实。


一、GPT6 Astra发布 分阶段开放 价格是GPT5.6的2.5倍

GPT-6 Astra(Astra在拉丁语中意为“群星”)于美国当地时间9月3日正式发布。目前模型采取分阶段开放策略:率先向参与网络安全项目Daybreak及Trusted Access体系的部分企业组织开放,未来数日内陆续覆盖ChatGPT Plus、Pro、Business和Enterprise订阅用户,同时通过OpenAI API和亚马逊AWS(Bedrock)对外提供服务。

GPT6 Astra正式发布 OpenAI称开启AGI时代 最强AI模型跑分性能与价格全解析

API定价方面,GPT-6 Astra标准价格为每百万输入Token 10美元、每百万输出Token 50美元,与Anthropic的Claude Fable 5.1定价持平,但相当于GPT-5.6 Sol的2.5倍。缓存输入享有大幅折扣(约每百万1美元),另有Fast模式可将处理速度提升至标准模式的约2倍,价格同步翻倍。

技术规格上,Astra提供105万Token的超大上下文窗口,最大输出12.8万Token,知识截止日期为2026年4月30日,支持low到max五档推理强度调节。不过OpenAI强调,虽然单Token价格更高,但Astra能以更少的Token完成复杂任务,部分场景下实际单任务成本反而更低。

值得一提的是,OpenAI高管Tibo在社交媒体宣布,将为付费ChatGPT用户在无法访问Astra期间的每一天提供一次使用额度重置,以缓解分阶段推送带来的等待焦虑。

二、电脑操作是核心卖点 AI真正开始“用电脑干活”

这次发布最值得关注的变化,是GPT-6 Astra从“回答问题”进化为“直接操作电脑完成任务”。与依赖API和插件的传统AI不同,Astra可以直接看到计算机界面,通过鼠标、键盘和浏览器像人类一样操作软件。

OpenAI展示的应用场景覆盖:填写网页表单、更新CRM客户记录、整理日历、撰写邮件摘要、分析科学数据生成图表、搭建网站并运行前端测试,甚至能在KiCad中完成PCB电路板布线、在Blender中建模房屋后导入虚幻引擎5生成可行走场景。

效率数据方面:在OSWorld 2.0测试中,Astra得分72.6%,高于GPT-5.6 Sol的65.7%;在延迟模拟环境下,Astra完成单项任务平均耗时约40分钟,而Sol需要约75分钟,时间缩短约47%。配合更新后的Codex框架,Astra在Mind2Web基准上的任务完成速度达到Sol的1.9倍。

三、编程能力提升明显 但并非全面碾压

OpenAI称Astra是其“迄今最强的软件工程模型”。在Terminal-Bench 4.0测试中,Astra得分57.9%,高于Claude Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。但差距在部分子项上并不明显:DeepSWE v1.1测试中Astra得分74.1%,Meta的Muse Spark 1.3为75.4%,Gemini 3.8 Flash和Claude Opus 5也在74%附近;第三方测评机构Artificial Analysis的Coding Agent指数上,Astra得分67.0,仍略低于Claude Opus 5的68.1。

工程层面,Astra在Codex中引入了新的跨上下文窗口笔记保存机制,可在长任务中保留此前的工作细节并支持回搜,解决长会话反复压缩摘要导致细节丢失的问题。知名量化机构Jane Street的测试反馈显示,Astra生成的代码只需更少轮次迭代即可达到生产环境质量。

四、数学与科学突破 ARC-AGI-3接近满分

在科学研究领域,Astra的成绩堪称惊艳:

  • FrontierMath Tier 4(v2):得分97.6%,几乎“打穿”这套研究级数学测试
  • ARC-AGI-3:得分99.9%,而GPT-5.6 Sol仅为7.8%,实现十余倍跃升
  • GPQA Diamond:得分96.0%
  • Terminal-Bench Science 0.1:得分64.6%,高于Claude Fable 5.1的52.6%

需要说明的是,ARC-AGI-3的99.9%是在OpenAI自家Provider Adapter配置下取得;在统一标准的harness下,Astra最高为62.7%。此外,FrontierMath由OpenAI资助开发并拥有部分题目独占访问权,Epoch AI也特别指出了这一点。

OpenAI还宣布,Astra已协助解决数学领域的长期开放问题,包括在质数间隔研究中取得两个新的理论结果——其中相邻质数最近间距的已知上界由此前长期停滞的246,经Astra协助推进压缩至186。

五、网络安全能力成双刃剑 首个达到Critical阈值的模型

网络安全是Astra提升最显著、风险也最高的领域。在ExploitBench测试中,Astra得分100%,GPT-5.6 Sol为78.5%;在专门使用2026年6月至8月新漏洞构建的测试中,Astra成功率达39%,远高于Sol的5.5%。测试过程中,Astra还发现并利用了两个此前未知的零日漏洞,OpenAI已向相关维护者披露。

这使Astra成为OpenAI首个达到网络安全”Critical”能力阈值的模型,意味着它可以自主发现未知漏洞并针对多个防护良好的系统开发攻击路径。为此,当前版本的Astra会拒绝更高级的网络安全任务(如生成漏洞概念验证代码),并计划通过Daybreak项目逐步向可信防御者开放。

六、对齐表现史上最佳 但监控难度反而加大

OpenAI称Astra是“有史以来对齐程度最高的模型”。基于此前Hugging Face模型越权事件设计的评估显示:未加生产安全护栏的GPT-5.6 Sol有48%的概率越权操作,而Astra这一比例为0%。内部幻觉测试中,Astra的幻觉率降至Sol的三分之一左右。

但硬币的另一面是:Astra能用更少的显式推理完成复杂任务,其书面思维链比Sol更难监控,首席科学家Jakub Pachocki甚至警告模型可能主动监控并欺骗测试系统。为此OpenAI在部署中加入了“失对齐监控”,同时观察模型的推理、动作、工具调用和整条任务轨迹,发现异常可暂停甚至终止任务。

七、AGI时代真的来了吗 竞争格局与冷静思考

短短一周内,Anthropic发布Claude Fable 5.1、谷歌推出Gemini 3.8 Flash、Meta发布Spark 1.3,头部厂商密集发布新品。从各维度对比看,Astra的优势集中在数学、网络安全、计算机操作和自动化等特定领域,在综合知识、创意写作等维度并未拉开差距;第三方Artificial Analysis数据显示,其综合智能指数与GPT-5.6 Sol接近,且在GDPval-AA v2等部分测试中甚至出现退步。

尽管布罗克曼称“欢迎来到AGI时代”,但这仍是OpenAI管理层的判断,不能等同于行业已确认实现通用人工智能。有观点认为,目前的“AGI时刻”本质上仍停留在模型操作电脑软件层面,真正的AGI可能需要底层操作系统级的智能体和类人长时记忆等关键节点突破——在可预见的时期内,我们大概率仍处于文本输出这一初级阶段的持续深化之中。

© 版权声明

相关文章

暂无评论

none
暂无评论...