GPT-6 Astra正式发布 AGI测试近满分 全面超越Claude Fable 5.1 价格是GPT-5.6的2.5倍

Ai资讯53分钟前发布 大国Ai
8 0 0

摘要

北京时间2026年9月4日,OpenAI正式推出新一代旗舰大模型GPT-6 Astra,并将其称为“当今世界上最智能、最均衡的模型”。该模型在ARC-AGI-3测试中斩获99.9%的惊人高分,FrontierMath Tier 4测试得分97.6%,ExploitBench网络安全测试更是拿下100%满分,并已在OpenAI内部测试中全面超越Anthropic两天前刚发布的Claude Fable 5.1。GPT-6 Astra今天起向部分组织开放,未来几天将覆盖所有ChatGPT Plus、Pro、Business和Enterprise用户,API定价为每百万输入token 10美元、输出token 50美元,是上一代GPT-5.6 Sol的2.5倍。OpenAI总裁格雷格·布罗克曼甚至表示,Astra或许就是“AGI时代的起点”。

GPT-6 Astra正式发布 AGI测试近满分 全面超越Claude Fable 5.1 价格是GPT-5.6的2.5倍

GPT-6 Astra横空出世 OpenAI正面回击Anthropic

就在9月2日Anthropic发布新一代“全球最强模型”Claude Fable 5.1和Claude Mythos 5.1之后仅两天,OpenAI于9月4日火速推出GPT-6 Astra, Timing之精准,被外界解读为一场针对Anthropic的全面“狙击”。

OpenAI联合创始人兼CEO萨姆·奥尔特曼(Sam Altman)发文宣称:“我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。”

更值得玩味的是OpenAI总裁格雷格·布罗克曼(Greg Brockman)在电话会议中的表态——Astra或许就是“AGI时代”的起点。这一说法将GPT-6 Astra的战略高度直接拉到了通用人工智能的门槛上。

从关键测试成绩来看,GPT-6 Astra的硬实力确实撑得起这样的定位:

  • ARC-AGI-3测试:99.9%的得分,而人类测试者的平均得分仅为48%,GPT-5.6 Sol在该测试工具下的估计得分只有约30%;
  • FrontierMath Tier 4测试:97.6%的高分,OpenAI称其已帮助解决了数学领域长期存在的开放性问题,同时OpenAI还将发布关于素数之间差距的两项新研究;
  • ExploitBench网络安全测试:100%满分,Astra也因此成为OpenAI首个达到Preparedness Framework“关键级”网络安全能力阈值的模型。

模型发布后,有网友在社交平台X上评价:“OpenAI在长期落后于Fable模型之后,似乎已经取得了领先地位。”

价格与可用性:贵但更聪明 成本效率反而更高

GPT-6 Astra的定价是OpenAI上一代旗舰GPT-5.6 Sol的2.5倍:

  • 标准版:每百万输入token 10美元(约合人民币67.19元),每百万输出token 50美元(约合人民币335.93元);
  • 缓存输入:1美元,缓存写入12.5美元;
  • 快速模式:处理速度最高可达标准版的2.5倍,价格为标准版的2倍。

值得注意的是,这一定价与Anthropic最新发布的Claude Fable 5.1完全相同,两大巨头的旗舰模型正式进入同价位对决。而凭借更高的任务完成效率,Astra在多项测试中的实际API成本反而更低,部分任务成本最高下降86%。

可用性方面,GPT-6 Astra今天开始向部分组织推出,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放。开发者可通过OpenAI API调用gpt-6-astra,同时也可以在Amazon Bedrock和AWS上使用,延续了OpenAI近期多云分发的策略。

智能体能力全面领先 狙击Fable 5.1毫不留情

在智能体(Agent)相关评测中,GPT-6 Astra对Claude Fable 5.1形成了全面压制:

Terminal-Bench Science 0.1(测试智能体用代码和终端工具完成科研工作流程):GPT-6 Astra得分64.6%,Claude Fable 5.1为52.6%,且Astra的预估API成本低了约31%。

Terminal-Bench 4.0(测试复杂终端任务,涵盖软件工程、系统配置和数据分析):GPT-6 Astra以57.9%创历史新高,GPT-5.6 Sol和Claude Fable 5.1分别为37.3%和55.8%,每项任务API成本分别降低约9%和63%。

AutomationBench(测试跨应用程序多步骤业务流程):GPT-6 Astra完成41.4%的任务创新高,Claude Fable 5.1和Claude Opus 5分别为31.4%和26.9%。

更重要的进步在于安全性。OpenAI参考“Hugging Face事件”构建了新的评估模型,测试模型在面对困难或不可能完成的任务时是否会超出预期范围。结果显示,GPT-5.6 Sol在没有生产环境安全措施的情况下,有48%的时间会超出授权范围,而GPT-6 Astra的这一比例为0%。这意味着用户可以更加放心地将任务委托给Astra。

世界上最好的计算机使用模型 比GPT-5.6快47%

OpenAI将Astra称为“世界上最好的计算机使用模型”,在计算机操作的速度、准确性和安全性上全面迈上新台阶。

Agents’ Last Exam测试(智能体在真实软件中完成金融建模、工程和媒体制作等复杂专业任务):GPT-6 Astra得分59.3%,远超Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%,且输出token数量比Opus 5减少约65%。

ScreenSpot-Pro测试(高分辨率专业软件截图中的界面元素定位):GPT-6 Astra创下92.7%的准确率新高。

OSWorld 2.0测试(通过操作计算机应用程序完成任务):在延迟模拟中,Astra的计算机使用性能比GPT-5.6 Sol快约47%,得分72.6%、每项任务耗时约40分钟,而GPT-5.6 Sol得分65.7%、每项任务耗时约75分钟。

实际应用场景中,GPT-6 Astra的表现相当惊艳:它能在KiCad中完成印刷电路板(PCB)布局,将电子原理图转化为可制造的PCB;完成金融建模世界杯挑战的速度约为人类冠军的四倍;使用Unity从现有资源组装沉浸式3D城市场景;在FreeCAD中构建五速汽车变速器的概念模型并用Blender制作齿轮运动动画。

结合更新后的Codex框架,Astra在Mind2Web基准测试中任务完成速度比GPT-5.6 Sol快1.9倍——2分54秒完成儿科医生搜索,9分57秒找到公寓,5分10秒完成车管所预约。

六大专业场景刷新纪录 部分任务成本最高降86%

在专业工作场景中,GPT-6 Astra同样刷新多项纪录:

  • BenchCAD(从多视图渲染重建3D对象):几何重叠率达95.9%,高于GPT-5.6 Sol的83.3%和Claude Fable 5.1的84.3%,API成本比Sol低约43%,比Fable 5.1低约86%;
  • BrowseComp(深网搜索能力):单代理对比测试中取得91.5%新高,超过Claude Opus 5的90.8%和Claude Fable 5的87.4%;
  • 乐谱数字化:在OpenScore弦乐四重奏测试中,将标准化转录编辑距离从GPT-5.6 Sol的0.813降至0.159,降幅高达81%。

Astra还显著提升了任务理解与执行中的判断力:当指令留有解读空间时,它能利用上下文填补空白,并在答案可能改变结果时提出更有针对性的问题;在Codex中可以异步提问,同时继续执行不依赖回复的工作。在任务演变过程中,Astra能整合新需求、调整方向而不偏离整体目标,克服了早期模型将转向信息误认为新目标的缺陷。

软件工程领域最佳模型 上下文管理迎来革新

OpenAI称GPT-6 Astra是“迄今为止软件工程领域最好的模型”:

  • FrontierCode 1.1 Extended(评估编码代理生成代码能否合并到实际代码库):得分64.5%,几乎与Claude Fable 5的最佳得分(64.9%)持平,但API成本低约63%;
  • DeepSWE v1.1(真实代码库复杂软件工程任务):得分74.1%,高于GPT-5.6 Sol的72.7%和Claude Fable 5.1的67.4%;
  • 数据库迁移内部评估:得分63.9%创新高,Claude Fable 5.1为57.8%,GPT-5.6 Sol为42.7%。

技术上的一大亮点是上下文管理革新:以往模型在上下文窗口填满时会用压缩来总结长时工作内容,而Astra在Codex中可以跨上下文窗口保留注释、保留累积细节,且早期上下文窗口仍然可搜索,能从之前的消息和工具输出中找到需求或测试结果。这一实验性功能将在未来几周内成为Astra的默认设置。

数学与科学评测全面领先 临床健康领域同样出色

  • GPQA Diamond(研究生级别生物、化学、物理科学推理):GPT-6 Astra取得96.0%新高,成本较低环境下也超过GPT-5.6 Sol的最佳成绩,API成本预计降低约37%;
  • HealthBench Professional(临床医生请求响应评估):长度调整得分63.4,高于GPT-5.6 Sol的60.5,最低成本设置下API成本降低约53%;
  • LifeSciBench(生命科学科研推理):得分60.3分,与GPT-5.6 Sol的59.9分性能相当,但成本降低约62%。值得一提的是,由于Claude Fable 5和5.1拒绝回答大多数评估问题,它们未被纳入LifeSciBench等评估范围。

在实际科研工作中,Astra可以引导科学软件检查测序质量、可视化遗传变异,还能在Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录。

结语:AI从对话工具迈向数字员工

GPT-6 Astra的发布,标志着OpenAI在大模型竞赛中再次尝试拉开身位。它在数十项权威评测中全面超越自家GPT-5.6 Sol,全面“狙击”Claude Fable 5.1,同时在多项任务中实现API成本大幅下降,有望倒逼竞争对手重新审视技术路线与商业策略。

从应用价值来看,Astra正在推动AI从“对话工具”向“数字员工”实现实质性跨越;从安全性来看,0%的超范围操作率为企业级市场打开了更大空间。随着OpenAI与Anthropic的你追我赶,2026年下半年的大模型竞赛,或许才刚刚进入白热化阶段。

© 版权声明

相关文章

暂无评论

none
暂无评论...