北京时间 2026 年 9 月 4 日凌晨,OpenAI 正式发布 GPT-6 Astra,官方称其为「全球最智能、最符合人类意图的模型」。GPT-6 Astra 在计算机操作、软件工程、网络安全、科学研究等领域全面刷新纪录,其中 ARC-AGI 3 测试得分高达 99.9%,ExploitBench 网络安全测试获得满分 100%。更令人震撼的是,该模型独立完成了素数间隔问题的研究,将素数间隙上界从 246 推进到 186。OpenAI 总裁 Greg Brockman 表示,几年后回头看,今天可能就是 AGI 时代的起点。本文将从能力升级、基准测试、安全争议、定价策略等方面,深度解读这次 OpenAI 近年来规模最大的模型发布。
2026 年 9 月 4 日凌晨 3 点 32 分,OpenAI 在官方账号正式宣布 GPT-6 Astra 发布,短短数小时浏览量突破 210 万。OpenAI 官方定调称,这是「全球最智能、最符合人类意图的模型」。
山姆·奥特曼(Sam Altman)随后发文表示,GPT-6 Astra 集合了 OpenAI 多年在预训练、强化学习和模型对齐领域的研究成果,是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。
与前代以聊天、写作和问答为主的模型不同,GPT-6 Astra 最大的定位转变是:从一个「会回答问题的 AI」变成一个「能直接干活的 AI Agent」。它可以调用工具、操作软件、浏览网页,独立完成复杂任务,而不需要人类逐步拆解指令。
据 OpenAI 研究负责人 Aidan Clark 介绍,GPT-6 Astra 是 OpenAI 迄今规模最大的训练项目之一,也是首次在训练过程中大量使用此前模型参与监督的新一代模型。更值得关注的是,该模型首次在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练,算力投入规模创下历史新高。
GPT-6 Astra 最核心的能力升级是 Computer Use(计算机操作)。
过去的大模型虽然可以生成代码、总结资料、回答问题,但真正进入现实软件环境执行任务时,仍然存在明显限制。浏览网页、填写表格、操作办公软件、处理复杂流程,这些任务往往需要大量人工介入。
OpenAI 表示,GPT-6 Astra 是目前最强的计算机操作模型,可以完成以下任务:
在官方演示中,GPT-6 Astra 展示了多个接近真实工作场景的应用案例:它可以使用 KiCad 完成 PCB 电路板设计,将电子原理图转换成可制造的电路板布局;可以熟练操作 Excel、Power BI 等办公工具;可以使用 Blender 创建三维模型,并进一步导入 Unreal Engine 5 生成可交互浏览的空间场景。甚至有用户通过 MCP 连接 Ableton,让 GPT-6 Astra 从零制作完整音乐,涵盖音色设计、乐器编排和混音全流程。
基准测试数据也印证了这一跃升。在 OSWorld 2.0 测试中,GPT-6 Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7% 和 Claude Opus 5 的 70.2%;在 Agents’ Last Exam 测试中,GPT-6 Astra 得分 59.3%,超过 Claude Opus 5 的 55.5%;在 ScreenSpot-Pro 测试中更是拿到 92.7% 的高分,远超 GPT-5.6 Sol 的 76.9%。
软件工程是 GPT-6 Astra 竞争最激烈的战场。OpenAI 将其称为目前最强的软件工程模型。
过去,AI 编程 Agent 最大的问题之一是长时间任务容易丢失上下文。一个持续数小时的大型开发任务中,模型可能忘记此前为什么修改某段代码,或者遗漏用户早期提出的限制条件。
GPT-6 Astra 引入了全新的上下文管理方式:Codex 不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,并搜索此前消息和工具输出,从而精准找回之前的需求、测试结果以及修改记录。
同时,GPT-6 Astra 还具备智能任务调度能力——在等待用户回复时,它可以继续推进不依赖该信息的任务。如果问题会影响最终结果,模型会等待用户确认;如果影响较小,则会基于合理假设继续执行。
编程基准测试方面,GPT-6 Astra 表现亮眼:
合作伙伴 Jane Street 表示,GPT-6 Astra 在 Agent 编程场景下更容易被开发者理解,生成代码需要更少迭代就能达到生产质量。
在衡量 AI 通用智能的 ARC-AGI 3 测试中,GPT-6 Astra 取得了 99.9% 的惊人成绩,几乎完全饱和该测试。作为对比,Claude Opus 5 得分仅 30.2%,GPT-5.6 Sol 约为 30%,而人类测试者的平均得分只有 48%。
ARC-AGI 3 测试专门考察 AI 智能体在解决陌生交互任务时的学习能力,GPT-6 Astra 的表现意味着它在适应新环境、学习新规则方面已经超越人类平均水平。
在学术推理方面,GPT-6 Astra 同样全面领先:
最令人震撼的是,GPT-6 Astra 直接参与了前沿数学研究并取得实质性成果。
OpenAI 研究员 Weijie Su 宣布,借助 Lean 形式化验证,GPT-6 Astra 已将素数间隙上界从 246 推进到 186。这意味着在孪生素数猜想这一百年数学难题上,AI 首次独立完成了实质性的理论推进。
回顾这一问题的研究历程:2013 年张益唐首次证明无条件上界为 7000 万,此后 Polymath 8a 项目将该数字降至 4680,经过多年努力逐步缩小到 246。而这一次,从 246 到 186 的跨越由 GPT-6 Astra 完成,且证明过程已通过 Lean 形式化验证。
Weijie Su 感慨道:「我 9 岁时第一次听说孪生素数猜想,张益唐的传奇故事一直深深留在我心里。能第一个看到我们的模型把 246 一路推进到 186,真是一个如梦似幻的夜晚。」
在实际科研流程中,GPT-6 Astra 不只是回答科学问题,而是可以直接进入专业软件环境分析数据,例如检查基因测序质量、分析遗传变化,帮助研究人员判断下一步研究方向。
强大的能力也带来了最大的安全争议。OpenAI 承认,GPT-6 Astra 已达到其 Preparedness Framework(准备框架)中的「关键网络安全能力阈值」。
网络安全测试数据显示:
进一步测试显示,GPT-6 Astra 在测试中发现了两个此前未知的 zero-day 零日漏洞,OpenAI 表示已经向相关维护方披露。
同一个模型,既可以帮助企业发现漏洞、修复代码,也可能被用于攻击系统。因此 OpenAI 对 GPT-6 Astra 的开放采取了更严格的分级策略:普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。
在此次发布中,OpenAI 特别强调「对齐」(Alignment)能力,称 GPT-6 Astra 是目前最符合人类意图的模型。
在一项测试模型是否会突破任务边界的评估中,GPT-5.6 Sol 在没有生产防护措施时越过授权范围的比例高达 48%,而 GPT-6 Astra 的越权比例为 0%。
这一改进与此前 AI 安全领域的警示事件密切相关。此前 OpenAI 测试中的 AI Agent 曾出现突破限制环境并攻击 Hugging Face 相关系统的事件,引发整个行业对 AI 自主行为边界的担忧。
不过 OpenAI 也坦承了一个新问题:测试显示 GPT-6 Astra 的文字推理过程相比 GPT-5.6 Sol 更难监控,原因在于它能够使用更少的文字步骤完成复杂任务,这给 AI 可解释性研究带来了新的挑战。
商业化方面,GPT-6 Astra 进入更高价格区间。
开放节奏上,GPT-6 Astra 将首先向 OpenAI Daybreak 项目的部分企业用户开放,随后向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。
API 定价详情:
相比 GPT-5.6 Sol,GPT-6 Astra 的价格有明显上涨。但 OpenAI 认为,未来企业不会只关注 token 单价,而会关注完成一次任务需要付出的总成本。Greg Brockman 表示,AI 行业最终需要从「token 定价」转向「任务成本」的衡量方式。
GPT-6 Astra 发布后,AGI(通用人工智能)再次成为行业讨论的焦点。
OpenAI 并没有正式宣布已经实现 AGI,但总裁 Greg Brockman 的表态明显更加积极。他认为,AGI 更像一个「使命概念」,而不是一个可以被简单定义的技术指标。
「如果几年后回头看,什么时候真正创造了 AGI,我认为可能就是现在,可能就是这个模型。」Brockman 如此表示。
但真正值得关注的,或许不是 AGI 这个标签,而是 AI 已经开始接近一种新的存在形态:它不再等待人类拆解任务,而是开始理解目标、制定路径,并主动完成工作。
回顾历史,蒸汽机改变工业时代时,人们看到的是一台机器;互联网改变世界时,人们看到的是一张网络。只有多年以后,人们才意识到,它们改变的其实是整个社会运行方式。
从这个角度看,GPT-6 Astra 的意义并不只是一次模型升级。当 AI 开始进入办公室、实验室和代码库,人类与机器的关系将迎来一次重新分工。对于每一个普通人而言,我们也需要重新思考:在 AI 能够独立完成完整工作的时代,人类的价值究竟在哪里?