2026年9月5日:OpenAI 正式发布 GPT-6 Astra:宣告迈入 AGI 时代,多项科研与安全基准近乎满分
【人工智能与前沿科技】 据财联社及 OpenAI 官方公告,OpenAI 于 9 月 4 日正式发布全新旗舰级模型 GPT-6 Astra。官方将其定义为“迄今为止全球最智能、且对齐程度最高”的 AI 综合系统,标志着通用人工智能(AGI)迈入全新发展阶段。该模型在 PC 端自主操作(Computer Use)、软件工程、网络安全、前沿科学研究及高阶专业工作流等领域均达当前全球最先进(SOTA)水平。
核心基准测试表现
1、高阶研究级数学(FrontierMath Tier 4)
在代表人类研究级数学能力的 FrontierMath Tier 4 基准测试中,Astra 取得 97.6%(部分测试达 98%) 的破纪录成绩,几乎全面“打穿”该高难度数学测评,并在测试期间协助推进了多项长期未解的数学难题研究。
2、抽象推理与陌生环境学习(ARC-AGI-3)
在强调无先验经验、自主建模与抽象推理的 ARC-AGI-3 评估中,Astra 凭借全新推理框架将得分从上一代 GPT-5.6 Sol 的 7.8% 暴增至 99.9%,在 96% 的测试关卡中动作效率超越人类中位数,达成人类对齐平权。
3、网络安全与漏洞利用(ExploitBench)
已知漏洞测试:在 ExploitBench 攻击测试中斩获 100% 满分(GPT-5.6 Sol 为 78.5%);
零日/新漏洞测试:在专门针对近期(6月至8月)最新公布漏洞的盲测中,Astra 的自主渗透成功率达到 39%,远超上一代 Sol 的 5.5%。
产业应用与能力跃迁维度
1、原生 PC 操作与自主 Agent 工作流
Astra 具备更高速、高精度的桌面控制能力(Computer Use),可自主跨浏览器、表格、专业软件执行多步骤复杂工作流(如自动化 QA 测试、电路设计、财务数据分析等),任务执行耗时较前代缩减近 47%。
2、工业级代码与对齐安全提升
在 Agentic Coding 场景下,Astra 能够构建代数世界模型并自主编写专用工具库,减少代码迭代成本。同时,在无生产环境安全防护的极端测试下,其越权或违规行为发生率为 0%,展现出极强的安全性与对齐水平。