2026年9月5日:OpenAI 正式发布 GPT-6 Astra:宣告迈入 AGI 时代,多项科研与安全基准近乎满分

【人工智能与前沿科技】 据财联社及 OpenAI 官方公告,OpenAI 于 9 月 4 日正式发布全新旗舰级模型 GPT-6 Astra。官方将其定义为“迄今为止全球最智能、且对齐程度最高”的 AI 综合系统,标志着通用人工智能(AGI)迈入全新发展阶段。该模型在 PC 端自主操作(Computer Use)、软件工程、网络安全、前沿科学研究及高阶专业工作流等领域均达当前全球最先进(SOTA)水平。

核心基准测试表现

1、高阶研究级数学(FrontierMath Tier 4)

在代表人类研究级数学能力的 FrontierMath Tier 4 基准测试中,Astra 取得 97.6%(部分测试达 98%) 的破纪录成绩,几乎全面“打穿”该高难度数学测评,并在测试期间协助推进了多项长期未解的数学难题研究。

2、抽象推理与陌生环境学习(ARC-AGI-3)

在强调无先验经验、自主建模与抽象推理的 ARC-AGI-3 评估中,Astra 凭借全新推理框架将得分从上一代 GPT-5.6 Sol 的 7.8% 暴增至 99.9%,在 96% 的测试关卡中动作效率超越人类中位数,达成人类对齐平权。

3、网络安全与漏洞利用(ExploitBench)

已知漏洞测试:在 ExploitBench 攻击测试中斩获 100% 满分(GPT-5.6 Sol 为 78.5%);

零日/新漏洞测试:在专门针对近期(6月至8月)最新公布漏洞的盲测中,Astra 的自主渗透成功率达到 39%,远超上一代 Sol 的 5.5%。

产业应用与能力跃迁维度

1、原生 PC 操作与自主 Agent 工作流

Astra 具备更高速、高精度的桌面控制能力(Computer Use),可自主跨浏览器、表格、专业软件执行多步骤复杂工作流(如自动化 QA 测试、电路设计、财务数据分析等),任务执行耗时较前代缩减近 47%。

2、工业级代码与对齐安全提升

在 Agentic Coding 场景下,Astra 能够构建代数世界模型并自主编写专用工具库,减少代码迭代成本。同时,在无生产环境安全防护的极端测试下,其越权或违规行为发生率为 0%,展现出极强的安全性与对齐水平。

© 版权声明

相关文章