OpenAI发布GPT-6 Astra:从"回答问题"到"直接干活",总裁称AGI时代已至

AI 驱动中国 月影 48 次阅读 0 条评论
分享 Q

美东时间9月3日,OpenAI正式发布新一代旗舰大模型GPT-6 Astra及Astra Pro,将其定义为"目前全球最智能、且对齐程度最高的模型"。发布会尾声,OpenAI总裁格雷格·布罗克曼(Greg Brockman)直言:"欢迎来到AGI时代。"这一表态引发行业广泛关注,也被视为OpenAI对通用人工智能(AGI)到来的一次高调宣示。

与此前以聊天、写作和问答为主的模型不同,Astra最核心的变化在于从"回答问题"转向"直接完成工作"。它不仅能生成文字和代码,还能自主操作电脑与浏览器,在多款软件中执行多步骤任务,最终交付可直接使用的文档、表格、演示文稿、网站乃至工程项目。

据OpenAI介绍,Astra在得州Stargate园区动用超过10万块GPU完成预训练,是公司迄今规模最大的训练项目之一,也是首款由前代模型深度参与训练监督的旗舰产品。

在多项基准测试中,Astra交出了亮眼的成绩单:

  • ARC-AGI-3(陌生环境推理):99.9%,上一代GPT-5.6 Sol仅为7.8%,实现十余倍的跃升。不过官方指出,该成绩是基于OpenAI的Responses API Harness框架运行所得,并非基础模型裸分,也未针对该测试进行专项优化。
  • FrontierMath Tier 4v2(高难数学):97.6%,显著高于Claude Fable 5.1的87.8%。
  • ExploitBench(漏洞利用):100%,上一代为78.5%。

此外,在计算机操作方面,Astra在OSWorld 2.0测试中得分72.6%(上一代65.7%),完成单项任务的平均时间从约75分钟缩短至40分钟,效率提升近47%。在编程领域,Terminal-Bench 4.0测试中Astra得分57.7%,同样领先于GPT-5.6 Sol的37.3%和Claude Fable 5.1的55.8%。

安全层面,Astra首次达到OpenAI内部的"关键"(Critical)网络安全能力门槛。在测试中,Astra发现并利用了两个此前未知的V8零日漏洞,OpenAI表示已向相关维护方披露。

与此同时,在"是否越界完成任务"的模拟测试中,未加生产安全护栏的GPT-5.6 Sol有48.2%的概率出现越界行为,而Astra为0%。这意味着Astra不仅更擅长发现漏洞,也更清楚哪些系统不能触碰。

不过,正是由于其网络安全能力触及最高风险等级,OpenAI并未全面开放Astra最强的安全相关功能,而是通过Daybreak计划先向经过筛选的企业组织提供,普通付费用户版本则增加了更严格的安全防护。

API定价方面,GPT-6 Astra为每百万输入Token 10美元、每百万输出Token 50美元,是GPT-5.6 Sol当前价格的2.5倍,与Claude Fable 5.1基本持平。OpenAI方面解释,单次调用虽然更贵,但由于Astra能以更少步骤完成工作、减少返工,完成任务的总成本反而可能下降。

开放计划上,Astra即日起先向"可信访问"(Trusted Access)和Daybreak网络安全项目中的有限企业组织开放,未来数日内将陆续覆盖ChatGPT Plus、Pro、Business、Enterprise订阅用户,并通过API和亚马逊AWS对外提供服务。

从各项指标来看,GPT-6 Astra在推理、编程、计算机操作和网络安全等领域确实实现了代际式跃升,尤其是从"对话式AI"向"任务执行式AI"的转变,标志着大模型能力边界的一次重要拓展。

不过,也有分析指出,Astra并非在所有维度全面碾压对手。在综合知识、创意写作等方面,各家模型各有千秋,行业竞争正在向精细化、场景化方向深化。至于"AGI时代"是否真正到来,正如布罗克曼本人所言——"可以留给外界自行判断"。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友