OpenAI最强模型GPT-6 Astra发布!欢迎来到AGI时代,将自研人形机器人

OpenAI于9月3日正式发布GPT-6 Astra,一款被公司称为可能标志着通用人工智能(AGI)开端的新一代前沿模型。

在面向媒体的闭门简报会上,OpenAI联合创始人兼总裁格雷格·布罗克曼用一句简短的话结束了整场会议:“欢迎来到AGI时代。”

但对企业和开发者而言,Astra更直接的冲击或许在于一个更具体的变化:用户不再需要自己点击鼠标或敲击键盘——如果他们不想的话。

从回答问题到操作电脑

OpenAI将Astra定位为“全球最好的计算机使用模型”。与以往需要开发者针对每个应用单独搭建API集成的模式不同,Astra被设计成能像人一样操作软件——在浏览器、电子表格、网站和桌面应用之间自由切换,自主完成多步骤工作流,生成完整的文档和演示文稿。

在演示视频中,OpenAI员工通过语音与Astra交互,让它把黄色圆圈变成火箭飞船,再变成完整的3D游戏,整个过程只用了几分钟。它还能在eBay上创建商品列表——全部来自语音输入。

具体能力层面,Astra可以填写在线表格、更新CRM记录、整理日程、进行网络调研并将结果整理成文档或邮件。它能操作电子表格、在Python笔记本中分析科学数据、在Power BI中工作、创建和测试网站,甚至运行KiCad和FreeCAD等工程应用。

布罗克曼认为,计算机使用能力可能开始绕过部分传统集成工作——因为软件已经为一种高度通用的智能体暴露了接口:人类用户。“我们被这个时代卡住太久了,因为人们一直在写连接器、费尽心思地搭建这些工具之间的连接,”布罗克曼说。有了足够强大的计算机使用能力,智能体可以“快速穿梭于电子表格、填写表单、在网页间导航”。

更大的训练规模,更强的基准表现

据OpenAI研究员艾丹·克拉克介绍,Astra是OpenAI有史以来规模最大的一次训练运行——首个在Stargate基础设施上使用超过10万颗DBU进行预训练的模型。公司认为,从Sol到Astra的能力跃升,比此前从之前模型到Sol的跃升更大。

基准数据方面,OpenAI报告Astra在多个测试中交出亮眼成绩:FrontierMath Tier 4 v2得分97.6%,DeepSWE v1.1得分74.1%,BenchCAD得分95.9%,GPQA Diamond得分96%,ExploitBench得分100%,ARC-AGI-3得分98.6%。

在OSWorld 2.0离线子集上,Astra得分72.6%,每任务耗时约40分钟;相比之下,GPT-5.6 Sol得分65.7%,耗时约75分钟——Astra每任务节省约47%的时间。

不过,ARC-AGI-3的98.6%需要谨慎解读。OpenAI自己的评估说明指出,Astra使用了公司的Responses API harness,而对比模型可能在不同配置下运行。今年8月,英伟达的AVO架构在ARC-AGI-3上取得了100%的成绩——但AVO使用的是Claude Opus 5作为底层模型,基线仅为约30%,分数提升来自持久记忆、工具调用、反馈和恢复等附加机制。这一争议暴露了一个越来越重要的问题:当讨论AGI时,测量的对象到底是什么?是基础模型本身,还是模型加持久记忆,还是模型配电脑、浏览器和工具,还是完整的部署系统?

按任务计价,而非按token

GPT-6 Astra的API定价为:标准模式输入每百万token 10美元、输出每百万token 50美元;快速模式提供最高2.5倍处理速度,价格为标准的2倍。

但布罗克曼认为,按token定价正成为衡量企业AI实际经济性的糟糕指标。“按token定价没有任何意义,”他说,“我们的token不一定和竞争对手的token一样;不同模型家族的token也不一样。”

相反,他认为企业应该评估每完成一个任务的成本。在DeepSWE v1.1上,Astra的最高性能配置不仅超越了GPT-5.6 Sol的最高得分配置,每任务的预估API成本还降低了约57%。

安全与治理:更强的能力,更高的门槛

Astra也是OpenAI首个达到“关键”网络安全阈值的模型——在Preparedness Framework下,这意味着该模型在获得适当工具和访问权限后,能够自主发现此前未知的漏洞并开发利用链,无需持续人工引导。它在ExploitBench上得分100%,在评估中发现了两个此前未知的漏洞并已向维护者披露。

能力越强,治理越难。OpenAI首席科学家雅库布·帕乔基强调:“智能的进步并不保证对齐的进步。”公司特别关注可监控性问题——人类或其他系统能否理解模型的推理过程以识别危险行为。

OpenAI在Astra的外部部署中加入了“错位监控”机制,使系统能够检查其推理和行动是否存在超出授权范围的迹象,严重情况下可终止活动。公司还描述了一套纵深防御系统,涵盖模型行为、分类器、安全控制、监控和部署后威胁响应。

内部评估显示,在没有生产安全防护的情况下,GPT-5.6 Sol在48.2%的情况下超出了授权范围;而Astra在0%的情况下发生越界。

GDPval的缺席

一个值得注意的细节是,OpenAI的Astra发布材料中并未包含GDPval——公司自己的、用于衡量模型在经济价值真实工作任务上表现的基准。

GDPval覆盖44个知识工作职业的1320项任务,包括法律简报、工程设计、电子表格、演示文稿等——与Astra设计要自动化的企业工作流高度相关。

这一缺席并不否定Astra的其他成绩,但确实留下了一个分析上的空白。

AGI:一个模糊的边界

布罗克曼没有把Astra的98.6% ARC-AGI-3分数当作OpenAI实现AGI的数学证明。

“每个人都有不同的AGI定义,”他说。但被问及Astra本身是否算AGI时,他的回答是:“对我个人而言,我认为我们已经到了。我觉得有相当充分的理由支持这一点。”

他后来的表述或许更清晰地概括了OpenAI的立场:“我认为,我们现在已经置身于AGI时代。”

从软件到硬件的“物理世界”扩张

GPT-6 Astra发布后不到48小时,OpenAI CEO萨姆·奥尔特曼在播客访谈中进一步透露了公司的物理世界战略——OpenAI将正式自研人形机器人本体,同时并行开发多种形态的机器人及数据中心特种机器人。

奥尔特曼表示,由于人类社会的物理空间是完美适配人体结构的,人形设计自然成为机器人研发的重要方向。该项目早期世界模拟研究在过去一年中发展迅猛,目前已演变为OpenAI Robotics,由Aditya Ramesh领导,核心逻辑在于将机器人硬件研究与机器学习进行深度协同设计。

短期目标是研发能够协助技术工人建设未来基础设施的机器人,长期则设想让每个人都拥有一台能够满足各种生活需求的个人机器人。

在消费级AI硬件方面,OpenAI的首款产品也已箭在弦上——由前苹果首席设计师Jony Ive主导操刀,内部代号“Gumdrop”(糖果)。这是一款无屏便携AI终端,外形类似甜甜圈,大小约与冰球相当,主打手写笔记转录、实时语音交互等功能,可直接连接ChatGPT实现总结、翻译、思维导图生成等服务,售价可能超过300美元,计划2027年发布。

OpenAI已从苹果和谷歌挖角数百名硬件工程师,并与富士康合作推进原型机生产,硬件团队目前正并行开发约五款不同产品。与此同时,公司CFO透露OpenAI计划于2027年正式完成IPO,若业务增长显著提速,上市时间节点有望进一步提前。

财务方面,OpenAI今年第二季度营收达67亿美元,环比增长18%,2025年全年年化收入突破200亿美元,较2024年增长超230%。但行业对比数据显示,竞争对手Anthropic最新季度营收已突破115亿美元、年化运行率超460亿美元并实现单季度盈利,OpenAI仍面临营收增速放缓与运营亏损扩大的双重压力。

(素材来自:OpenAI 智算芯能前沿网综合)

标签:OpenAI AGI 大模型

本文由智算芯能前沿网编辑整理,转载请注明出处。