巅峰对决!GPT-6 Astra vs Claude Fable 5.1,谁才是地表最强大模型?

2026年9月的第一周,AI行业迎来了今年最激烈的一场旗舰大模型对决。

9月1日,Anthropic率先发布Claude Fable 5.1,定位“全球最先进的编程和知识工作模型”。两天后的9月3日,OpenAI推出GPT-6 Astra,OpenAI总裁Greg Brockman在发布会上宣告“欢迎来到AGI时代”。

两款模型API定价完全相同:每百万输入token 10美元、每百万输出token 50美元。但在相同的价格标签之下,性能表现却各有侧重。

核心参数速览

 
综合智能指数:Fable 5.1领先5分

在Artificial Analysis Intelligence Index上,GPT-6 Astra得分为61分,与GPT-5.6 Sol持平。Claude Fable 5.1(max with fallback)得分为66分,排名第一。两者分差为5分,Fable 5.1领先。

在BenchLM平台上,Fable 5.1以82.95/100的综合评分领先于Astra的81.05/100,但两者的90%置信区间存在重叠。

编程与智能体任务:各有所长

在Artificial Analysis Coding Agent Index中,GPT-6 Astra在Codex上得分67分,大致相当于Claude Opus 5和Fable 5的水平。而Fable 5.1在该指数上以70分领跑。

GPT-6 Astra在编程索引上的最大优势是成本效率——它只用了Fable 5三分之一的token就达到了相同分数,在最大推理设置下每任务成本约为Fable 5的一半。不过,Fable 5.1的缓存读取定价仅为0.25美元/百万token,是Astra(1美元/百万token)的四分之一,在长上下文、高缓存命中率的Agent工作流中具有显著的成本优势。

在智能体任务方面,BenchLM数据显示Claude Fable 5.1在公共智能体跑道上以78.7分领先GPT-6 Astra的70.3分。但在终端编程能力测试Terminal-Bench 4.0中,GPT-6 Astra得分57.7%,高于Fable 5.1的55.8%。在业务流程自动化测试Automation Bench中,Astra得分41.4%,同样高于Fable 5.1的31.4%。

科学研究能力:Astra全面占优

在衡量自主科学研究能力的Terminal-Bench Science 0.1基准上,GPT-6 Astra得分64.6%,显著高于Claude Fable 5.1的52.6%。Fable 5.1相较前代Fable 5已实现翻倍提升(从24.7%到52.6%),但Astra的领先幅度仍然明显。完成同等任务的估计API成本,Astra低约31%。

在高难度数学测试Frontier Math Tier4(v2)中,Astra取得了97.6%的成绩,Claude Fable 5.1为87.8%。

在ARC-AGI-3测试中——衡量模型在陌生环境中的抽象推理和学习能力——Astra拿到99.9%的接近满分成绩,而上一代GPT-5.6 Sol仅为7.8%。不过需要注意的是,ARC-AGI官方博客指出,99.9%的分数是通过OpenAI定制适配器实现的,默认测试框架下得分可能有所不同。

计算机操作与安全能力

在模拟计算机操作的OSWorld 2.0测试中,GPT-6 Astra得分72.6%,单任务平均时间从上一代的约75分钟缩短至40分钟。在Arena AI的AutomationBench中,Astra得分41.4%,Fable 5.1为31.4%。

在网络安全能力上,Astra是首个达到OpenAI“关键级”网络安全能力门槛的模型。它在ExploitBench上得分100%(GPT-5.6 Sol为78.5%),在ExploitGym上得分42.4%,在SRE-Bench二进制逆向工程上99.2%在四次尝试内完成。

延迟与吞吐量

在Artificial Analysis的实测中,GPT-6 Astra的输出速度为56.3 tokens/s,Claude Fable 5.1的输出速度为55.7 tokens/s,两者速度基本持平,均略低于行业平均水平(71 tokens/s)。

总结:如何选择

两款模型定价完全相同,但适用场景有明显差异:

选择GPT-6 Astra的场景:科学研究与数学推理任务(Terminal-Bench Science 0.1大幅领先、FrontierMath Tier4 97.6%对87.8%);计算机操作与GUI智能体任务(OSWorld 2.0 72.6%、AutomationBench 41.4%对31.4%);需要最强网络安全能力的场景(ExploitBench 100%);高难度抽象推理任务(ARC-AGI-3跃升至99.9%);对每任务成本敏感的场景(Astra每任务约$1.67,Fable约$3.70)。

选择Claude Fable 5.1的场景:长上下文、高缓存命中率的智能体工作流(缓存读取定价仅Astra的四分之一);需要最高综合智能水平的场景(智能指数66对61);编程与编码智能体任务(Coding Agent Index 70对67);对知识新鲜度要求较高(知识截止2026年6月);工具辅助的复杂推理任务(HLE with tools 65.0%对57.2%)。

(素材来自:OpenAI/Anthropic 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。