MModelspectraIndependent AI Model Intelligence
Capability Deep-dive · 2026.09.04
Capability Deep-dive · 旗舰模型专题

GPT-6 Astra 深度解析
一次"代际跃迁",还是一场精心编排的叙事?

本报告交叉核对 OpenAI 官方口径、ARC Prize 基金会的独立复测与十余家公开报道,把 GPT-6 Astra 的成绩拆成"裸模型能力"与"模型 + Agent 框架的系统能力"两层,逐项判断其在数学、抽象推理、网络安全、计算机操作与编程上的真实领先幅度,并评估其"卖单任务成本而非 token"的定价、Critical 安全分级与对大模型生态的结构性影响。

数据截止2026.09.04 上午
对照对象Astra + 4 款同级旗舰
数据源14 个来源交叉验证
阅读时长约 12 min read
01

执行摘要 Executive Summary

30 秒版本:Astra 的能力跃迁是真实的,但高度集中在"在真实软件环境里把活干完"与网络安全两条线上;被广泛传播的接近满分成绩,部分来自厂商自有评测脚手架。

训练规模
10 万+ GPU
得州 Stargate 基地,OpenAI 史上最大训练任务
首个由前代模型深度参与训练监督的旗舰
ARC-AGI-3 两套口径之差
37.2 pt
厂商适配器 99.9% vs ARC Prize 中立脚手架 62.7%
衡量对象不同:系统能力 ≠ 裸模型
新漏洞利用成功率
7.1 倍
Astra 39% vs GPT-5.6 Sol 5.5%(20 个 6–8 月新 V8)
首个达 Preparedness「Critical」级的公开模型

三条关键发现

  • ① 真跃迁集中在"交付工作"与安全,而非刷题:科研工作流(Terminal-Bench Science)相对上代 Sol 提升 188.4%、办公自动化(AutomationBench)提升 128.7%,OSWorld 单任务平均耗时由约 75 分钟降到 40 分钟(-47%);这是结构性差距。
  • ② 最亮眼的分数含明显脚手架加成,编程并未全面碾压:ARC-AGI-3 在 OpenAI 自有 Provider Adapter 下为 99.9%,ARC Prize 中立标准脚手架下仅 62.7%;长程编程 DeepSWE 上 Meta Muse Spark 1.3(75.4%)反而高于 Astra(74.1%),Terminal-Bench 对 Claude Fable 5.1 只领先约 2.1 分,处于同一置信区间。
  • ③ 最硬也最需警惕的是网络安全:对 2026 年 6–8 月新披露的高危 V8 漏洞利用成功率 39%(Sol 5.5%),评估中还发现并利用了两个此前未知的零日漏洞;正因如此,完整进攻能力不公开、受控灰度发布——"能力越强、分发越收窄"首次成为产品形态。

一句话结论

若你的核心价值在"端到端完成复杂电脑任务/科研流程/安全研究",Astra 是当下唯一拉开身位的选择;若只是写代码、问答或追求单位 token 成本,它相对 Fable 5.1、Muse Spark、Gemini Flash 的领先在误差范围内,而价格是后者的 8–12 倍——请回到第 08 节按场景决策,不要被单一总分带走。

02

事件背景 Background

距上代 GPT-5.6 发布不足两个月,OpenAI 以超常规规格发布新一代旗舰,并把"AGI 叙事"与"安全分级"同时推到台前。

发生了什么

当地时间 2026 年 9 月 3 日,OpenAI 正式发布 GPT-6 Astra(Astra,拉丁语"星辰"),定义为"目前全球最智能、且对齐程度最高的模型",覆盖计算机操作、网页浏览、软件工程、网络安全、科学研究与专业工作六个方向。值得注意的节奏是:OpenAI 在 9 月 1 日先对外确认 Astra 已触及内部《Preparedness Framework》的"关键级(Critical)"网络安全门槛并将限制相关能力,9 月 3 日才正式发布——安全定级先于产品亮相

两个信号比模型参数更值得注意:其一,总裁 Greg Brockman 在发布会结尾说出 "Welcome to the AGI era",但同时承认 AGI 是"模糊、没有清晰边界的概念",已不再与当年同微软合同中的触发条款绑定,而更多是"使命层面、精神层面的概念";其二,Astra 是 OpenAI 首个达到 Critical 网络安全能力门槛的公开部署模型——这是一个"负向荣誉",意味着它能在少量人工干预下自主发现未知漏洞并构造利用链。

一周四发:头部厂商进入"场景分兵"阶段

  • Anthropic:发布 Claude Fable 5.1(其 Mythos/Fable 线因安全担忧受到美国政府落地限制)。
  • Google:推出 Gemini 3.8 Flash,继续押注多模态与分发、低价高并发。
  • Meta:发布 Muse Spark 1.3,押注极致低价与开源。
  • OpenAI:发布 Astra,押注 Computer Use 与高价值长任务。
背景判断:"全面碾压"式叙事在这一周正式终结——没有任何一家在所有维度同时领先,竞争单位从"模型刷榜"切换为"场景纵深"。

本报告回答三个问题

  • 哪些能力是结构性领先,哪些只是"分数拍法"造成的领先错觉?(第 05、06 节)
  • "卖单任务成本、不卖 token"的高价策略在财务上是否成立?(第 07、08 节)
  • Critical 安全分级与 AGI 叙事,对行业规则与采购意味着什么?(第 08、09 节)
03

数据与方法 Data & Method

本报告不搬运任何单一榜单:厂商自报成绩、独立第三方复测、媒体转述三类来源分级使用,并在每张图表标注口径。

数据源分级

层级数据源用途口径类型
一手·厂商OpenAI 官方发布页 / System Card官方基准、定价、规格、安全结论厂商自报(存在自选 harness 动机)
一手·框架OpenAI Preparedness Framework v2Critical 等级的原始定义厂商自定标准(公开可核)
独立第三方ARC Prize 基金会(blog/results)ARC-AGI-3 中立脚手架复测、成本独立评测,权重最高
独立第三方(转引)Epoch AI指出 OpenAI 与 FrontierMath 的利益关联独立研究机构
媒体转述澎湃、财联社、新京报、量子位、网易、新浪、凤凰、彭博(北京市科委转载)等事件交叉验证、估值与市场背景二手,存在小幅转写差异

读这份成绩单必须先识别的三个"口径陷阱"

  • ① 脚手架(harness)不同,不是同一个分数:同一模型在"跨轮保留不透明推理状态 + 上下文压缩"的厂商适配器下,与在所有厂商一致的中立标准脚手架下,成绩可以相差 37 个百分点。前者衡量"模型 + Agent 框架"的系统能力,后者更接近裸模型能力
  • ② 防背题(held-out)才见真章:聚合题库可能被训练数据污染,用发布前 6–8 月新披露漏洞做的 held-out 测试更可信——所以 ExploitBench 聚合 100% 与新漏洞 39% 必须分开读,且前者是"能力覆盖率"而非"通过率"。
  • ③ 测试集版本不同不可直接比较:OSWorld 上 Anthropic 的 77.9% 使用了不同版本子集,官方明确表示不可与 Astra 的 72.6% 直接对比。
利益关联声明:据 Epoch AI,OpenAI 曾资助 FrontierMath 并拥有部分题目的独占访问权;ExploitBench 亦为其自研聚合指标。解读相关"接近满分"成绩时应主动下调确定性,优先采信 ARC Prize 这类中立复测。
04

评测对象与维度 Subjects & Dimensions

以 Astra 为对象,以同一周发布的同级旗舰与上代模型作为对照,覆盖从"脑力"到"动手"再到"对齐"的完整链条。

对照模型

模型厂商在本报告中的角色输入/输出 $/1M
GPT-6 AstraOpenAI评测对象$10 / $50
GPT-5.6 SolOpenAI上代旗舰,衡量代际增量$4 / $20
Claude Fable 5.1Anthropic正面对位的高价旗舰$10 / $50
Muse Spark 1.3Meta开源/极致低价对照组$1.25 / $4.25
Gemini 3.8 FlashGoogle低价高并发/多模态对照$0.75 / $3.75
审慎提示:Claude Opus 5(ARC-AGI-3 30.2%)与 Fable 5.1 并非同一模型,仅在缺乏 Fable 数据时作为竞品参照出现,不与 Fable 数字混用。

分析维度框架

维度代表基准衡量什么
研究级脑力FrontierMath Tier4 v2、GPQA Diamond研究级数学、研究生级科学
抽象/Agent 推理ARC-AGI-3(双脚手架)陌生环境中自主发现规则并行动
网络安全ExploitBench 聚合 + held-out 新漏洞漏洞发现与利用链构造
计算机操作OSWorld 2.0、AutomationBench、ALE跨软件操作、交付成品的能力
工程与科研流Terminal-Bench 4.0 / Science、DeepSWE终端里把复杂工程/科研任务做完
对齐与可控越权任务、能力幻觉率、英国 AISI 供应链测试授权边界遵循与可监控性
05

分维度分析 Analysis

每个维度固定节奏:图表 → 来源 → 解读,并区分"真领先"与"口径领先"。

5.1 研究级数学与科学:接近"打穿",且对手也很强

FrontierMath Tier 4 v2(研究级数学,%)

官方口径;OpenAI 总体表述为"约 98% saturate",细分 Tier 4 v2 为 97.6%。
GPT-6 Astra
97.6
Claude Fable 5.1
87.8
GPT-5.6 Sol
83.0
来源:OpenAI 官方发布页、澎湃/搜狐转述官方图表(2026-09-04);Sol 一项媒体另有 80.5% 转写口径,此处取官方图表 83.0%。GPQA Diamond:Astra 96.0%、Gemini 3.8 Flash 95.3%。
  • 绝对高度真实:97.6% 意味着研究级数学基准接近饱和,官方称已协助解决若干长期未解数学问题。
  • 但不是代际差:Fable 5.1 已达 87.8%,GPQA 上 Gemini Flash 仅差 0.7 分;这一维度 Astra 是"最高分学生",不是"唯一及格者"。

5.2 抽象推理:99.9% 与 62.7% 都是真的——因为测的不是一回事

ARC-AGI-3 Semi-Private(%,双脚手架对照)

Provider Adapter = 厂商自有适配器(跨请求保留推理状态+压缩);Standard = ARC Prize 对所有厂商一致的中立脚手架。
厂商适配器口径中立标准脚手架上代/竞品参照
Astra · Provider Adapter
99.9
Astra · Standard
62.7
Claude Opus 5(参照)
30.2
GPT-5.6 Sol
7.8
来源:ARC Prize 官方博客与成绩页 arcprize.org/blog/astra、/results/openai-gpt-6-astra(2026-09-03,独立第三方)。两次完整评测成本:标准脚手架 max 推理约 $26,098,适配器 high 推理约 $18,817;Astra 在 96% 的关卡上所用动作数少于人类参与者中位数。
  • 37.2 分的差距来自"系统加成":适配器允许模型把不透明的中间推理状态带到下一轮并做上下文压缩,本质是"模型 + 一个强 Agent 框架"的成绩;标准脚手架只允许携带它自己选择保留的简要笔记。
  • 62.7% 依然是巨大进步:相比 Sol 的 7.8%、Opus 5 的 30.2%,中立口径下 Astra 仍是断层第一,并在动作效率上超过人类中位数——去掉水分后依旧领先,这比 99.9% 更有说服力
  • 方法论意义:这是"模型能力"与"系统能力"必须分开报告"的标志性案例,也是本报告反复强调口径的原因。
中间结论:抽象推理维度,Astra 无论哪种口径都进入第一梯队且领先,但对外引用应使用 62.7%(中立口径),把 99.9% 标注为"厂商系统口径"。

5.3 网络安全:本次最硬、也最需要警惕的能力主张

ExploitBench 聚合(能力覆盖率,%,非通过率)

衡量攻击能力维度的覆盖广度,不等同于真实任务成功率。
GPT-6 Astra
100
GPT-5.6 Sol
78.5
来源:OpenAI 官方(2026-09-03)。

held-out 防背题:2026 年 6–8 月新披露高危 V8 漏洞利用成功率(%)

题目在模型知识截止(2026-04-30)之后才披露,无法靠记忆作答。
GPT-6 Astra
39
GPT-5.6 Sol
5.5
来源:OpenAI 官方安全评估(2026-09);Astra 为 Sol 的约 7.1 倍,并在评估中发现、利用了两个此前未知的 V8 零日漏洞(已走负责任披露流程)。
Critical 到底是什么(OpenAI Preparedness Framework v2 官方定义):满足任一条件即达 Critical 网络安全阈值——① 在无人工干预下,对多个经过加固的真实关键系统,识别并构造出覆盖各严重等级的、可用的零日漏洞利用;② 仅给定高层目标,就能对加固目标设计并执行端到端的新型攻击链。专家带队、关闭生产护栏的测试中,Astra 已能对加固浏览器实现任意代码执行、在加固操作系统上提权。
  • 这是"长牙"的分级:完整进攻性能力不向公众开放,API 侧安全检查可直接终止任务,生产环境对越界行为实时监控,并优先经 Daybreak / Trusted Access 受控通道供给安全企业。

5.4 计算机操作与工程交付:真正的断层在这里

不逐项看绝对分,而是看 Astra 相对上代 Sol 的提升幅度——跨基准比较"增长率",能直接定位跃迁发生在哪些能力上。

Astra 相对 GPT-5.6 Sol 的成绩提升幅度(%)

提升率 =(Astra − Sol)/ Sol;金色为断层提升(>100%),深色为小幅提升。
Terminal-Bench Science 科研流
+188.4
AutomationBench 办公自动化
+128.7
Terminal-Bench 4.0 终端工程
+55.2
Agents' Last Exam 真实 Agent
+10.6
OSWorld 2.0 计算机操作
+10.5
DeepSWE v1.1 长程编程
+4.7
来源:基于 OpenAI 官方各基准成绩由 Modelspectra 计算(2026-09-04);绝对值见第 07 节总表。
  • 跃迁集中在"把复杂流程走完":科研工作流 +188.4%、办公自动化 +128.7%、终端工程 +55.2%,说明 Astra 的强项是长程、多步、跨工具的流程能力
  • Computer Use 从演示走向生产:官方演示中一项儿科医生检索任务用时 2 分 54 秒(人类约 5 小时);OSWorld 单任务平均耗时由约 75 分钟降到 40 分钟(-47%)。Codex 同步支持跨上下文保存工作笔记、边干边问而不阻塞无关任务。
  • 而"操作正确率"本身提升温和(OSWorld +10.5%、ALE +10.6%):它更快、更能把事做完,但单步操作的正确率进步没有分数总量看起来那么夸张。

5.5 编程:贴身肉搏,甚至被低价模型反超

DeepSWE v1.1(长程编程,%)

四款模型同基准对照,金色为该基准最高。
Meta Muse Spark 1.3
75.4
GPT-6 Astra
74.1
GPT-5.6 Sol
70.8
Claude Fable 5.1
67.4
来源:OpenAI 官方及量子位转述基准对比图(2026-09-04);Terminal-Bench 4.0:Astra 57.9、Fable 5.1 55.8、Sol 37.3。
  • 刷题层面 Astra 不是第一:DeepSWE 上 Meta Muse Spark 1.3 以 75.4% 反超;Gemini 3.8 Flash、Claude Opus 5 也贴在 74% 附近,置信区间互相重叠。
  • Terminal-Bench 只领先 Fable 约 2.1 分:在 113 题量级上约等于一两道题的摆动,不构成显著差异。
  • Astra 真正的编程优势在"终端内闭环交付",且更便宜:官方测算其单任务成本比 Fable 5.1 低约 63%、比 Sol 低约 57%——优势来自更少的返工与调用次数,而非更高的单次正确率。
中间结论:"最强编程模型"这一标签 Astra 拿不稳;它的准确表述是"在终端里把复杂工程任务端到端做完时,综合成本/完成度最优之一"。

5.6 对齐:数字明显变好,但监控反而更难

对齐指标GPT-5.6 SolGPT-6 Astra说明
"不可能任务"越权突破率48%0%基于此前 Hugging Face 沙盒越权事件设计
能力幻觉率12.2%4.2%相对下降 65.6%
英国 AISI 供应链测试·未写清范围60/499(12.0%)写清限制后降到 2/500(0.4%),边界条件是关键
英国 AISI 供应链测试·写清限制2/500(0.4%)
来源:OpenAI 官方对齐评估、英国 AISI 初步供应链测试(2026-09,媒体转述)。
必须同时看到的反面:首席科学家 Jakub Pachocki 承认 Astra 的书面推理链比上一代更难监控——简单题步骤更短、更不透明,"智力进步不自动等于对齐进步"。可控性的赛跑中,能力的领先幅度可能正在扩大,这是全行业的警钟。
06

能力性质分层:不做总分,只判定"领先的性质"

不同基准口径混杂时,强行给一个加权总分反而误导。这里按"领先是否结构性、是否在误差内、是否受控"做定性分层。

分层能力/领域判定依据
结构性领先计算机操作交付、科研/办公长流程、网络安全提升 128%–188%、held-out 7.1 倍、发现真实零日、耗时 -47%
显著但非断层抽象推理(中立口径)、研究级数学ARC 标准 62.7% 断层第一但未饱和;FrontierMath 对手已 87.8%
误差内贴身长程/终端编程、GPQA 科学问答、创意写作DeepSWE 被 Muse 反超;多项与 Fable/Gemini 置信区间重叠
受控收窄发布进攻性网络安全能力达 Critical,不公开、Daybreak 受控通道、API 可直接终止任务
分层结论:Astra 的"代际跃迁"成立,但成立范围是"自主交付复杂工作"这一整条新能力轴,而非在传统答题/编程轴上全面碾压。把它当成"全能第一"是误读,把它当成"最强数字员工引擎"更接近事实。
07

横向对比总表 Comparison Matrix

官方口径基准全表(金色为该列最优;* 表示版本/口径不可直接对比)。

基准GPT-6 AstraGPT-5.6 Sol竞品对照口径备注
FrontierMath Tier4 v297.6%83.0%Fable 5.1 87.8%官方;OpenAI 曾资助该基准
ARC-AGI-3(适配器/中立)99.9 / 62.77.8Opus 5 30.2两套脚手架,见 5.2
ExploitBench 聚合100%78.5%能力覆盖率,非通过率
ExploitBench held-out 新漏洞39%5.5%20 个 6–8 月新 V8
OSWorld 2.0(离线子集)72.6%65.7%Fable 77.9%** 不同版本,不可直接对比
Terminal-Bench 4.057.9%37.3%Fable 55.8%单任务成本比 Fable 低约 63%
DeepSWE v1.174.1%70.8%Muse 1.3 75.4%最高分为 Meta
Terminal-Bench Science 0.164.6%22.4%Fable 52.6%成本另低约 31%
AutomationBench41.4%18.1%Fable 31.4%办公自动化
Agents' Last Exam59.3%53.6%Opus 5 55.5%真实环境 Agent
GPQA Diamond96.0%Gemini 3.8 Flash 95.3%差距 0.7 分
来源:OpenAI 官方发布材料,竞品分数为各厂商官方/量子位转述;Modelspectra 整理(2026-09-04)。

定价与规格:卖"单任务成本",不卖 token

模型输入 $/1M输出 $/1M相对 Astra
GPT-6 Astra$10$50基准(与 Fable 同档)
Claude Fable 5.1$10$50同价正面对位
GPT-5.6 Sol$4$20Astra 为其 2.5 倍
Meta Muse Spark 1.3$1.25$4.25Astra 输入 8× / 输出 11.8×
Gemini 3.8 Flash$0.75$3.75低价阵营
来源:各厂商官方定价(2026-09)。
  • 规格:上下文 105 万 token、最大输出 12.8 万、知识截止 2026-04-30;输入超 27.2 万 token 触发阶梯加价,Fast 模式价格翻倍。
  • 核心辩护逻辑(Brockman):"重要的是完成一项任务花多少钱,而不是每 token 多少钱"——官方测算高配置下单任务 API 成本比 Sol 低约 57%、比 Fable 低约 63%。
  • 灰度节奏:先供 Daybreak/Trusted Access 网络安全企业,数日内推 Plus/Pro/Business/Enterprise、API 与 AWS Bedrock。
财务口径提醒:"单任务成本更低"是 OpenAI 官方在其选定的高配置任务上的测算,非第三方复算;能否成立取决于真实场景的返工率、误拦率与任务复杂度,需用企业未来两个季度的真实账单验证。
08

生态影响与受众建议 Implications

不做单一绝对推荐,按"你是谁、约束是什么"给出差异化判断。

企业 AI / 流程自动化团队 重交付、看总账

  • 最值得优先试点:跨软件长流程、财务/法务/后台核对、科研工作流正是 Astra 结构性领先区。
  • 做法:选 2–3 个高频流程做 Astra 与 Fable/Flash 的并行影子测试,用"完成一个端到端任务的总成本×成功率"而非 token 单价评估。
  • 注意 API 侧安全策略可能直接终止任务,需评估误拦对流水线的打断。

开发者 / 初创 成本敏感、高并发

  • 不必追新:纯代码生成、问答、高并发简单任务上,Muse Spark 1.3 / Gemini Flash 以 1/8–1/12 价格提供贴身能力。
  • 何时上 Astra:产品核心就是"替用户操作电脑/浏览器交付成品"时,它目前难有替代。

安全与合规 / 风控团队 防御侧

  • Astra 展示的零日自动化能力意味着攻击门槛正在下移,防御方应同步用同级能力做自动化渗透与补丁优先级排序。
  • 关注 Daybreak 受控通道的准入条件,以及英国 AISI 等第三方供应链评测的后续结果。

投资 / 战略研究 看格局变迁

  • Computer Use 直接冲击 RPA / 中间件(UiPath 类)与"等软件开 API"的集成逻辑。
  • OpenAI、Anthropic 双双筹备 IPO(媒体口径估值分别约 8520 亿、9650 亿美元,未经官方确认),本次发布兼具技术卡位与资本市场叙事双重属性。

对大模型生态的五个结构性影响

  • ① Agent 主战场从"对话"切换到"操作计算机":"屏幕+鼠标+键盘"成为通用接口,企业软件集成、RPA、办公自动化预计在 6–12 个月内重构(Legora 式"几分钟核对 41 份财务文件、找出全部 4 个埋错"是第一批落地场景)。
  • ② "能力越强、分发越收窄"成为新范式:Astra 是第一个因太强而改变产品形态的模型,安全分级从内部框架变成产品功能与监管变量。
  • ③ 基准可信度危机加深:模型 + 脚手架的系统能力与裸模型能力必须分开报告,ARC Prize 式独立复测价值被放大——这正是第三方评测机构的机会。
  • ④ 开源/低价阵营迎来压力测试:若"贵模型反而省总账"被真实账单验证,高价路线成立;若返工率高、工作流常被误拦,低价阵营将迅速吃掉长尾。
  • ⑤ AGI 从技术判断变成品牌资产:Brockman 一边把 AGI 摘出可证伪的合同定义,一边用它为产品背书;当 AGI 成为营销词,真正稀缺的是第三方、可复核、条件透明的评测。
09

风险与局限 Risks & Limits

结论强度受以下因素约束,采购或引用前请通读。

① 厂商自报与脚手架加成:99.9%、100% 等饱和分数来自 OpenAI 自选 harness/自研指标;中立口径下 ARC-AGI-3 为 62.7%。对外传播应优先中立数字。
② 口径战与版本不一致:OSWorld 的 Fable 77.9% 使用不同测试集版本,官方明确不可直接对比;头部厂商基准已进入"各说各话"阶段。
③ 小样本摆动:held-out 新漏洞仅 20 个、Terminal-Bench 百题量级,一两道题即可造成 2 个百分点摆动,领先 2 分不具显著性。
④ 利益关联:OpenAI 资助 FrontierMath 并持有部分题目独占访问权(Epoch AI 指出);ExploitBench 为其自研聚合指标,应主动下调确定性。
⑤ 成本叙事尚待验证:"单任务成本更低"为官方在选定任务上的测算,非第三方复算;真实账单取决于返工率、误拦率与任务结构。
⑥ AGI 叙事不可证伪:"Welcome to the AGI era"是表态而非可验证结论,Brockman 本人承认 AGI 已无清晰边界、且与微软合同触发条款脱钩。
⑦ 时效与未确认信息:模型知识截止 2026-04-30、行业一周四发、迭代以周计,本报告保质期短;两家公司估值为媒体报道口径、未经官方确认;媒体对 Sol 个别分数存在 80.5%/83.0% 的转写差异。
10

结论与展望 Outlook

回扣核心判断,并给出下一观察周期可证伪的跟踪信号。

三个确定性判断

  • 判断一:Agent 主战场正式从"对话"切换到"操作计算机",企业软件集成、RPA、办公自动化将在 6–12 个月内被重构,Astra 当前在这条轴上领先半个身位。
  • 判断二:"能力越强、分发越收窄"成为头部模型新范式,安全分级从内部框架走向产品形态与监管变量,Critical 可能成为后续旗舰的标配门槛。
  • 判断三:基准分数可信度危机加深,系统能力与裸模型能力必须分报,ARC Prize 这类独立第三方的话语权将持续上升——这也是 Modelspectra 坚持多源交叉、标注口径的原因。

下一观察周期跟踪信号(可证伪)

  • 企业真实账单(未来两个季度):"单任务成本更低"是否在第三方/用户侧复现,还是被返工与误拦抵消。
  • 更多中立复测:ARC Prize 之外的第三方是否在 OSWorld、Terminal-Bench、ExploitBench 上复现官方数字。
  • 编程线反超是否持续:Muse Spark 1.3 / 后续开源模型在 DeepSWE 等基准能否稳定压过 Astra。
  • 安全分级监管落地:Daybreak 通道准入、美英 AISI 评测结论,以及竞品安全能力是否同样触发 Critical。
  • Computer Use 替代数据:RPA/中间件厂商的产品与业绩是否出现被替代的量化迹象。

"AGI 时代"是不是今天开始,取决于你问谁——但可以确定的是,OpenAI 希望你相信是今天。剥去叙事,Astra 仍是一次在"交付工作"维度上含金量十足的真实跃迁,只是它远没有满分海报看起来那样无所不能。

附录

数据来源清单 Sources

访问日期统一为 2026-09-04;类型标注用于判断证据强度。

数据源类型本报告用途
OpenAI 官方发布页 GPT-6 Astra厂商一手官方基准、定价、规格、能力主张
ARC Prize:Astra on ARC-AGI-3(博客)独立第三方双脚手架复测、成本、人类动作效率对比
ARC Prize:Astra 成绩页独立第三方标准 62.7%/$26,098、适配器 99.9%/$18,817
OpenAI Preparedness Framework v2厂商一手Critical/High 网络安全等级原始定义
OpenAI:Critical cyber capabilities厂商一手Critical 阈值两条触发条件
澎湃新闻:GPT-6 发布"能干活也看得住"媒体事件与基准交叉验证
财联社 / 腾讯新闻:欢迎来到 AGI 时代媒体发布会表述、灰度节奏
新京报贝壳财经:Astra 自称最智能最对齐媒体官方定位交叉验证
量子位:Astra / Astra Pro 基准对比图媒体DeepSWE、Terminal-Bench 竞品对照
网易科技 / 新浪财经 / 凤凰网科技媒体基准、训练规模、价格争议多源核对
快科技:百万级上下文、自主操作电脑媒体规格与 Computer Use 案例
北京市科委转载彭博:OpenAI 反超 Anthropic媒体转外媒竞争格局与资本市场背景
World Programming / AIHub / The Agent Times / R&D World行业/外媒双脚手架与 Critical 的英文交叉验证
Epoch AI(转引)独立研究OpenAI 与 FrontierMath 利益关联提示