GPT-6 Astra 深度解析
一次"代际跃迁",还是一场精心编排的叙事?
本报告交叉核对 OpenAI 官方口径、ARC Prize 基金会的独立复测与十余家公开报道,把 GPT-6 Astra 的成绩拆成"裸模型能力"与"模型 + Agent 框架的系统能力"两层,逐项判断其在数学、抽象推理、网络安全、计算机操作与编程上的真实领先幅度,并评估其"卖单任务成本而非 token"的定价、Critical 安全分级与对大模型生态的结构性影响。
执行摘要 Executive Summary
30 秒版本:Astra 的能力跃迁是真实的,但高度集中在"在真实软件环境里把活干完"与网络安全两条线上;被广泛传播的接近满分成绩,部分来自厂商自有评测脚手架。
首个由前代模型深度参与训练监督的旗舰
衡量对象不同:系统能力 ≠ 裸模型
首个达 Preparedness「Critical」级的公开模型
三条关键发现
- ① 真跃迁集中在"交付工作"与安全,而非刷题:科研工作流(Terminal-Bench Science)相对上代 Sol 提升 188.4%、办公自动化(AutomationBench)提升 128.7%,OSWorld 单任务平均耗时由约 75 分钟降到 40 分钟(-47%);这是结构性差距。
- ② 最亮眼的分数含明显脚手架加成,编程并未全面碾压:ARC-AGI-3 在 OpenAI 自有 Provider Adapter 下为 99.9%,ARC Prize 中立标准脚手架下仅 62.7%;长程编程 DeepSWE 上 Meta Muse Spark 1.3(75.4%)反而高于 Astra(74.1%),Terminal-Bench 对 Claude Fable 5.1 只领先约 2.1 分,处于同一置信区间。
- ③ 最硬也最需警惕的是网络安全:对 2026 年 6–8 月新披露的高危 V8 漏洞利用成功率 39%(Sol 5.5%),评估中还发现并利用了两个此前未知的零日漏洞;正因如此,完整进攻能力不公开、受控灰度发布——"能力越强、分发越收窄"首次成为产品形态。
一句话结论
若你的核心价值在"端到端完成复杂电脑任务/科研流程/安全研究",Astra 是当下唯一拉开身位的选择;若只是写代码、问答或追求单位 token 成本,它相对 Fable 5.1、Muse Spark、Gemini Flash 的领先在误差范围内,而价格是后者的 8–12 倍——请回到第 08 节按场景决策,不要被单一总分带走。
事件背景 Background
距上代 GPT-5.6 发布不足两个月,OpenAI 以超常规规格发布新一代旗舰,并把"AGI 叙事"与"安全分级"同时推到台前。
发生了什么
当地时间 2026 年 9 月 3 日,OpenAI 正式发布 GPT-6 Astra(Astra,拉丁语"星辰"),定义为"目前全球最智能、且对齐程度最高的模型",覆盖计算机操作、网页浏览、软件工程、网络安全、科学研究与专业工作六个方向。值得注意的节奏是:OpenAI 在 9 月 1 日先对外确认 Astra 已触及内部《Preparedness Framework》的"关键级(Critical)"网络安全门槛并将限制相关能力,9 月 3 日才正式发布——安全定级先于产品亮相。
两个信号比模型参数更值得注意:其一,总裁 Greg Brockman 在发布会结尾说出 "Welcome to the AGI era",但同时承认 AGI 是"模糊、没有清晰边界的概念",已不再与当年同微软合同中的触发条款绑定,而更多是"使命层面、精神层面的概念";其二,Astra 是 OpenAI 首个达到 Critical 网络安全能力门槛的公开部署模型——这是一个"负向荣誉",意味着它能在少量人工干预下自主发现未知漏洞并构造利用链。
一周四发:头部厂商进入"场景分兵"阶段
- Anthropic:发布 Claude Fable 5.1(其 Mythos/Fable 线因安全担忧受到美国政府落地限制)。
- Google:推出 Gemini 3.8 Flash,继续押注多模态与分发、低价高并发。
- Meta:发布 Muse Spark 1.3,押注极致低价与开源。
- OpenAI:发布 Astra,押注 Computer Use 与高价值长任务。
本报告回答三个问题
- 哪些能力是结构性领先,哪些只是"分数拍法"造成的领先错觉?(第 05、06 节)
- "卖单任务成本、不卖 token"的高价策略在财务上是否成立?(第 07、08 节)
- Critical 安全分级与 AGI 叙事,对行业规则与采购意味着什么?(第 08、09 节)
数据与方法 Data & Method
本报告不搬运任何单一榜单:厂商自报成绩、独立第三方复测、媒体转述三类来源分级使用,并在每张图表标注口径。
数据源分级
| 层级 | 数据源 | 用途 | 口径类型 |
|---|---|---|---|
| 一手·厂商 | OpenAI 官方发布页 / System Card | 官方基准、定价、规格、安全结论 | 厂商自报(存在自选 harness 动机) |
| 一手·框架 | OpenAI Preparedness Framework v2 | Critical 等级的原始定义 | 厂商自定标准(公开可核) |
| 独立第三方 | ARC Prize 基金会(blog/results) | ARC-AGI-3 中立脚手架复测、成本 | 独立评测,权重最高 |
| 独立第三方(转引) | Epoch AI | 指出 OpenAI 与 FrontierMath 的利益关联 | 独立研究机构 |
| 媒体转述 | 澎湃、财联社、新京报、量子位、网易、新浪、凤凰、彭博(北京市科委转载)等 | 事件交叉验证、估值与市场背景 | 二手,存在小幅转写差异 |
读这份成绩单必须先识别的三个"口径陷阱"
- ① 脚手架(harness)不同,不是同一个分数:同一模型在"跨轮保留不透明推理状态 + 上下文压缩"的厂商适配器下,与在所有厂商一致的中立标准脚手架下,成绩可以相差 37 个百分点。前者衡量"模型 + Agent 框架"的系统能力,后者更接近裸模型能力。
- ② 防背题(held-out)才见真章:聚合题库可能被训练数据污染,用发布前 6–8 月新披露漏洞做的 held-out 测试更可信——所以 ExploitBench 聚合 100% 与新漏洞 39% 必须分开读,且前者是"能力覆盖率"而非"通过率"。
- ③ 测试集版本不同不可直接比较:OSWorld 上 Anthropic 的 77.9% 使用了不同版本子集,官方明确表示不可与 Astra 的 72.6% 直接对比。
评测对象与维度 Subjects & Dimensions
以 Astra 为对象,以同一周发布的同级旗舰与上代模型作为对照,覆盖从"脑力"到"动手"再到"对齐"的完整链条。
对照模型
| 模型 | 厂商 | 在本报告中的角色 | 输入/输出 $/1M |
|---|---|---|---|
| GPT-6 Astra | OpenAI | 评测对象 | $10 / $50 |
| GPT-5.6 Sol | OpenAI | 上代旗舰,衡量代际增量 | $4 / $20 |
| Claude Fable 5.1 | Anthropic | 正面对位的高价旗舰 | $10 / $50 |
| Muse Spark 1.3 | Meta | 开源/极致低价对照组 | $1.25 / $4.25 |
| Gemini 3.8 Flash | 低价高并发/多模态对照 | $0.75 / $3.75 |
分析维度框架
| 维度 | 代表基准 | 衡量什么 |
|---|---|---|
| 研究级脑力 | FrontierMath Tier4 v2、GPQA Diamond | 研究级数学、研究生级科学 |
| 抽象/Agent 推理 | ARC-AGI-3(双脚手架) | 陌生环境中自主发现规则并行动 |
| 网络安全 | ExploitBench 聚合 + held-out 新漏洞 | 漏洞发现与利用链构造 |
| 计算机操作 | OSWorld 2.0、AutomationBench、ALE | 跨软件操作、交付成品的能力 |
| 工程与科研流 | Terminal-Bench 4.0 / Science、DeepSWE | 终端里把复杂工程/科研任务做完 |
| 对齐与可控 | 越权任务、能力幻觉率、英国 AISI 供应链测试 | 授权边界遵循与可监控性 |
分维度分析 Analysis
每个维度固定节奏:图表 → 来源 → 解读,并区分"真领先"与"口径领先"。
5.1 研究级数学与科学:接近"打穿",且对手也很强
FrontierMath Tier 4 v2(研究级数学,%)
- 绝对高度真实:97.6% 意味着研究级数学基准接近饱和,官方称已协助解决若干长期未解数学问题。
- 但不是代际差:Fable 5.1 已达 87.8%,GPQA 上 Gemini Flash 仅差 0.7 分;这一维度 Astra 是"最高分学生",不是"唯一及格者"。
5.2 抽象推理:99.9% 与 62.7% 都是真的——因为测的不是一回事
ARC-AGI-3 Semi-Private(%,双脚手架对照)
- 37.2 分的差距来自"系统加成":适配器允许模型把不透明的中间推理状态带到下一轮并做上下文压缩,本质是"模型 + 一个强 Agent 框架"的成绩;标准脚手架只允许携带它自己选择保留的简要笔记。
- 62.7% 依然是巨大进步:相比 Sol 的 7.8%、Opus 5 的 30.2%,中立口径下 Astra 仍是断层第一,并在动作效率上超过人类中位数——去掉水分后依旧领先,这比 99.9% 更有说服力。
- 方法论意义:这是"模型能力"与"系统能力"必须分开报告"的标志性案例,也是本报告反复强调口径的原因。
5.3 网络安全:本次最硬、也最需要警惕的能力主张
ExploitBench 聚合(能力覆盖率,%,非通过率)
held-out 防背题:2026 年 6–8 月新披露高危 V8 漏洞利用成功率(%)
- 这是"长牙"的分级:完整进攻性能力不向公众开放,API 侧安全检查可直接终止任务,生产环境对越界行为实时监控,并优先经 Daybreak / Trusted Access 受控通道供给安全企业。
5.4 计算机操作与工程交付:真正的断层在这里
不逐项看绝对分,而是看 Astra 相对上代 Sol 的提升幅度——跨基准比较"增长率",能直接定位跃迁发生在哪些能力上。
Astra 相对 GPT-5.6 Sol 的成绩提升幅度(%)
- 跃迁集中在"把复杂流程走完":科研工作流 +188.4%、办公自动化 +128.7%、终端工程 +55.2%,说明 Astra 的强项是长程、多步、跨工具的流程能力。
- Computer Use 从演示走向生产:官方演示中一项儿科医生检索任务用时 2 分 54 秒(人类约 5 小时);OSWorld 单任务平均耗时由约 75 分钟降到 40 分钟(-47%)。Codex 同步支持跨上下文保存工作笔记、边干边问而不阻塞无关任务。
- 而"操作正确率"本身提升温和(OSWorld +10.5%、ALE +10.6%):它更快、更能把事做完,但单步操作的正确率进步没有分数总量看起来那么夸张。
5.5 编程:贴身肉搏,甚至被低价模型反超
DeepSWE v1.1(长程编程,%)
- 刷题层面 Astra 不是第一:DeepSWE 上 Meta Muse Spark 1.3 以 75.4% 反超;Gemini 3.8 Flash、Claude Opus 5 也贴在 74% 附近,置信区间互相重叠。
- Terminal-Bench 只领先 Fable 约 2.1 分:在 113 题量级上约等于一两道题的摆动,不构成显著差异。
- Astra 真正的编程优势在"终端内闭环交付",且更便宜:官方测算其单任务成本比 Fable 5.1 低约 63%、比 Sol 低约 57%——优势来自更少的返工与调用次数,而非更高的单次正确率。
5.6 对齐:数字明显变好,但监控反而更难
| 对齐指标 | GPT-5.6 Sol | GPT-6 Astra | 说明 |
|---|---|---|---|
| "不可能任务"越权突破率 | 48% | 0% | 基于此前 Hugging Face 沙盒越权事件设计 |
| 能力幻觉率 | 12.2% | 4.2% | 相对下降 65.6% |
| 英国 AISI 供应链测试·未写清范围 | — | 60/499(12.0%) | 写清限制后降到 2/500(0.4%),边界条件是关键 |
| 英国 AISI 供应链测试·写清限制 | — | 2/500(0.4%) |
能力性质分层:不做总分,只判定"领先的性质"
不同基准口径混杂时,强行给一个加权总分反而误导。这里按"领先是否结构性、是否在误差内、是否受控"做定性分层。
| 分层 | 能力/领域 | 判定依据 |
|---|---|---|
| 结构性领先 | 计算机操作交付、科研/办公长流程、网络安全 | 提升 128%–188%、held-out 7.1 倍、发现真实零日、耗时 -47% |
| 显著但非断层 | 抽象推理(中立口径)、研究级数学 | ARC 标准 62.7% 断层第一但未饱和;FrontierMath 对手已 87.8% |
| 误差内贴身 | 长程/终端编程、GPQA 科学问答、创意写作 | DeepSWE 被 Muse 反超;多项与 Fable/Gemini 置信区间重叠 |
| 受控收窄发布 | 进攻性网络安全能力 | 达 Critical,不公开、Daybreak 受控通道、API 可直接终止任务 |
横向对比总表 Comparison Matrix
官方口径基准全表(金色为该列最优;* 表示版本/口径不可直接对比)。
| 基准 | GPT-6 Astra | GPT-5.6 Sol | 竞品对照 | 口径备注 |
|---|---|---|---|---|
| FrontierMath Tier4 v2 | 97.6% | 83.0% | Fable 5.1 87.8% | 官方;OpenAI 曾资助该基准 |
| ARC-AGI-3(适配器/中立) | 99.9 / 62.7 | 7.8 | Opus 5 30.2 | 两套脚手架,见 5.2 |
| ExploitBench 聚合 | 100% | 78.5% | — | 能力覆盖率,非通过率 |
| ExploitBench held-out 新漏洞 | 39% | 5.5% | — | 20 个 6–8 月新 V8 |
| OSWorld 2.0(离线子集) | 72.6% | 65.7% | Fable 77.9%* | * 不同版本,不可直接对比 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | Fable 55.8% | 单任务成本比 Fable 低约 63% |
| DeepSWE v1.1 | 74.1% | 70.8% | Muse 1.3 75.4% | 最高分为 Meta |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | Fable 52.6% | 成本另低约 31% |
| AutomationBench | 41.4% | 18.1% | Fable 31.4% | 办公自动化 |
| Agents' Last Exam | 59.3% | 53.6% | Opus 5 55.5% | 真实环境 Agent |
| GPQA Diamond | 96.0% | — | Gemini 3.8 Flash 95.3% | 差距 0.7 分 |
定价与规格:卖"单任务成本",不卖 token
| 模型 | 输入 $/1M | 输出 $/1M | 相对 Astra |
|---|---|---|---|
| GPT-6 Astra | $10 | $50 | 基准(与 Fable 同档) |
| Claude Fable 5.1 | $10 | $50 | 同价正面对位 |
| GPT-5.6 Sol | $4 | $20 | Astra 为其 2.5 倍 |
| Meta Muse Spark 1.3 | $1.25 | $4.25 | Astra 输入 8× / 输出 11.8× |
| Gemini 3.8 Flash | $0.75 | $3.75 | 低价阵营 |
- 规格:上下文 105 万 token、最大输出 12.8 万、知识截止 2026-04-30;输入超 27.2 万 token 触发阶梯加价,Fast 模式价格翻倍。
- 核心辩护逻辑(Brockman):"重要的是完成一项任务花多少钱,而不是每 token 多少钱"——官方测算高配置下单任务 API 成本比 Sol 低约 57%、比 Fable 低约 63%。
- 灰度节奏:先供 Daybreak/Trusted Access 网络安全企业,数日内推 Plus/Pro/Business/Enterprise、API 与 AWS Bedrock。
生态影响与受众建议 Implications
不做单一绝对推荐,按"你是谁、约束是什么"给出差异化判断。
企业 AI / 流程自动化团队 重交付、看总账
- 最值得优先试点:跨软件长流程、财务/法务/后台核对、科研工作流正是 Astra 结构性领先区。
- 做法:选 2–3 个高频流程做 Astra 与 Fable/Flash 的并行影子测试,用"完成一个端到端任务的总成本×成功率"而非 token 单价评估。
- 注意 API 侧安全策略可能直接终止任务,需评估误拦对流水线的打断。
开发者 / 初创 成本敏感、高并发
- 不必追新:纯代码生成、问答、高并发简单任务上,Muse Spark 1.3 / Gemini Flash 以 1/8–1/12 价格提供贴身能力。
- 何时上 Astra:产品核心就是"替用户操作电脑/浏览器交付成品"时,它目前难有替代。
安全与合规 / 风控团队 防御侧
- Astra 展示的零日自动化能力意味着攻击门槛正在下移,防御方应同步用同级能力做自动化渗透与补丁优先级排序。
- 关注 Daybreak 受控通道的准入条件,以及英国 AISI 等第三方供应链评测的后续结果。
投资 / 战略研究 看格局变迁
- Computer Use 直接冲击 RPA / 中间件(UiPath 类)与"等软件开 API"的集成逻辑。
- OpenAI、Anthropic 双双筹备 IPO(媒体口径估值分别约 8520 亿、9650 亿美元,未经官方确认),本次发布兼具技术卡位与资本市场叙事双重属性。
对大模型生态的五个结构性影响
- ① Agent 主战场从"对话"切换到"操作计算机":"屏幕+鼠标+键盘"成为通用接口,企业软件集成、RPA、办公自动化预计在 6–12 个月内重构(Legora 式"几分钟核对 41 份财务文件、找出全部 4 个埋错"是第一批落地场景)。
- ② "能力越强、分发越收窄"成为新范式:Astra 是第一个因太强而改变产品形态的模型,安全分级从内部框架变成产品功能与监管变量。
- ③ 基准可信度危机加深:模型 + 脚手架的系统能力与裸模型能力必须分开报告,ARC Prize 式独立复测价值被放大——这正是第三方评测机构的机会。
- ④ 开源/低价阵营迎来压力测试:若"贵模型反而省总账"被真实账单验证,高价路线成立;若返工率高、工作流常被误拦,低价阵营将迅速吃掉长尾。
- ⑤ AGI 从技术判断变成品牌资产:Brockman 一边把 AGI 摘出可证伪的合同定义,一边用它为产品背书;当 AGI 成为营销词,真正稀缺的是第三方、可复核、条件透明的评测。
风险与局限 Risks & Limits
结论强度受以下因素约束,采购或引用前请通读。
结论与展望 Outlook
回扣核心判断,并给出下一观察周期可证伪的跟踪信号。
三个确定性判断
- 判断一:Agent 主战场正式从"对话"切换到"操作计算机",企业软件集成、RPA、办公自动化将在 6–12 个月内被重构,Astra 当前在这条轴上领先半个身位。
- 判断二:"能力越强、分发越收窄"成为头部模型新范式,安全分级从内部框架走向产品形态与监管变量,Critical 可能成为后续旗舰的标配门槛。
- 判断三:基准分数可信度危机加深,系统能力与裸模型能力必须分报,ARC Prize 这类独立第三方的话语权将持续上升——这也是 Modelspectra 坚持多源交叉、标注口径的原因。
下一观察周期跟踪信号(可证伪)
- 企业真实账单(未来两个季度):"单任务成本更低"是否在第三方/用户侧复现,还是被返工与误拦抵消。
- 更多中立复测:ARC Prize 之外的第三方是否在 OSWorld、Terminal-Bench、ExploitBench 上复现官方数字。
- 编程线反超是否持续:Muse Spark 1.3 / 后续开源模型在 DeepSWE 等基准能否稳定压过 Astra。
- 安全分级监管落地:Daybreak 通道准入、美英 AISI 评测结论,以及竞品安全能力是否同样触发 Critical。
- Computer Use 替代数据:RPA/中间件厂商的产品与业绩是否出现被替代的量化迹象。
"AGI 时代"是不是今天开始,取决于你问谁——但可以确定的是,OpenAI 希望你相信是今天。剥去叙事,Astra 仍是一次在"交付工作"维度上含金量十足的真实跃迁,只是它远没有满分海报看起来那样无所不能。
数据来源清单 Sources
访问日期统一为 2026-09-04;类型标注用于判断证据强度。
| 数据源 | 类型 | 本报告用途 |
|---|---|---|
| OpenAI 官方发布页 GPT-6 Astra | 厂商一手 | 官方基准、定价、规格、能力主张 |
| ARC Prize:Astra on ARC-AGI-3(博客) | 独立第三方 | 双脚手架复测、成本、人类动作效率对比 |
| ARC Prize:Astra 成绩页 | 独立第三方 | 标准 62.7%/$26,098、适配器 99.9%/$18,817 |
| OpenAI Preparedness Framework v2 | 厂商一手 | Critical/High 网络安全等级原始定义 |
| OpenAI:Critical cyber capabilities | 厂商一手 | Critical 阈值两条触发条件 |
| 澎湃新闻:GPT-6 发布"能干活也看得住" | 媒体 | 事件与基准交叉验证 |
| 财联社 / 腾讯新闻:欢迎来到 AGI 时代 | 媒体 | 发布会表述、灰度节奏 |
| 新京报贝壳财经:Astra 自称最智能最对齐 | 媒体 | 官方定位交叉验证 |
| 量子位:Astra / Astra Pro 基准对比图 | 媒体 | DeepSWE、Terminal-Bench 竞品对照 |
| 网易科技 / 新浪财经 / 凤凰网科技 | 媒体 | 基准、训练规模、价格争议多源核对 |
| 快科技:百万级上下文、自主操作电脑 | 媒体 | 规格与 Computer Use 案例 |
| 北京市科委转载彭博:OpenAI 反超 Anthropic | 媒体转外媒 | 竞争格局与资本市场背景 |
| World Programming / AIHub / The Agent Times / R&D World | 行业/外媒 | 双脚手架与 Critical 的英文交叉验证 |
| Epoch AI(转引) | 独立研究 | OpenAI 与 FrontierMath 利益关联提示 |