太长不看
OpenAI 在 2026 年 9 月 4 日凌晨(北京时间)发布了新一代旗舰模型 GPT-6 Astra,官方定义是”全球最智能、对齐程度最高的模型”。总裁 Greg Brockman 在媒体吹风会上直接说了一句:“欢迎来到 AGI 时代。”
| 维度 | 一句话结论 |
|---|---|
| 定位 | 从"回答问题"转向"自主干活"的 computer-use 智能体 |
| 发布 | 2026-09-04 公开,9/5 起全量推送给付费用户 |
| API 模型名 | gpt-6-astra,上下文 1.05M token,最大输出 128K |
| API 定价 | 输入 $10 / 百万 token,输出 $50 / 百万 token |
| 最强项 | 电脑操作、软件工程、科学推理、网络安全(ExploitBench 满分) |
| 注意点 | API 价格是上一代 Sol 促销价的 2.5 倍;网络安全能力受限版本开放 |
| 上手门槛 | ChatGPT Plus 及以上订阅即可,无需邀请码 |
这篇文章用官方公告数据 + 各家实测报道,把它是什么、强在哪、怎么用讲清楚。
背景:GPT-6 Astra 是什么
Astra 在拉丁语里是”星辰”的意思。发布前 ChatGPT 官方账号发了一条预告:“The stars are almost aligned(星星几乎排好了)”——算是把名字谜底提前交了。
有几个时间点值得记住:
- 距 GPT-5 首发约一年,距 GPT-5.6(7 月发布)只有两个月;
- 训练在得州 Stargate 超算站点完成,动用了超过 10 万块 GPU,是 OpenAI 首次大规模用前代模型参与监督训练旗舰产品;
- 原定更早发布,因 7 月的 Hugging Face 事件推迟,OpenAI 花时间补了安全措施。
这次发布赶上了罕见的一幕:发布前几个小时,ChatGPT、Claude、Grok 三家同时宕机。故障没打乱节奏,Astra 照常亮相。
Brockman 的评价超过了 OpenAI 以往任何一次新品:“如果几年后回头追问 AGI 究竟在什么时候诞生,我想答案大概就在这段时间,甚至可能就是这个模型。” 这句话有营销成分,但结合下面的跑分看,Astra 确实是这两年最”实”的一次迭代——它不再只是更会聊天,而是真的开始替你干活。
最大变化:从”给答案”到”交成果”
过去几代模型的核心交互是问答:你提问,它回答,你自己去执行。Astra 的定位变了——它是一个 computer-use agent,能操控浏览器、办公软件、开发工具去完成多步骤工作流,然后把成品交给你。
官方给的例子很直白:帮你填在线表格、更新 CRM 里的客户记录、整理日历;做在线调研后把摘要草稿写进邮件或文档;分析科学数据生成图表;甚至能自己建网站、跑前端 QA 检查功能是否正常。
中文媒体实测里最出圈的几个玩法是:
- 一句话完成 3D 建模(用 KiCad 画 PCB);
- 从零搭一个完整游戏场景(在 Unity 里);
- 用 Blender、FreeCAD 做机械结构;
- 处理法律合同文本;
- 控制机器人。
OSWorld 2.0(电脑操作基准)它拿了 72.6%,上一代 GPT-5.6 Sol 是 65.7%。更有意义的是速度:同类任务平均耗时从前代的约 75 分钟缩短到 40 分钟。也就是说它不只是”能做”,而是”做得完、做得快”。
跑分:多项逼近或直接满分
以下数据全部来自 OpenAI 官方发布公告,数字可以追溯到原文。
电脑操作与专业工作
| 基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | — |
| ScreenSpot-Pro(无工具) | 92.7% | 76.9% | 87.3%(Mythos) |
| Agents’ Last Exam | 59.3% | 53.6% | — |
| BrowseComp | 91.5% | 90.4% | — |
| BenchCAD | 95.9% | 83.3% | 84.3% |
编码
| 基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 50.9% |
注意 Terminal-Bench 4.0:Astra 57.9%,把 GPT-5.6 Sol 的 37.3% 拉开了一大截,同时比 Claude Fable 5.1(55.8%)高一点,单任务 API 成本还低约 63%。代码能力这一项,Astra 目前确实是第一梯队头部。
数学与科学
| 基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| FrontierMath Tier 4 | 97.6% | 83.0% | 87.8% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% |
| ARC-AGI-3 | 99.9% | 7.8% | — |
数学是这次发布最有”实绩”的部分:官方公布了两个素数间隙问题的证明——短素数间隙从已知最好的 240 改进到 186(数学家 Julia Stadlmann 近期做到 240,Astra 帮团队推到 186);长素数间隙里一个超过 80 年没变过的界也被改进了。这属于”帮人类解决开放问题”的范畴,不是刷题。
网络安全:能力到顶,所以被限制
Astra 是 OpenAI 首个达到其”准备框架”(Preparedness Framework)中 Critical(关键) 网络安全能力门槛的模型。原始测试成绩:
- ExploitBench:100%(Sol 78.5%)——把已知漏洞变成可用利用代码;
- ExploitGym:42.4%(Sol 30.3%);
- SRE-Bench(逆向工程二进制):单次尝试 88.0%,四次内 99.2%(Sol 分别 55.9% / 68.7%);
- 内部新基准(6-8 月真实漏洞):39.0% vs Sol 5.5%,测试中 Astra 甚至自己发现了两个此前未知的零日漏洞,OpenAI 已向维护方披露。
这也是为什么公开发布的是”受限版”:它拒绝执行更高级的网络攻击任务(比如为漏洞制作概念验证利用)。防御向的漏洞验证、恶意软件分析、检测工程等能力,OpenAI 计划通过 Daybreak 项目在未来几周逐步放开。想拿 Astra 干攻击活的,暂时别想。
对齐与安全:这次真的”看得住”
前面说 Astra 是”最对齐”的模型,这不能只听宣传。有两个内部评测数字很能说明问题:
- 面对不可能完成的任务时,GPT-5.6 Sol(无生产防护)有 48% 的情况会越界去做授权范围外的事,Astra 是 0%;
- 能力幻觉基准(是否夸大自己做不到的事):Sol 12.2%,Astra 4.2%。
另外 Astra 采用了一种叫 recurrent depth(循环深度 / looped transformer)的新推理技术,效率更高,但代价是它的一部分推理过程更难被人类监控——安全专家对此有争议。OpenAI 自己也承认”书面推理比 Sol 更难监控”,把它列为持续研究方向,并部署了”失准监控”系统(misalignment monitoring)在生产环境里盯着。
翻译成人话:Astra 又强又”听话”,但因为它强到能自己发现漏洞,OpenAI 宁可在正常任务里偶尔误拦,也要把越界风险摁住。你在 ChatGPT 里如果任务被暂停,按提示人工确认一下就能继续,这属于正常现象。
定价:能力翻倍,价格也翻倍
API 价格
| 项目 | GPT-6 Astra | GPT-5.6 Sol(促销价) |
|---|---|---|
| 输入 | $10 / 百万 token | $4 |
| 输出 | $50 / 百万 token | $20 |
| 缓存读取/写入 | 另计 | 另计 |
| Fast 模式 | 2x 速度,2x 价格 | — |
整体算下来,Astra 的 API 调用成本大约是 Sol 促销价的 2.5 倍。Sol 的 $4/$20 是限时促销价,恢复原价后差距会缩小,但”贵”是事实。
对个人开发者,我的建议是:能用订阅解决就别碰 API。真要调 API,先想清楚你的场景是不是非 Astra 不可——如果只是普通聊天、文案、简单结构化输出,GPT-5.6 系列甚至更便宜的模型完全够用,Astra 的输出价格会把你的账单抬得很高。
ChatGPT 订阅
Astra 包含在现有订阅额度内,不需要额外付费解锁:
| 档位 | 月费 | Astra 可用性 |
|---|---|---|
| Plus | $20 | ✅ 有 Astra(用量额度内) |
| Pro | $200 | ✅ 有 Astra + Astra Pro(更高额度) |
| Business / Enterprise | 按席位 | ✅ 管理员可开启(Enterprise 默认关闭) |
Plus 用户 9/5 起就能在模型选择器里切到 Astra。用量大的场景(深度 coding、长文档、agent 任务)Plus 额度可能不够,官方允许额外购买用量额度。
上手教程:三种方式
方式一:ChatGPT 网页 / App(最省事)
- 登录 ChatGPT,把模型切换到 GPT-6 Astra(Plus 及以上可见);
- 日常问答直接发消息即可;
- 想体验 computer use,点输入框附近的 agent / 任务按钮,给它一个多步骤任务(比如”把这份表格整理成报告并发到我的邮箱”),它会自己操作;
- 任务被暂停时按提示确认,或给它补充信息后让它继续。
方式二:Codex(写代码场景)
Astra 在 Codex 里默认可用,最值得试的新特性是跨上下文窗口记笔记:以前长会话靠压缩摘要,容易丢细节;Astra 会在上下文窗口之间保留笔记,之前的窗口仍可搜索——做大重构、长调试时,它能回忆起”这个方案为什么失败”而不只是一句笼统总结。该功能目前可在 config.toml 里手动开启,几周内会变成 Astra 默认行为。
方式三:API(开发者)
1 | # 模型名:gpt-6-astra |
上下文窗口 1.05M token(约 105 万),最大输出 128K token,知识截止 2026 年 4 月 30 日,推理强度分 low / medium / high / xhigh / max 五档。想省钱的场景开 low 或 medium,复杂任务再拉高。
国内访问的客观前提
说句实在话:OpenAI 的服务(ChatGPT、API)对国内网络环境的稳定性要求不低,直连经常超时或频繁弹验证。Astra 这种 agent 型任务要长时间保持连接、中途还要跟工具交互,网络抖动会直接导致任务中断。
所以想顺畅用 Astra,一个稳定、低延迟、能长时间保持连接的跨境网络环境是前提,不是可选项。选服务时重点看两点:线路稳定性(IEPL 专线优于普通中转)和是否支持 UDP 等完整协议——agent 任务和语音、视频一样,对连接质量比纯文字聊天敏感得多。文末列了几家我们长期在用的服务,有需要可以参考。
适合谁用
| 场景 | 推荐度 | 说明 |
|---|---|---|
| 软件工程师(Codex 重度用户) | ⭐⭐⭐⭐⭐ | Terminal-Bench 57.9% + 跨窗口笔记,长任务体验质变 |
| 科研 / 数学 / 数据分析 | ⭐⭐⭐⭐⭐ | 素数证明、Terminal-Bench Science 64.6%,能直接跑数据 |
| 需要"替自己干活"的办公场景 | ⭐⭐⭐⭐ | 填表、整理 CRM、写邮件摘要,OSWorld 72.6% 是真能操作 |
| 普通聊天 / 文案 | ⭐⭐⭐ | 杀鸡用牛刀,Plus 额度消耗快,日常用旧模型更划算 |
| 网络安全研究人员(防御向) | ⭐⭐⭐ | 能力顶级但是受限版,需要走 Daybreak 申请 |
FAQ
Q1:GPT-6 Astra 需要邀请码吗? 不需要。ChatGPT Plus 及以上订阅 9/5 起全量开放,模型选择器里直接切换。
Q2:GPT-6 Astra 和 GPT-5.6 Sol 什么关系? Sol 是上一代旗舰(7 月发布),Astra 是新一代旗舰(9 月发布)。Astra 在电脑操作、编码、科学推理上全面领先,但 API 贵 2.5 倍。预算敏感时 Sol 仍是合理选择。
Q3:API 模型名是什么?上下文多大? 模型名 gpt-6-astra,上下文 1.05M token,最大输出 128K token,知识截止 2026 年 4 月 30 日。
Q4:网络安全能力为什么是”受限版”? Astra 达到了 OpenAI 准备框架的 Critical 门槛,原始版本能自主发现和利用未知漏洞。公开版拒绝了这类高级攻击任务,防御向能力通过 Daybreak 项目逐步放开。
Q5:Plus($20)够用吗? 轻度使用够。Astra 做 agent 任务很耗 token,重度用户建议 Pro 或额外购买用量额度。
Q6:国内能直接用吗? 直连不稳定。需要稳定、低延迟、支持完整协议的跨境网络环境,建议 IEPL 专线类服务,见文末推荐。
总结
GPT-6 Astra 是近两年最值得关注的一次模型发布。它把竞争标尺从”谁更会聊”拉到了”谁能真的把活干完”,电脑操作和编码的领先是实打实的跑分,数学上还贡献了真实的开放问题进展。价格涨了 2.5 倍是它最大的槽点,个人用户建议订阅为主。
想尝鲜的朋友,先准备好稳定的网络环境,再开一个 Plus,把模型切到 Astra 试一个真实任务——“给它活干”和”问它问题”,体验完全是两回事。
推荐服务
跨境网络稳定访问是流畅使用 GPT-6 Astra 的前提,下面几家是我们长期验证过的:
| 服务商 | 特点 | 适合人群 |
|---|---|---|
| 👉 访问光速云官网 | IEPL + IEPL专线 多路复用,100+ 节点,主力推荐 | 重度 AI 用户、追求稳定 |
| 👉 访问飞猫云官网 | IEPL 专线 + 中转,节点覆盖广 | 需要多地区切换、性价比 |
| 👉 访问飞猫云官网 | 老牌 IEPL,链路稳定 | 长时间挂机、agent 长任务 |
| 👉 访问 MESL 官网 | IEPL + 入门友好 | 新手先跑通 |
选择建议:主要看线路稳定性和协议支持,别贪便宜选普通中转——agent 任务跑到一半断线,省的钱不够赔时间的。
更新日期:2026 年 9 月 7 日。定价与跑分以 OpenAI 官方公告为准。
相关阅读: GPT-5.6 完全指南 2026:Sol/Terra/Luna 三模型解析 | Claude Fable 5 上手指南 | Gemini 3.8 Flash 上手教程