GPT-6 Astra 深度评测:当 AI 开始自己干活
还在把 AI 的回答复制进 Excel 自己排版?新旗舰 Astra 想替你把这一步也省了。它能直接打开浏览器、填表格、跑代码、做 PPT,自己把活干完再交付。抽象推理基准 ARC-AGI 几乎满分,官方称这是 AGI 时代的开端。它到底有多能打,又贵不贵,上手试一遍才知道。
产品概述
OpenAI 在 2026 年 9 月 4 日(北京时间)发布了新一代旗舰模型 GPT-6 Astra,代号在拉丁语里意为星辰。官方把它定义为全球最智能、对齐最好的模型,明确把重心从聊天问答转向自主完成任务。训练动用了得州 Stargate 超算超过 10 万块 GPU,是 OpenAI 首次大规模用前代模型参与监督训练的旗舰产品。
它不是又一个只会聊天的 bot,定位是 computer-use agent,能操控浏览器、办公软件、开发工具去完成多步骤工作流,再把成品交给你。这种从“给答案”到“交成果”的跳跃,是这一代最该被记住的变化,意味着 AI 竞争的标尺从“谁更会聊”变成了“谁真能把事办成”。
入口都在 OpenAI 自家体系内,认准官网与 API 文档这两个地址,别去第三方镜像折腾。
想第一时间试,直接装 ChatGPT 桌面端最省事,灰度从那里推,比苦等 API 配额更早摸到真实能力,企业用户走 API 还能拿到完整参数和更高额度。
官网:https://openai.com | API 文档:https://platform.openai.com/docs。

核心功能
前面说了它要自己干活,下面看看底子到底有多厚。Astra 最大的变化是操作计算机:你给它一个目标,比如把财报做成演示文稿,它自己拆任务、调工具、边做边查,再交付成品。它能填在线表单、更新 CRM、整理日历、做网页研究摘要,也能分析科学数据、画图表、建网站并跑前端 QA。
OpenAI 展示的案例里,它能把电子原理图转成可制造 PCB,用 Unity 做游戏原型,在 Blender 建好房再导入虚幻 5 让人走进去体验。找儿科医生人工要 5 小时,它不到 3 分钟。法律平台一次性核查 41 份财报,预埋的 4 处错误一个没漏,这种长链路准确率正是 agentic 模式最值钱的地方。
理解 Astra 得看它的工作方式,它不是单模型硬扛,而是分层协作:上层接住你的目标和授权边界,中间规划并记住跨上下文的信息,下层调度一连串工具去执行,再经安全门控后交付。这套结构决定了它为什么能跑长任务而不中途失忆,也解释了为什么它比单纯大模型更难被对手抄作业。

关键在跨上下文记忆。过去 Codex 靠压缩旧对话,会丢掉为什么某次修复失败。Astra 保留笔记并回查早期消息和工具输出,长任务不丢上下文。reasoning 还新增 xhigh 和 max 两档,复杂工程任务可以拉满算力,代价是更慢更贵,按难度切换即可,不必全程开满浪费预算。
数字最能说明问题,下面这组 OpenAI 自测成绩,是 Astra 相对上代 GPT-5.6 Sol 的代际跃升,部分维度已经接近饱和。需要提醒的是,这些数字多来自 OpenAI 自家评测,第三方尚在复核,读的时候留一分余量,别被接近满分的成绩单冲昏头。

ARC-AGI-3 从 7.8% 跳到 99.9%,几乎打满;FrontierMath Tier 4 到 97.6%;OSWorld 2.0 任务完成率 72.6%,平均耗时从 75 分钟压到 40 分钟,约降 47%。数学、抽象推理、计算机操作三块同时起飞,这才是“代际”二字的底气,不是挤牙膏式的小修小补,而是整段能力的重新排列。
上手体验
聊完能力,最实在的问题是现在怎么用上它。普通用户最快的路径是 ChatGPT 桌面端:发布当天优先开放给 Daybreak 网络安全项目的企业,随后数日内向 Plus、Pro、Business、Enterprise 推送,想写代码或做自动化则走 API 更直接,文档和配额都更完整。
拿到 key 后,一次最基础的调用长这样:model 填 gpt-6-astra,把目标当 input 丢进去就行,不用自己拆步骤。下面这段就是真实请求,注意它只描述“要什么”,不写“怎么做”,剩下的交给模型自己规划与调度工具,你只管验收最终结果,省掉手写多步提示词的麻烦。

第一次体感是给目标比给提示词省事。我说把这份财报做成带图表的 PPT,它真去检索、生成、自检,十几分钟交出版式能看的成品。代价是思考过程比上代更不透明,你很难看清它为什么这么决定,普通用户还要等几天灰度,别急着冲,先在小任务上摸清它的脾气。
使用技巧
很多人不知道,Astra 的性价比不在单价,而在一次把任务做对、省下反复调的工夫。下面几条是这段时间实测下来最管用、也最容易被忽略的用法,照着做能省不少冤枉钱,也能少踩几个权限和成本的坑,新手尤其该先看一遍。
-
把目标说清,而不是下指令。Astra 擅长自己拆任务,你定义什么叫“好”,比教它每一步更划算。 -
长任务开 xhigh 或 max 推理档,复杂工程类任务准确率明显更高,但更慢更贵,按难度切换。 -
涉及敏感权限时主动设授权边界,它能做到越界率 0%,但你得先把边界讲明白。 -
超长上下文(超 27.2 万 token)会触发阶梯计价,长文档先裁再喂,成本能砍一半。
竞品对比
光看自家数据不够,放进牌桌才清楚位置。下面这张表把 Astra 和上代 Sol、Anthropic 的 Fable 5.1 摆在一起,维度选的是普通人最在意的几项,而不是堆冷门指标,这样你一眼就能看出谁适合干什么活,不用自己拼凑。
| 维度 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| 产品定位 | 计算机操作 agent | 通用旗舰(聊天/编码) | 通用旗舰(强编码/长上下文) |
| 上下文窗口 | 105 万 token | 未披露 | 未披露 |
| 计算机操作 | 强(OSWorld 72.6%) | 中(65.7%) | 强(Anthropic 报 77.9%,版本不同) |
| 网安能力门控 | Critical 级(受限开放) | 未达 Critical | 未达 Critical |
| API 定价 | $10 / $50 每百万 | 约 $4 / $20(促销) | 约 $10 / $50 |
| 可用状态 | 灰度开放中 | 全量 | 全量 |
横向看,Astra 在 computer-use 和网安能力上最激进,代价是定价也最高。Claude Fable 5.1 在 OSWorld 上报过 77.9%,但那是不同版本,不宜直接横比;Astra 的 agentic 整合更深入,不是单点分数高。Sol 是性价比基线,适合不想为 agentic 买单的常规任务,短期仍是多数人的务实选择。
用户反馈
发布会刷屏,真实声音目前两极,主要来自早期企业和评测圈,毕竟大众还要等灰度。把正反两面的信号分开看,比被标题带着走更有用,也更能判断自己要不要现在上车,而不是跟风喊一句 AGI 就掏钱。
正面:早期企业用户最买账的是省人力。Legora 用它核 41 份财报零漏错,Playco 进 Unity 做原型把人工修补砍半。开发者圈子里,长任务一次做对比反复调省心是共识,尤其适合本来就要雇人盯流程的团队,替代的是重复性脑力劳动。
负面:价格先被吐槽,2.5 倍于 Sol,小团队算账会肉疼。可监控性也被点名,首席科学家自己把模型可解释性列为后续挑战。还有人质疑部分基准用了配套 harness,分数含系统红利而非纯模型能力,这点等独立复测才有定论,现在下结论确实太早。
多维评分
该打多少分,按八个维度摊开看。评分基于已披露的官方数据与早期实测信号,能力维度几乎拉满,扣分项集中在价格和早期支持,企业和个人体感会差很多,所以下面这个分数要分人看,别直接套到自己的场景上。
| 维度 | 权重 | 星级 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ★★★★★ | computer-use + 多工具 + 长任务,能力覆盖面空前 |
| 易用性 | 15% | ★★★★ | 自然语言给目标即可,但安全门控和 API 配置有门槛 |
| 性能表现 | 15% | ★★★★★ | 多项基准代际跃升,任务耗时降约 47% |
| AI 能力 | 15% | ★★★★★ | 推理/对齐/agentic 全面领先,ARC-AGI-3 达 99.9% |
| 价格合理性 | 10% | ★★★ | $10/$50 每百万,是 Sol 的 2.5 倍,偏贵 |
| 生态集成 | 10% | ★★★★ | ChatGPT + API + AWS + Codex/MCP,但权重不开放 |
| 文档与支持 | 10% | ★★★ | 刚发布,文档和企业支持仍在铺开,普通用户延迟数日 |
| 更新频率 | 5% | ★★★★ | 距 5.6 仅两月即 6 代,迭代快 |
加权归一化后综合约 8.6 / 10。对预算充足、要自动化干活的企业,这个分数很能打;对个人尝鲜者,定价和灰度节奏会压低实际体验分,建议等一两个月口碑稳定再下注,那时降价或任务计费可能也已落地。
优缺点
优点:
-
真正能操作电脑完成多步骤任务,不止给建议 -
跨上下文记忆让长任务不丢线索,一次做对比反复调省心 -
推理与对齐双高,越权率实测 0%,是迄今最守规矩的模型 -
基准代际跃升明显,数学、抽象推理、计算机操作全面领先
缺点:
-
定价是上代 2.5 倍,中小团队短期账本不好看 -
思考过程更不透明,可监控性被官方列为后续挑战 -
强网安能力受限开放,普通 API 用户拿不到完整能力 -
刚发布灰度中,普通用户要等几天,稳定性待观察
适用人群
不是每个人都该现在上车,按 ROI 高低排个序更清楚。下面四类人,前两类最该立刻试,后两类建议再等等,免得为用而用、白交订阅,先把任务定义清楚比抢先体验更重要。
-
企业自动化团队:要批量跑报表、CRM、研究摘要的,ROI 最明显,人力替代直接可见。 -
开发者与独立游戏人:做原型、搭站点、跑 QA,省下一堆重复劳动,原型周期明显缩短。 -
科研与金融建模:长链路分析任务,Astra 的跨上下文记忆是刚需,一次跑完不丢中间结论。 -
普通个人用户:等灰度稳定再说,现在冲容易卡在权限和价格上,体验未必比 Sol 好太多。
定价方案
钱的事单独算笔账,毕竟这是最多人皱眉的地方。Astra 的计价逻辑和 Sol 一样按 token,但单价和附加项都更狠,得拆开看才不会被标价吓退,也不会误判自己到底要花多少,建议先拿小任务试水。
| 档位 | 价格 | 说明 |
|---|---|---|
| API 标准 | $10 输入 / $50 输出(每百万) | 缓存输入 $1,常规调用主力档 |
| 快速模式 | 标准价 ×2 | 速度最高 2.5 倍,赶进度时划算 |
| 长上下文附加 | 超 27.2 万 token 触发 | 输入 ×2、输出 ×1.5 的阶梯计价 |
| ChatGPT 订阅 | 随 Plus/Pro/Business/Enterprise | 后续内置,按订阅费计,不单列 token |
| Astra Pro | 仅 Pro/企业 | 能力更强,面向重度工作负载 |
对比 Sol 促销价(约 $4/$20),Astra 贵 2.5 倍。OpenAI 的意思是别按 token 算,按任务算:一次做对省反复。但中小团队短期账本不好看,得等任务计费真正落地,才能说贵得有理,现在先用小任务摸成本曲线最稳。
FAQ
把大家最关心的问题集中回答一遍,下面十二条覆盖从能力、价格到部署的大部分疑惑。这些答案基于发布当天的官方信息与早期实测信号,能省你不少翻文档和试错的时间,看完基本能判断自己要不要现在上车。
Q1:GPT-6 Astra 和普通 GPT-5 有什么区别?
A1:核心区别是从问答转向执行。 它能直接操作电脑完成多步骤任务,而不是只给建议。基准上 ARC-AGI-3 从 7.8% 跳到 99.9%,代际差距明显,不是同一代产品的修补。
Q2:普通人现在能用吗?
A2:还不能完全随便用。 发布当天先给 Daybreak 企业用户,随后数日向 Plus、Pro、Business、Enterprise 灰度,等几天才轮到大多数普通用户,企业渠道更早。
Q3:API 怎么调用?
A3:走 OpenAI Responses API,model 填 gpt-6-astra。 把目标当 input 传入即可,模型自行拆解任务,无需手写多步提示词,你只管描述和验收最终结果。
Q4:定价贵不贵?
A4:偏贵,是上代 Sol 的 2.5 倍。 标准价每百万输入 10 美元、输出 50 美元,快速模式再翻倍,长上下文另有阶梯计价,中小团队需先算清任务总成本。
Q5:它真达到 AGI 了吗?
A5:OpenAI 没正式宣布 AGI,只说有理由认为已身处 AGI 时代。 Brockman 把判断权留给读者,强调这是旅程开端而非终点,是否算 AGI 由你自行定义。
Q6:安全吗,会乱来吗?
A6:越权率实测 0%,是迄今最对齐的模型。 无防护措施时 Sol 有 48% 会越界,Astra 把这项压到零,强网安能力反而受限开放,普通用户拿不到完整权限。
Q7:上下文有多长?
A7:105 万 token 输入,最大输出 12.8 万 token。 知识截止 2026 年 4 月 30 日,支持文本与图像输入、纯文本输出,长文档可一次性喂入不截断。
Q8:和 Claude Fable 5.1 比谁强?
A8:Astra 的 agentic 整合更深,Fable 编码与长上下文更强。 两者 API 定价持平,OSWorld 成绩因版本不同不宜直接横比,选谁看你的任务落在哪块。
Q9:为什么思考过程看不懂?
A9:推理更往模型内部藏,外部难追踪决策链。 OpenAI 首席科学家已把可监控性列为后续 Scaling 的重要挑战,透明度问题短期难根本解决。
Q10:有开源或自部署吗?
A10:没有,纯托管闭源,权重不开放。 只能走 ChatGPT、OpenAI API 或 AWS,无法私有化部署到自家硬件,数据出境合规需自行评估。
Q11:快速模式值得开吗?
A11:看任务时效要求。 速度最高 2.5 倍但价格翻倍,紧急交付或长任务赶进度时划算,常规任务用标准档更省,别为一点快感多花钱。
Q12:未来会按任务收费吗?
A12:OpenAI 暗示行业可能转向按任务计费。 当前仍是 token 计价,但官方口径是看单次任务总成本,而非单价高低,任务计费落地后性价比逻辑会变。
结尾
GPT-6 Astra 不是一次普通升级,它把 AI 的标尺从会写会答,推到了会干事。computer-use、跨上下文记忆、越权率归零,这三件事叠在一起,确实配得上官方那句欢迎来到 AGI 时代,也值得认真看待而非当营销。
但它不是所有人的立刻选项。2.5 倍定价、灰度开放、思考不透明,都意味着普通人先观望、企业先试点更稳。把任务定义清楚、把边界讲明白,比追逐参数更重要,工具越强越考使用者的功力,别被宣传带节奏。
这一代真正改变的,是我们和工具的关系:从你教它怎么做,变成你告诉它要什么。剩下的问题,交给接下来几个月的真实落地,让独立复测和大众口碑替我们作答,那时候再下最终判断也不迟。
- 目前还没评论,等你发挥!

起点课堂会员权益



