

美东时间9月3日山西股票配资,OpenAI于发布GPT-6 Astra。
OpenAI在美东时间9月3日发布GPT-6 Astra。按照OpenAI官方说法,Astra是其“最智能、最对齐”的旗舰模型,能力重点覆盖Computer Use、软件工程、数学与科学、专业办公、等场景。
这次发布的市场反馈明显好于OpenAI过去几次模型更新。据Latent Space整理,GPT-6 Astra发布约9小时后,相关内容浏览量已达3600万,点赞数16.4万,是OpenAI自Sora以来最受关注的一次发布。更重要的是,Astra被市场视为OpenAI对Anthropic Fable 5.1和Opus系列进展的正面回应。

从能力披露看,OpenAI给出的核心表述是:“任何你能在电脑上完成的事,Astra都可以替你完成。”这意味着,模型竞争的重心正在从聊天、写作、代码生成,进一步转向电脑操作、长程Agent和端到端任务交付。
Astra在Terminal-Bench 4.0、OSWorld 2.0、AutomationBench、FrontierMath Tier 4、ARC-AGI-3、ExploitBench等评测中取得高分,其中OSWorld和AutomationBench更值得关注,因为它们衡量的是模型在真实软件环境和专业工作流中的执行能力。

但Astra的发布也伴随争议。外部评测显示,它在Coding智能体、Computer Use和长程知识工作中表现突出,但在通用智能指数上并未全面领先Claude Fable 5.1;同时,由于token单价较GPT-5.6 Sol显著上升,其成本优势高度依赖具体任务和运行框架。另一方面,OpenAI系统卡披露Astra在对齐表现上改善,但链式思考可监控性下降,引发安全研究者关注。
「明亮公司」结合市场观点总结发现,目前对GPT-6 Astra的解读已经形成几项基本共识。
第一,模型竞争正在从“聊天/写代码”转向端到端执行,Computer Use与长程Agent成为前沿模型的新主线,能力边界正从对话框扩展到真实工作流。
第二,Astra在单token价格上升的同时,强调特定场景下的任务成本下降,这意味着头部模型并未失去定价权,反而可能通过更高完成率、更少返工和更短执行时间重新获得溢价,早前“价格战会持续侵蚀商业模型”的担忧被部分证伪
第三,无论是训练侧十万卡级别投入,还是推理侧为Agent、Computer Use和安全监控配置更大集群,GPT-6都再次强化了算力长期需求逻辑。
第四,OpenAI在Coding和Agentic Coding上的表现明显追近Anthropic,行业竞争从此前“Anthropic单方面领先”的叙事,重新回到OpenAI与Anthropic胶着竞争的格局。
而分歧则主要集中在三处。
第一是架构变化对存储需求的影响。若Recurrent Depth确实通过层复用和隐藏空间推理实现“用计算换存储”,它可能改变推理侧算力结构,进而削弱部分HBM/DRAM需求弹性。第二是对市场影响的方向,硬件侧预期已经较充分,而AI软件开始进入“算利润、看兑现”的阶段。第三是Benchmark的可信度和安全约束。多数高分来自研究环境或特定Harness,官方对比也未完全覆盖Muse Spark 1.3等竞争模型;同时,Astra达到Critical级网络安全能力后,监控、拒答和权限限制可能影响实际可用性。

01 GPT-6三层核心变化:训练方式、技术架构、产品能力
GPT-6 Astra的第一层变化是训练方式。
据多家券商,Astra基于OpenAI Stargate德州站点超过10万颗GPU训练,是OpenAI迄今最大规模的一次训练。据申万宏源,Astra首次大规模引入前代模型GPT-5.6 Sol参与训练监督,训练后期系统可以自主连续运行。申万宏源将其称为递归自我改进的雏形。更直接地说,上一代模型开始参与下一代模型的训练和维护,模型迭代从单次训练,开始转向更连续的系统工程。
第二层变化是技术架构。
据天风证券和西部证券,Astra可能采用Recurrent Depth或Looped Transformer架构,即同一组Transformer层可以被反复调用,模型将部分推理过程放在隐藏空间中完成,而不是把每一步都展开成可见文字。这个变化有两个结果:一方面,它可能减少显式token消耗,提高复杂任务中的执行效率;另一方面,推理过程更难被外部观察,安全监控和可解释性成本上升。据天风证券,OpenAI为此额外投入约20%的推理算力用于监控。OpenAI在官方介绍中也承认,Astra的书面推理比GPT-5.6 Sol更难监控,并将monitorability列为后续研究重点。此外,有分析也指出,目前这种在隐空间的推理可能使蒸馏的难度增大。
第三层变化是产品能力。
OpenAI把Astra称为“世界上最好的computer use模型”。据OpenAI介绍,Astra可以填写在线表格、更新CRM客户记录、整理日历、进行在线研究并写入邮件或文档编辑器,也可以分析科学数据、生成图表、创建网站、运行前端QA、安装和测试软件,并处理屏幕上出现的问题。这些例子比传统跑分更能说明GPT-6的产品方向,即模型开始进入软件界面、工具链和业务流程。据中信证券、华泰证券等机构判断,头部模型的竞争重点正在从普通对话和单点Coding能力,转向长程Agent和Computer Use。
#02 成本再定义:从Token到任务
GPT-6的价格本身,是这次发布最有信息量的部分之一。
据OpenAI披露,Astra API标准价格为每百万输入token 10美元、每百万输出token 50美元。按中信证券测算,这一价格较GPT-5.6 Sol当前促销价上涨约2.5倍。这也说明,OpenAI并没有用低价抢市场,而是选择把旗舰模型重新放回高价区间。
这背后是计价口径的变化,过去模型公司更多按token收费,市场也习惯用每百万token价格衡量模型经济性。但OpenAI这次强调的是单任务成本。
据OpenAI披露,在Terminal-Bench 4.0中,Astra相对5.6 Sol和Fable 5.1,分别以约低9%和低63%的估算API成本完成任务;在Terminal-Bench Science 0.1中,Astra得分64.6%,高于Claude Fable 5.1的52.6%,同时估算API成本低约31%;在BenchCAD中,Astra达到95.9%的几何重合分数,相比Sol和Fable 5.1的估算API成本分别低约43%和86%。
这说明OpenAI并不试图证明Astra的token更便宜,而是证明它在特定任务里更少绕路、更快完成、更少返工。
对企业客户来说,单token价格只是成本的一部分。如果模型需要更多轮交互、更多人工校正,或者在最后一步失败,便宜token并不一定带来低成本。反过来,如果一个更贵的模型能一次性完成复杂任务,它的总成本可能更低。
但这个说法仍需要区分场景。据Artificial Analysis,Astra在Coding智能体任务上的token效率较Sol提升约70%,部分Codex框架下的成本效率处于前沿;但同一机构在通用智能指数中测算,Astra输出token仅减少约10%,由于单价上涨,单任务成本反而比Sol高75%。这意味着,“GPT-6更便宜”不是通用结论。它在Codex、Computer Use和特定Agent框架下更有可能成立,在裸API和通用问答场景中未必成立。
结合上述变化可以理解,OpenAI同步更新Codex harness的原因。
据OpenAI介绍,Astra结合新的Codex harness后,在Mind2Web基准上的任务完成速度较当前GPT-5.6 Sol体验提升1.9倍;在Codex中,Astra还可以通过跨上下文笔记保存长期任务细节,减少过去长会话压缩造成的信息丢失。
#03 模型叙事转变起点:从Coding到任务交付
过去一年,Coding能力是前沿模型竞争的核心。Anthropic正是靠“赌对”Coding这一方向,成为了历史上最快达到万亿美元市值/估值的公司之一,而且,在二级市场上的开源模型公司,也多因Coding收获了上市后投资者的认可。
此前,OpenAI用GPT-5.6 Sol、Codex和ChatGPT开发者生态追赶。但GPT-6发布后,这个叙事可能发生变化——Coding更像是端到端任务的一部分,而不是终点。
原因很简单,会编程,不等于能完成工作。或者说,编程只是工作/任务中高价值的一环。
据OpenAI介绍,Astra在Codex中可以跨上下文检索前序窗口中的需求、测试结果和工具输出,避免在长时间调试或大型重构中丢失关键细节。
Jane Street相关负责人就在发布中的信息中表示,Astra在内部编码基准和交易直觉评估中较GPT-5.6 Sol有明显提升,用于agentic coding时,生成代码达到生产质量所需迭代更少。
这正是大模型产品形态的变化。过去模型更多是“回答者”,现在头部公司希望它变成“执行者”。
据OpenAI介绍,Astra可以在指令不完整时补足常规信息,在关键决策前提问;在Codex中,它可以异步提问,同时继续处理不依赖用户回复的部分。这类能力比单次回答准确率更接近企业使用场景,因为真实工作很少是一次性、结构化、边界清晰的。
这也反映出AI大模型下一程叙事的方向。
据华泰证券,顶级模型竞争已经转向长程Agent,小模型则在追平上一代旗舰。这意味着模型市场开始分层,旗舰模型处理复杂任务和高价值工作,中端模型覆盖多数生产需求,小模型承担低价、高频调用。
OpenAI此前对Sol降价,更像是为GPT-6发布做产品分层,而不是前沿模型失去定价权。Astra价格重新站上高位,也可能继续证明,最前沿模型仍然可以通过复杂任务获得溢价,而这意味着中国的大模型厂商也将迎来变化。
#04 对中国大模型公司的叙事影响
在GPT-6发布前,中国头部模型刚完成一轮追赶。2026年7月至8月国产模型密集发布后,头部国产模型已经接近上一代前沿模型水平,Kimi K3在部分Coding榜单表现突出,国产模型在OpenRouter上的调用份额也有提升。这说明,中国模型公司在普通对话、中文场景、部分Coding能力和低成本调用上,已经具备较强竞争力。
但GPT-6 Astra把前沿差距重新拉到执行层。
具体来看,Astra 的一些表现得分明显提高。

这些提升集中在长程任务、软件操作、终端任务和专业流程上。这恰好是国内模型公司仍需补齐的地方。
据中金公司此前评价,部分国产小参数模型除长程任务外,大部分日常任务已经可以较好运转。国产模型在多数日常任务上已经不弱,但在长程Agent、Computer Use和闭环执行上仍有短板。GPT-6主打的正是这些能力。
一些观点甚至认为,短期看中国模型公司和OpenAI的差距可能在执行层重新扩大,而不是在所有维度同时扩大。
但这种差距并非无法追赶,据天风证券,Recurrent Depth和Latent Reasoning并非完全封闭路线,国内外已有相关论文和开源实践(比如;Astra的提升也不完全来自更大的知识库,而与后训练、强化学习、工具调用和工程系统相关。国产模型公司过去在后训练和工程优化上有较快追赶速度。
截至9月4日收盘,智谱(02513.HK)股价跌2.98%,MiniMax(0100.HK)股价涨1.8%,两家模型公司的股价并未大幅波动。
欣旺配资提示:文章来自网络,不代表本站观点。