OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果

OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果

  OpenAI宣布推出新一代人工智能模型GPT-6 Astra ,并将其定位为公司迄今智能水平和对齐能力比较高 的模型 。Astra近来 首先向部分机构开放,并将在未来数日逐步覆盖ChatGPT Plus 、Pro、Business和Enterprise用户,同时登陆OpenAI API、微软Azure和亚马逊AWS Bedrock。

OpenAI更新GPT-6 Astra发布页:明确开放范围	,测试成绩以及网络安全测试结果-第1张图片

  此次升级的重点已不仅是传统问答能力 ,而是进一步强化计算机操作 、软件开发 、科学研究、网络安全以及复杂专业工作。OpenAI公布的多项测试显示,Astra相较上一代GPT-5.6 Sol在计算机操作、编程和科研任务上出现明显提升,并尝试把模型能力进一步转化为可执行的企业级自动化工具 。

OpenAI更新GPT-6 Astra发布页:明确开放范围	,测试成绩以及网络安全测试结果-第2张图片

  从商业化角度看,Astra正在把大模型竞争进一步推向“直接完成工作 ”的阶段 。OpenAI称,新模型能够操作软件 、填写在线表单、维护客户关系管理系统、总结 日程 、进行网络研究 ,也可以直接处理科学数据、制作图表、开发网站和执行前端质量检查。

OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果-第3张图片

  计算机操作能力明显提升,单项任务耗时下降近一半

  OpenAI此次重点强调了Astra的计算机操作能力。

  在模拟真实专业软件环境的Agents‘ Last Exam测试中 ,GPT-6 Astra得分59.3%,高于GPT-5.6 Sol的53.6%,也高于Claude Opus 5的55.5% 。OpenAI称 ,在比较高 得分配置下,Astra使用的输出Token数量比Claude Opus 5少约65%。

  在OSWorld 2.0测试中,Astra得分72.6% ,高于GPT-5.6 Sol的65.7%。与此同时 ,完成单项任务的模拟耗时从Sol的大约75分钟降至40分钟左右,缩短约47% 。

  OpenAI还同步升级了Codex的计算机操作体系。结合Astra本身的效率提升,公司称 ,在Mind2Web测试中,新组合的任务完成速度达到近来 GPT-5.6 Sol体验的约1.9倍。

  这意味着OpenAI正在把模型竞争从“谁回答得更好”,逐步推进到“谁能更快 、更稳定地在真实软件环境中完成整套工作流程” 。

  企业级文档、表格和演示文稿成为重点应用场景

  除了计算机操作 ,Astra明显加强了针对专业办公环境的训练。

  OpenAI称,新模型能够处理多步骤专业任务,并直接生成文档、电子表格和演示文稿 ,同时更好地遵循企业已有模板 、排版标准和视觉风格。模型还被专门训练为只提取与任务真正相关的信息,减少无关内容重复 。

  在BenchCAD测试中,Astra借助工具完成三维物体重建时取得95.9%的几何重合度 ,高于GPT-5.6 Sol的83.3%以及Claude Fable 5.1公布的84.3%。OpenAI称,在相关测试配置中,Astra的估算API成本分别低约43%和86%。

  这部分升级对于OpenAI的企业业务尤其重要 。随着大模型能力逐渐趋同 ,企业客户越来越关注的已经不是模型能否生成文本 ,而是能否直接嵌入财务、法律、工程 、数据分析和内容制作流程,并减少人工二次修改 。

  编程能力继续提升,Codex强化长期任务处理

  OpenAI同时将GPT-6 Astra称为公司迄今最强的软件工程模型。

  在Terminal-Bench 4.0测试中 ,Astra得分57.9%,明显高于GPT-5.6 Sol的37.3%,并略高于Claude Fable 5.1的55.8%。OpenAI称 ,在相应测试配置下,其单项任务API成本也低于对比模型 。

  Astra还为Codex引入新的长期上下文处理机制。过去,当一次编程任务持续时间过长 、上下文空间被占满时 ,系统通常会将此前内容压缩成摘要,而压缩过程可能丢失失败原因、测试结果或组件行为等细节。

  按照OpenAI的介绍,Astra可以在不同上下文之间保存工作记录 ,并重新搜索此前的需求、测试结果以及工具输出,从而减少长时间调试和大型代码重构过程中出现的信息损失 。

  科学与网络安全能力进一步提升

  Astra此次另一项明显升级来自科学研究。

  在Terminal-Bench Science 0.1中,Astra取得64.6%的完成率 ,高于Claude Fable 5.1的52.6%。OpenAI称 ,在该测试配置中,其估算API成本低约31%;在一个成本更低的配置下,Astra得分61.1% ,而GPT-5.6 Sol的比较高 成绩为22.4% 。

  在GPQA Diamond研究生级科学推理测试中,Astra得分96.0%。OpenAI还表示,模型能够直接操作专业科研软件 ,对数据进行检查 、分析和可视化。

  但更值得关注的是网络安全能力的跃升 。

  OpenAI表示,Astra已经达到其《Preparedness Framework》中的网络安全“Critical ”级别。在没有生产环境安全限制的测试中,Astra在ExploitBench取得100%的成绩 ,高于GPT-5.6 Sol的78.5%;在ExploitGym中成功率达到42.4%,Sol为30.3%。

  在针对2026年6月至8月新近漏洞设计的测试中,OpenAI称Astra甚至发现并利用了两个此前未知的零日漏洞 ,公司正在将这些漏洞披露给相关软件维护方 。

  正因如此,OpenAI此次也同步强化了安全限制 。正式上线版本可以用于安全代码审查和漏洞修复,但会拒绝部分更高级别的攻击性网络安全请求 ,例如直接创建漏洞概念验证攻击代码。

  安全对齐成为此次发布的另一条主线

  相比此前单纯强调能力提升 ,OpenAI此次对Astra的安全和行为边界给予了更多篇幅。

  公司称,在一项测试模型是否会超出授权范围的内部评估中,没有生产安全措施保护的GPT-5.6 Sol有48%的情况会超出预定目标 ,而GPT-6 Astra在该测试中的比例为0% 。

  在另一项计算机操作安全压力测试中,Astra出现不符合预期结果的比例为2.4%,低于Claude Fable 5.1的9.5%和Claude Opus 5的11.5%。

  不过 ,OpenAI同时披露了一个潜在问题:部分评估显示,Astra的书面推理过程比GPT-5.6 Sol更难监控。公司称,这是由于Astra在较简单任务中能够使用更少的显性推理步骤完成问题 ,近来 提升模型行为的可监控性仍是研究重点 。

  API定价每百万输入Token 10美元,输出50美元

  商业化方面,GPT-6 Astra将直接进入OpenAI现有订阅体系。

  Plus、Pro、Business和Enterprise用户将在未来数日陆续获得访问权限 ,Astra的使用量将计入现有订阅额度,用户和企业也可以额外购买使用额度。Pro 、Business和Enterprise用户还将获得GPT-6 Astra Pro版本 。企业管理员需要主动开启Astra,发布初期默认处于关闭状态。

  开发者可以通过OpenAI API调用gpt-6-astra ,微软Azure以及亚马逊Bedrock也将提供该模型。

  OpenAI公布的API标准费用 为每百万输入Token 10美元、每百万输出Token 50美元 ,缓存读写另行计费 。此外,公司还提供Fast模式,处理速度比较高 可以达到标准模式的两倍 ,但费用 也是标准模式的两倍。

  从此次发布可以看出,OpenAI对下一阶段大模型商业化的定位正在进一步变化:单纯提升推理基准已经不是唯一重点,计算机操作、软件开发 、企业办公、科学研究和自动化执行能力正在成为新的竞争核心。

  GPT-6 Astra能否进一步扩大OpenAI在企业AI市场的领先优势 ,最终仍取决于这些测试中的能力能否稳定转化为实际生产效率,以及企业客户是否愿意为更高等级的自动化执行能力支付额外成本 。

©版权声明
THE END