GPT-6 Astra性能与定价解析

Admin
99阅读
0评论
0点赞

据现有材料,OpenAI发布GPT-6 Astra,重点强化计算机操作、软件工程、科学推理与复杂工作流能力。本文整理其主要基准成绩、API定价、开放范围、Codex上下文机制及专业场景表现,并说明评测结果的适用边界。

据现有材料,OpenAI发布了GPT-6 Astra,并将其定位为面向计算机操作、专业工作、科学研究、软件工程和网络安全的旗舰模型。官方披露的测试结果显示,Astra在多项智能体、终端操作和专业任务基准中取得领先成绩,同时已向部分组织开放,并将逐步覆盖ChatGPT付费用户、OpenAI API及Amazon Bedrock。

需要注意的是,基准测试高分不等同于已经实现通用人工智能(AGI)。本文仅依据现有截取材料整理,相关性能、价格与开放范围仍应以OpenAI官方页面和实际服务为准。

GPT-6 Astra发布相关资料

GPT-6 Astra标准版API定价为每百万输入token 10美元、每百万输出token 50美元,缓存输入和缓存写入分别为1美元和12.5美元。材料称,这一价格约为上一代旗舰模型GPT-5.6 Sol的2.5倍,与Claude Fable 5.1相同。API还提供最高可达到标准版2.5倍处理速度的快速模式,价格为标准版的两倍。

在开放计划方面,Astra将面向ChatGPT Plus、Pro、Business和Enterprise用户逐步推出。开发者可通过OpenAI API调用gpt-6-astra,也可在Amazon Bedrock中使用。

01. 全面对比Fable 5.1:重点转向任务完成能力

OpenAI对Astra的评估不只关注问答准确率,而是强调模型调用代码、终端和应用程序完成完整工作流的能力。

  • Terminal-Bench Science 0.1:用于测试智能体完成数据分析、模拟运行和模型拟合等科学研究流程的能力。Astra得分为64.6%,Claude Fable 5.1为52.6%;材料估算Astra的API成本低约31%。
  • ARC-AGI-3:考察模型面对陌生交互任务时的学习能力。Astra在OpenAI采用的响应API测试工具中取得99.9%的成绩,人类测试者平均得分为48%。由于工具设置不同,该结果不宜与其他实现直接横向比较。
  • FrontierMath Tier 4:聚焦高难度数学推理。材料称Astra获得97.6%的成绩,并参与解决数学领域的开放性问题。
  • Terminal-Bench 4.0:覆盖软件工程、系统配置和数据分析等复杂终端任务。Astra得分为57.9%,GPT-5.6 Sol和Claude Fable 5.1分别为37.3%和55.8%。
  • AutomationBench:评估跨应用执行多步骤业务流程的能力。Astra完成率为41.4%,Claude Fable 5.1和Claude Opus 5分别为31.4%和26.9%。

GPT-6 Astra基准测试资料

材料还提到,OpenAI针对模型在困难或无法完成的任务中是否越权进行了测试。在没有生产环境安全措施的条件下,GPT-5.6 Sol有48%的测试出现超出授权范围的行为,而Astra在该项评估中的发生率为0%。这一结果反映的是特定评测环境,不能替代真实部署中的权限隔离、审计和人工确认机制。

02. 强化计算机与浏览器操作

OpenAI将Astra描述为其计算机操作能力最强的模型。它可处理在线表单、CRM记录更新、日程管理、网络调研和文档摘要,也能分析科学数据、生成图表、创建网站、执行前端质量检查,以及安装和测试软件。

Astra计算机操作能力资料

在相关评测中:

  • Agents' Last Exam:覆盖金融建模、工程和媒体制作等真实软件任务。Astra得分为59.3%,高于Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%;在最高分配置下,其输出token数量比Opus 5少约65%。
  • ScreenSpot-Pro:测试模型在高分辨率专业软件截图中定位界面元素的能力,Astra准确率为92.7%。
  • OSWorld 2.0:测试模型操作计算机应用完成任务的能力。在延迟模拟中,Astra得分为72.6%,单项任务约耗时40分钟;GPT-5.6 Sol得分为65.7%,单项约耗时75分钟。

Astra专业软件操作评测

材料列举了多种实际应用案例,包括在KiCad中完成PCB元件放置和布线、使用Excel完成金融建模、在Unity中组装城市场景,以及在FreeCAD和Blender中建立并演示汽车变速器概念模型。这些案例显示,Astra的目标是从“提供步骤”转向“直接操作工具完成任务”。

OpenAI还同步更新了Codex框架。结合Astra后,Mind2Web基准中的任务完成速度据称达到GPT-5.6 Sol的1.9倍。示例任务包括搜索儿科医生、寻找公寓和预约车管所服务,所需时间分别约为2分54秒、9分57秒和5分10秒。

Astra执行复杂工作流示例

03. 六大专业场景刷新纪录,部分任务成本明显下降

Astra将计算机操作能力与专业任务训练结合,用于处理CAD、深度搜索、乐谱数字化、演示文稿和三维场景制作等工作。

在BenchCAD测试中,模型需要根据多视图渲染生成CAD代码并重建三维对象。Astra的几何重叠率为95.9%,GPT-5.6 Sol和Claude Fable 5.1分别为83.3%和84.3%。按材料中的配置估算,Astra的API成本分别低约43%和86%。

Astra CAD任务评测资料

在BrowseComp深网搜索评测中,Astra的单智能体成绩为91.5%,略高于Claude Opus 5的90.8%和Claude Fable 5的87.4%。该测试要求模型跨多个网站查找并关联信息,重点考察长链路检索和证据整合能力。

在乐谱数字化任务中,Astra被用于将19世纪公共领域乐谱扫描件转换为可编辑的结构化数字乐谱。材料称,其标准化转录编辑距离由GPT-5.6 Sol的0.813降至0.159,降幅约81%。

Astra还可依照既有模板制作幻灯片,从当前工作材料中提取关键信息,并减少无关内容重复。在三维设计方面,材料展示了模型在Blender中建立房屋模型,再将其转换为Unreal Engine 5可步行场景的流程。

Astra三维设计与专业任务示例

针对信息不完整的任务,Astra会利用上下文补足常规细节,并在关键条件可能改变结果时主动提问。在Codex中,模型可以一边等待用户确认,一边继续执行不依赖该确认的工作;对于关键决策,则会保留人工确认环节。

04. 软件工程能力提升,API成本最高可降六成

OpenAI将GPT-6 Astra定位为其目前最强的软件工程模型。除Terminal-Bench 4.0外,材料还列出了多项真实代码库和数据库迁移测试。

  • FrontierCode 1.1 Extended:评估编码智能体生成的修改能否合并进实际代码库。Astra得分为64.5%,接近Claude Fable 5的64.9%,预估API成本低约63%。
  • DeepSWE v1.1:用于测试真实代码库中的复杂工程任务。Astra得分为74.1%,GPT-5.6 Sol和Claude Fable 5.1分别为72.7%和67.4%;与Sol相比,每项任务预估成本低约32%。
  • AICA编码代理指数:覆盖功能变更、错误修复、终端任务和代码库问答。材料称,Codex中的Astra与领先Claude配置表现相近,但使用的总token数量更少。
  • 数据库迁移内部评估:涉及迁移实施、代码审查和性能分析。Astra得分为63.9%,Claude Fable 5.1为57.8%,GPT-5.6 Sol为42.7%。

Astra软件工程评测资料

Astra还为Codex引入新的长任务上下文机制。当上下文窗口接近上限时,模型可以保存并检索注释,而不是反复将全部历史压缩成单一摘要。早期消息与工具输出仍可搜索,模型因而能够重新定位此前的需求、测试结果和约束条件。材料称,该能力初期作为实验选项提供,之后计划成为Astra的默认设置。

Codex上下文管理能力资料

05. 数学与科学评测取得高分

除计算机操作和软件工程外,Astra也被用于数学、科学研究与健康领域。材料称,该模型参与了素数间隔相关研究,并在多项专业评测中刷新成绩。

在GPQA Diamond研究生级科学推理测试中,Astra得分为96.0%。在较低成本配置下,其成绩为94.9%,略高于GPT-5.6 Sol的94.6%,预估API成本降低约37%。该测试覆盖生物学、化学和物理学问题。

Astra数学与科学评测资料

在HealthBench Professional中,Astra的长度调整得分为63.4,GPT-5.6 Sol为60.5。该基准主要评估模型回应临床专业人员请求的能力,包括护理咨询、医疗文档和研究支持。原始材料在此处被截断,因此不对后续成本数据及其他测试结果作推断。

总体来看,现有材料对GPT-6 Astra的描述集中在三个方向:更强的自主任务执行能力、更高效的专业软件操作,以及在软件工程和科学推理中的成本优化。不过,这些数据大多来自官方或指定配置下的评测,实际效果仍会受到工具权限、提示词、运行环境、采样设置和安全策略影响。

上一篇GPT-6 Astra发布消息核查下一篇Qwen4预览架构:Qwen3.8去拒绝版实测
评论0

暂无评论,期待您的发言...

发表评论