GPT-6 Astra来了。
(资料图片仅供参考)
当地时间9月3日,OpenAI正式发布GPT-6 Astra,并将其定义为“新一代智能”。Astra在拉丁语中意为“星辰、群星”。ChatGPT官方在发布前曾预告:“The stars are almost aligned(星星几乎排列好了)。”
OpenAI称,Astra是“当今世界智能水平最高、对齐表现最好的模型”,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现进一步突破。
OpenAI CEO山姆·奥特曼(Sam Altman)发文表示,希望Astra能够开启“新一代的创业、科学发现与创造”,并认为Astra在电脑操作、专业工作、科学研究、编程、网络安全等诸多领域,都是“最强的模型”。
OpenAI总裁格雷格·布罗克曼(Greg Brockman)更进一步表示,人们未来或许会回头将这个时间、这个模型视为AGI(通用人工智能)到来的节点,并称:“欢迎进入AGI时代。”
星星排列好了,GPT-6 Astra正式发布。
“能干活”
据介绍,在电脑操作方面,Astra可以自主填写网络表单、更新CRM客户记录、整理日历,也可以进行网络搜索、在邮件或文档编辑器中撰写总结;还可以分析科学数据、生成图表、创建网站,并运行前端质量测试。对于软件开发任务,Astra可以自主安装和测试软件,并根据屏幕上出现的问题进行排查。
与传统聊天机器人不同,用户可以向其直接给出一个目标。例如,“帮我整理一份财务分析并做成演示文稿”,或者“开发一个游戏原型并测试它是否能正常运行”。模型需要自己拆解任务、调用不同工具、持续执行,再把最终结果交付出来。
在OSWorld 2.0测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%;在延迟模拟环境下,Astra完成一项任务平均约需40分钟,而GPT-5.6 Sol约需75分钟,OpenAI据此称Astra完成任务所需时间约减少47%。
在Mind2Web测试中,结合更新后的Codex harness后,Astra的任务完成速度达到当前GPT-5.6 Sol体验的1.9倍。
在OSWorld 2.0测试中,Astra得分72.6%。
奥特曼在接受外媒采访时表示,Astra在主观体验上与此前任何模型都非常不同,这是第一个让他觉得可以放心让用户直接“试一试”的模型。用户可以让Astra构建复杂互动软件、开发电脑游戏、进行DIY电子工程、运行科学模拟,甚至制作财务模型并同步生成PPT演示文稿。
OpenAI表示,Astra将复杂推理与多步骤工作流结合起来,可以直接生成和处理文档、电子表格和演示文稿,并能够遵循已有模板、调整页面布局,同时尽可能只提取与任务相关的信息。
OpenAI公布的Professional评测中,Astra在AutomationBench取得41.4%,GPT-5.6 Sol为18.1%;在BenchCAD中分别为95.9%和83.3%;在BrowseComp中分别为91.5%和90.4%。
这些指标分别覆盖自动化任务、计算机辅助设计以及网络信息检索等不同工作场景。其中,AutomationBench的差距尤其明显。Astra的成绩达到41.4%,GPT-5.6 Sol为18.1%。
OpenAI公布的企业案例也显示,Astra正在被用于更加接近真实生产流程的任务。
法律科技公司Legora使用Astra进行财务报表审阅,在其相关基准中,Astra带来约40%的提升,并在一次Agent运行中用几分钟审阅41份文件,同时发现了人为埋设的4处错误。游戏开发公司Playco则使用Astra进行游戏原型开发。在其测试中,人工修复工作减少50%,并从一个灰盒基础原型制作出3个不同主题的游戏原型。
科学研究也是此次GPT-6升级的重要方向。
OpenAI称,Astra在数学和科学领域取得新的纪录。在FrontierMath Tier 4(v2)中,Astra得分97.6%。在ARC-AGI-3中,OpenAI给出的成绩为99.9%;在GPQA Diamond中为96.0%。在科学和健康相关评测中,Astra在GeneBench Pro中取得37.8%,MedChemBench为49.3%,LifeSciBench为60.3%,HealthBench Professional为63.4%。
OpenAI还强调,Astra可以将科学推理和电脑操作结合起来,直接进入专业软件检查数据、探索结果,帮助研究人员分析证据,并决定下一步值得研究什么。
OpenAI称,Astra已经帮助解决一些长期存在的数学开放问题,并公布了关于质数间隔的新结果。
Coding依然是核心战场
编程能力仍然是GPT-6 Astra的重要卖点。
OpenAI称,Astra是其迄今为止“最强的软件工程模型”。在Terminal-Bench 4.0中,Astra得分57.7%,GPT-5.6 Sol为37.3%;在DeepSWE v1.1中,Astra为74.1%,GPT-5.6 Sol为72.7%;在FrontierCode 1.1 Extended中,Astra为64.5%,GPT-5.6 Sol为60.6%;在内部数据库迁移任务中,Astra为63.9%,GPT-5.6 Sol为42.7%。
在Terminal-Bench 4.0中,Astra得分57.7%。
OpenAI此次还改进了Astra处理超长编程任务的方式。
在过去的长时间编码任务中,当上下文窗口被占满时,模型通常需要对此前的工作进行压缩总结。这样做虽然可以继续工作,但一些细节可能在压缩过程中丢失。
Astra在Codex中引入了新的上下文保存机制,可以跨上下文窗口保留之前的笔记,并在之后检索此前的需求、测试结果以及工具输出。
“看得住”
GPT-6 Astra此次还特别强调了在网络安全领域的能力。
在ExploitBench测试中,Astra取得100%的成绩,GPT-5.6 Sol为78.5%;在ExploitGym中,Astra的成功率为42.4%,GPT-5.6 Sol为30.3%。在SRE-Bench中,Astra单次尝试解决率为88.0%,四次尝试解决率为99.2%;GPT-5.6 Sol对应为55.9%和68.7%。
OpenAI进一步披露,在一项内部测试中,Astra发现并利用了两个此前未知的漏洞,目前OpenAI正在向相关维护者披露这两个漏洞。
OpenAI认定,Astra已经达到网络安全“Critical”能力阈值。按照OpenAI的定义,这意味着模型在获得适当工具和访问权限后,可以发现此前未知的安全漏洞,并在没有人持续指导每一步的情况下,针对多个受到较好防护的系统开发攻击路径。
OpenAI官方称,当前版本的Astra会拒绝更高级的网络安全任务,例如生成漏洞概念验证利用代码;通过OpenAI Daybreak,未来才会逐步扩大防御性网络安全能力的开放范围。
奥特曼表示,Astra之所以比原本预期更晚发布,一个重要原因就是OpenAI花费了更多时间做安全与对齐。“当这些模型变得越来越强大时,我们必须化解的风险也变得更加严重。如果我们没做好防护,模型可能会造成更大的破坏”。
OpenAI CEO山姆·奥特曼
OpenAI此次还专门测试了Astra是否会超出用户原本授权的范围。
在一项内部评测中,在没有生产级安全防护的情况下,GPT-5.6 Sol有48%的时间超出授权目标,而GPT-6 Astra这一比例为0%。
同时,OpenAI也指出,Astra的书面推理过程比GPT-5.6 Sol更难监控。
官方解释称,一方面,Astra在简单任务上拥有更强的书面推理控制能力,可以用更少的步骤解决问题;另一方面,这也意味着传统的思维链监控难度正在增加。
OpenAI因此继续加强对模型推理和行为的监控,并在外部部署中加入对模型完整行为轨迹的监测,在发现潜在的失调行为时进行干预。
奥特曼也特别强调,即使这意味着无法最大化原本可能获得的模型能力,OpenAI也希望保留足够的监控能力。
GPT-5.6 Sol有48%的时间超出授权目标,而GPT-6 Astra这一比例为0%。
GPT-6 Astra目前正在分阶段开放。模型首先面向少量组织推出,随后将在接下来几天向ChatGPT Plus、Pro、Business和Enterprise用户开放,同时通过OpenAI API和AWS提供。面向开发者,GPT-6 Astra已在OpenAI API中以gpt-6-astra提供,同时也在亚马逊Bedrock上线。
奥特曼称,正努力让Astra尽快交到每个人手中,“应该很快了”。
目前,OpenAI API给Astra设定的标准价格为每百万输入Token 10美元、每百万输出Token 50美元,缓存读取和写入另行收费。Fast模式最高可以达到标准处理速度的2倍,价格也为标准价格的2倍。
OpenAI表示,虽然Astra的单Token价格更高,但由于其能够以更少的输出Token完成复杂任务,在一些场景下,实际完成一个任务的成本反而低于此前模型。
奥特曼表示,OpenAI的目标是提供“极其廉价且丰沛的智能”,未来还将继续大幅降低价格。
奥特曼还对上市做出了最新表态,他表示:“如果我们有一天真的上市,我假定我们会,我打算花大量时间提醒那些想买或不想买我们股票的人:我们是使命优先的,而且我们也是极度面向长期的。因此,我们会针对这项技术做出我们认为对整个社会最有利的决策,并且我们会在数十年的时间跨度上来做决策。”