OpenAI发布GPT-6系列新成员GPT-6 Sol和GPT-6 Luna,训练方式与GPT-6 Astra类似,把Astra在专业工作、事实性、编码、计算机使用和对齐等方面的先进性能带到更快、更经济的模型上。两款模型API价格比GPT-5.6促销价降50%,已在ChatGPT Work和Codex中开放使用。
一、价格大降,但Astra仍是最强
GPT-6 Sol和Luna的API价格相比GPT-5.6促销价降低50%。不过OpenAI也说了,GPT-6 Astra依然是整体最优秀的模型,想要最佳效果和无妥协体验,还是建议选Astra。
二、跨应用流程测试:Sol优于Opus 5.成本仅9%
在AutomationBench跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5.成本仅为Opus 5每任务成本的9%。high强度下,GPT-6 Luna比前代提升5.4%,每项任务成本降低58%。
三、智能体测试:Sol得分超Opus 5.成本低60%
在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分56.4%,高于Claude Opus 5最高分,每任务成本也降低60%。
四、事实可靠性:Sol错误率约为前代一半
在OpenAI基于去标识化真实世界对话的测试中,GPT-6 Sol错误率约为前代的一半,接近Astra级可靠性且成本更低。GPT-6 Luna的事实可靠性也大幅提升,同时成本更低。
五、编程能力:针对AI Coding Agent优化
GPT-6 Sol和Luna均针对AI Coding Agent工作负载优化。FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol明显提升,以更低成本达到与Claude Fable 5.1 xhigh相当的水平。DeepSWE v1.1测试中,GPT-6 Sol max effort取得68.8%,距Claude Fable 5最高分69.9%仅差1.1个百分点,单任务成本低约80%;GPT-6 Luna max effort取得66.6%,接近Opus 5和Fable 5的medium effort,成本分别低约93%和96%。
六、计算机操作:Astra仍最强,Sol/Luna更便宜
OpenAI表示,GPT-6 Astra仍是计算机操作方面最强的模型,但Sol和Luna能以更低成本完成相关任务。OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%,与Claude Opus 5 medium effort的60.3%接近,单任务成本约低80%。GPT-6 Luna max effort超过GPT-5.6 Sol medium effort,成本约为后者十分之一。
七、沟通风格更清晰,提示缓存更省钱
OpenAI把GPT-6 Astra改进后的沟通风格带到Sol和Luna,官方认为新模型在技术和编程对话中更清晰、术语更少、措辞更自然、低价值细节更少,回答更短但不失实质。此外,GPT-6提示缓存也改进了,默认提供更高缓存命中率,帮智能体重用更多上下文,响应更快、更省钱。
八、价值对齐提升,误导性声明减少
GPT-6 Sol和Luna在价值对齐方面也有提升。在OpenAI官方对齐评估中,Sol和Luna相比GPT-5.6版本均有改进,包括关于其编码工作的误导性声明发生率降低。
九、开放范围与调用方式
GPT-6 Sol和GPT-6 Luna自今日起已在ChatGPT Work和Codex中向所有Plus、Pro、Business、Enterprise和Edu用户开放。免费用户和Go用户可在桌面应用中使用GPT-6 Luna。这些模型目前还没在Chat中提供。在OpenAI API中,它们以gpt-6-sol和gpt-6-luna的形式提供。