您所在的位置:PC下载网 > 软件教程 > 业界资讯  > 

OpenAI发布GPT-6 Sol与Luna:性能更强,API价格降一半

OpenAI发布GPT-6 Sol与Luna:性能更强,API价格降一半

编辑:pcsoft资讯 来源:互联网 时间:2026-10-08 17:34:01

      OpenAI发布GPT-6系列新成员GPT-6 Sol和GPT-6 Luna,训练方式与GPT-6 Astra类似,把Astra在专业工作、事实性、编码、计算机使用和对齐等方面的先进性能带到更快、更经济的模型上。两款模型API价格比GPT-5.6促销价降50%,已在ChatGPT Work和Codex中开放使用。

文章配图

      一、价格大降,但Astra仍是最强

      GPT-6 Sol和Luna的API价格相比GPT-5.6促销价降低50%。不过OpenAI也说了,GPT-6 Astra依然是整体最优秀的模型,想要最佳效果和无妥协体验,还是建议选Astra。

文章配图

      二、跨应用流程测试:Sol优于Opus 5.成本仅9%

      在AutomationBench跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5.成本仅为Opus 5每任务成本的9%。high强度下,GPT-6 Luna比前代提升5.4%,每项任务成本降低58%。

文章配图

文章配图

      三、智能体测试:Sol得分超Opus 5.成本低60%

      在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分56.4%,高于Claude Opus 5最高分,每任务成本也降低60%。

文章配图

文章配图

      四、事实可靠性:Sol错误率约为前代一半

      在OpenAI基于去标识化真实世界对话的测试中,GPT-6 Sol错误率约为前代的一半,接近Astra级可靠性且成本更低。GPT-6 Luna的事实可靠性也大幅提升,同时成本更低。

      五、编程能力:针对AI Coding Agent优化

      GPT-6 Sol和Luna均针对AI Coding Agent工作负载优化。FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol明显提升,以更低成本达到与Claude Fable 5.1 xhigh相当的水平。DeepSWE v1.1测试中,GPT-6 Sol max effort取得68.8%,距Claude Fable 5最高分69.9%仅差1.1个百分点,单任务成本低约80%;GPT-6 Luna max effort取得66.6%,接近Opus 5和Fable 5的medium effort,成本分别低约93%和96%。

      六、计算机操作:Astra仍最强,Sol/Luna更便宜

      OpenAI表示,GPT-6 Astra仍是计算机操作方面最强的模型,但Sol和Luna能以更低成本完成相关任务。OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%,与Claude Opus 5 medium effort的60.3%接近,单任务成本约低80%。GPT-6 Luna max effort超过GPT-5.6 Sol medium effort,成本约为后者十分之一。

文章配图

      七、沟通风格更清晰,提示缓存更省钱

      OpenAI把GPT-6 Astra改进后的沟通风格带到Sol和Luna,官方认为新模型在技术和编程对话中更清晰、术语更少、措辞更自然、低价值细节更少,回答更短但不失实质。此外,GPT-6提示缓存也改进了,默认提供更高缓存命中率,帮智能体重用更多上下文,响应更快、更省钱。

文章配图

      八、价值对齐提升,误导性声明减少

      GPT-6 Sol和Luna在价值对齐方面也有提升。在OpenAI官方对齐评估中,Sol和Luna相比GPT-5.6版本均有改进,包括关于其编码工作的误导性声明发生率降低。

文章配图

      九、开放范围与调用方式

      GPT-6 Sol和GPT-6 Luna自今日起已在ChatGPT Work和Codex中向所有Plus、Pro、Business、Enterprise和Edu用户开放。免费用户和Go用户可在桌面应用中使用GPT-6 Luna。这些模型目前还没在Chat中提供。在OpenAI API中,它们以gpt-6-sol和gpt-6-luna的形式提供。

文章配图

PC下载站网友:
共有12条评论