OpenAI发布GPT-6 Sol与Luna模型,API价格降50%
OpenAI发布GPT-6系列新模型Sol与Luna,API价格较GPT-5.6促销价降低50%。两款模型在性能、成本及可靠性上均有显著提升,其中Sol在多项基准测试中表现优异,Luna则大幅降低任务成本,旨在为开发者提供更具性价比的AI解决方案。
驱动中国9月23日消息,OpenAI今日正式推出GPT-6系列模型的最新成员——GPT-6 Sol和GPT-6 Luna。这两款新模型在保持高性能的同时,API价格相比GPT-5.6的促销价大幅降低50%。
OpenAI官方介绍,GPT-6 Sol和Luna采用了与GPT-6 Astra类似的训练方法,旨在将Astra在专业工作、事实性、编码、计算机使用和对齐等方面的先进性能,融入更快、更经济的模型中。尽管新模型在性价比上有所突破,OpenAI仍强调GPT-6 Astra依然是其整体性能最强的模型,适合追求最佳效果和无妥协体验的用户。
在性能测试方面,GPT-6 Sol在AutomationBench跨应用业务流程测试的xhigh强度下,表现优于Claude Opus 5,且每任务成本仅为Opus 5的9%。GPT-6 Luna在high强度下,相比前代性能提升5.4%,每项任务成本降低58%。在评估智能体能力的Last Exam测试中,GPT-6 Sol在max effort状态下得分56.4%,高于Claude Opus 5的最高分,每任务成本降低60%。
事实可靠性方面,GPT-6 Sol在OpenAI基于去标识化真实对话的测试中,错误率约为前代的一半,接近Astra级可靠性且成本更低。GPT-6 Luna的事实可靠性也显著提升,同时保持了更低的成本。
编程能力上,两款模型均针对AI Coding Agent工作负载进行了优化。在FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol有明显提升,以更低成本达到与Claude Fable 5.1 xhigh相当的水平。在DeepSWE v1.1软件工程测试中,GPT-6 Sol在max effort下取得68.8%的成绩,距离Claude Fable 5的最高成绩69.9%仅差1.1个百分点,单任务成本低约80%。GPT-6 Luna在max effort下取得66.6%,表现接近Opus 5和Fable 5的medium effort,单任务成本分别低约93%和96%。
计算机操作能力方面,OpenAI表示GPT-6 Astra仍是该领域最强的模型,但Sol和Luna能以更低成本完成相关任务。在OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%的成绩,与Claude Opus 5 medium effort的60.3%接近,单任务成本约低80%。GPT-6 Luna max effort则超过GPT-5.6 Sol medium effort,成本约为后者的十分之一。
此外,OpenAI将GPT-6 Astra改进后的沟通风格引入Sol和Luna,新模型在技术和编程对话中更清晰,术语使用更少,回答更简洁且不丢失实质内容。官方还改进了GPT-6的提示缓存,默认提供更高的缓存命中率,帮助开发者在应用重复利用的上下文部分节省更多费用。