JetBrains发布Mellum2.1模型 智能体编程增强
JetBrains上线Mellum2.1模型,延续12B混合专家架构与Apache 2.0许可,重点增强智能体编程能力,并通过强化学习训练与多Token预测提升性能,高负载推理吞吐接近Qwen3.5-9B两倍。
驱动中国10月9日消息,JetBrains于10月8日发布Mellum2.1模型,重点增强智能体编程能力。该模型延续Mellum2的12B混合专家架构,拥有2.5B活跃参数,并继续以Apache 2.0许可证发布。
在训练层面,Mellum2.1将预训练后的强化学习从短期收尾环节扩展为主体训练阶段,并围绕数学、算法竞赛、科学、工具使用与软件工程等任务补充训练数据。
JetBrains为模型搭建内部强化学习环境基础设施,训练期间启动数百万个沙盒,覆盖数千个环境。训练前,团队还筛选开放数据集,剔除测试缺陷、不可验证答案及难度失当的任务。
能力方面,Mellum2.1可探索代码库、编辑文件并检查自身修改。JetBrains表示,最大改进集中在智能体编程场景,模型可识别失败测试的根因,起草修复方案并验证结果。
性能方面,Mellum2.1与Mellum2架构一致,速度保持不变;多Token预测(MTP)进一步提升响应速度,单请求场景下速度提高约1.6倍。
在相同评估设置下,JetBrains将Mellum2.1与Mellum2、Qwen3.5-9B及Gemma 4 E4B进行比较。结果显示,高负载时Mellum2.1推理吞吐Token数量接近Qwen3.5-9B的两倍,并在编程、算法竞赛、数学、工具调用和通用知识等维度均有提升。
Mellum2.1已登陆Hugging Face,支持本地或自有基础设施部署,企业可将代码和数据保留在自身环境中。官方后续将推出面向llama.cpp、Ollama和LM Studio的GGUF版本,以及vLLM的MTP推测解码组件。