小米直播训练MiMo-V2.6模型 罗福莉披露强化学习进展

AI 驱动中国 韩序 671次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

小米MiMo大模型负责人罗福莉透露,团队正通过直播展示MiMo-V2.6模型的强化学习过程。自4月开源MiMo-v2.5后,小米投入近半年探索强化学习扩展边界,目前该模型已扩展计算、环境工具及Grader Compute三项能力,训练花费超125万美元,细节将逐步开源。

驱动中国9月17日消息,小米MiMo大模型负责人罗福莉今日发文披露,小米MiMo团队正在通过直播方式公开MiMo-V2.6模型的训练过程。自今年4月开源MiMo-v2.5模型后,小米团队在近半年时间内专注于探索强化学习技术的扩展极限。

据罗福莉介绍,MiMo-V2.6模型目前处于强化学习的中间阶段。团队为该模型扩展了三项核心能力:在计算层面,每步处理约20亿个Token,采用1,568个Prompt与16条Rollout完全异步的方式运行;在环境与工具层面,实施多任务智能体强化学习,支持在一次运行中混合多个框架;在Grader Compute层面,为打分与评分过程本身增加算力,应用Agentic In-group Credit Assignment技术,并包含测试案例与评分标准奖励机制。

小米MiMo团队计划在未来几周内,逐步开源上述技术细节。罗福莉同时公开了MiMo-V2.6模型的训练直播链接,页面显示该模型即将推出。直播数据显示,该模型训练总花费已超过125万美元,按当前汇率折算约合人民币840.3万元。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 4 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友