小米直播训练MiMo-V2.6模型 罗福莉披露强化学习进展
AI摘要
由 AI 生成 · 仅供参考
小米MiMo大模型负责人罗福莉透露,团队正通过直播展示MiMo-V2.6模型的强化学习过程。自4月开源MiMo-v2.5后,小米投入近半年探索强化学习扩展边界,目前该模型已扩展计算、环境工具及Grader Compute三项能力,训练花费超125万美元,细节将逐步开源。
驱动中国9月17日消息,小米MiMo大模型负责人罗福莉今日发文披露,小米MiMo团队正在通过直播方式公开MiMo-V2.6模型的训练过程。自今年4月开源MiMo-v2.5模型后,小米团队在近半年时间内专注于探索强化学习技术的扩展极限。
据罗福莉介绍,MiMo-V2.6模型目前处于强化学习的中间阶段。团队为该模型扩展了三项核心能力:在计算层面,每步处理约20亿个Token,采用1,568个Prompt与16条Rollout完全异步的方式运行;在环境与工具层面,实施多任务智能体强化学习,支持在一次运行中混合多个框架;在Grader Compute层面,为打分与评分过程本身增加算力,应用Agentic In-group Credit Assignment技术,并包含测试案例与评分标准奖励机制。
小米MiMo团队计划在未来几周内,逐步开源上述技术细节。罗福莉同时公开了MiMo-V2.6模型的训练直播链接,页面显示该模型即将推出。直播数据显示,该模型训练总花费已超过125万美元,按当前汇率折算约合人民币840.3万元。
版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系
editor@qudong.com。
本文价值
★★★★★
4
2 人已评
登录后为本文打分
评论加载中…