Source: 澎湃新闻 ↗
每小时成本超3万美元!沉寂半年后小米罗福莉直播大模型训练过程
|
Traduction indisponible. Veuillez réessayer.
Ce que rapporte la source
沉寂半年后,小米罗福莉再次卷入大模型“厮杀”战场,并全程直播大模型训练过程。9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文表示,目前正在研究强化学习(RL)能走多远。目前,小米旗下最新大模型MiMo-V2.6正处于其RL运行的中途,在此期间,团队正在进行三方面扩展:第一是计算资源(每步约20亿token,1568个提示×16次rollout,完全异步),第二是环境和测试框架(多任务代理式RL,在一次运行中混合多个测试框架),第三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励),并透露将在未来几周逐步开源细节。罗福莉分享了MiMo-V2.6的实时训练页面,这也是外界首次看到这一代模型强化学习阶段的部分训练状态。从罗福莉公开的训练页面来看,MiMo-V2.6正在进行一次大规模Agent(智能体)强化学习实验。页面展示模型训练进度、Toke...
Lire l'article original sur 澎湃新闻 ↗