摩尔线程公布万卡级集群训练成绩 称国产芯片可训出前沿模型
▪AI快讯1101个月前

MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。
MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。
来源:钛媒体
AI工具集加载中...

MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。
MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。
来源:钛媒体