Marin 535B-A23B 中的 A23B 是什么意思?
A23B 表示该 MoE 模型每个 Token 实际激活约 230 亿参数,并非所有 5350 亿参数同时参与计算。

11 套英伟达 GB200 连续跑 3 个月,大模型最昂贵的“炼丹过程”被彻底摊开。
斯坦福CRFM发起Marin开放基础模型项目,公开训练5350亿参数MoE模型。训练将处理18.75万亿Token,运行在11套GB200上,全程公开数据、代码、Loss曲线和实验记录。项目通过缩放梯和开放实验室机制探索AI研究透明度,吴恩达公开支持。
A23B 表示该 MoE 模型每个 Token 实际激活约 230 亿参数,并非所有 5350 亿参数同时参与计算。
较短的上下文可在同等 Token 批量下容纳更多独立序列,使专家负载更均衡,从而降低 Token Dropping 比例。此前实验中上下文从 4K 扩展到 65K 时,Token Dropping 从约 7% 升至约 40%。
让基础模型的训练过程像开源软件一样公开可审查,通过开放实验室机制实时发布数据、代码、Loss 和实验记录,推动 AI 研究的透明化和协作。