InfoQ 中文 发布于 08/26 22:51

535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

查看原文

资讯摘要

11 套英伟达 GB200 连续跑 3 个月,大模型最昂贵的“炼丹过程”被彻底摊开。

AI 摘要

斯坦福CRFM发起Marin开放基础模型项目,公开训练5350亿参数MoE模型。训练将处理18.75万亿Token,运行在11套GB200上,全程公开数据、代码、Loss曲线和实验记录。项目通过缩放梯和开放实验室机制探索AI研究透明度,吴恩达公开支持。

AI 问答

Marin 535B-A23B 中的 A23B 是什么意思?

A23B 表示该 MoE 模型每个 Token 实际激活约 230 亿参数,并非所有 5350 亿参数同时参与计算。

为什么 Marin 选择从 4K 上下文开始预训练?

较短的上下文可在同等 Token 批量下容纳更多独立序列,使专家负载更均衡,从而降低 Token Dropping 比例。此前实验中上下文从 4K 扩展到 65K 时,Token Dropping 从约 7% 升至约 40%。

Marin 项目的核心目标是什么?

让基础模型的训练过程像开源软件一样公开可审查,通过开放实验室机制实时发布数据、代码、Loss 和实验记录,推动 AI 研究的透明化和协作。

打开原文