Hugging Face Blog 发布于 08/25 23:14

Granite 4.2 LLMs: How They're Built

(翻译)Granite 4.2 大语言模型:它们是如何构建的

查看原文

资讯摘要

A Blog post by IBM Granite on Hugging Face

AI 摘要

IBM 发布 Granite 4.2 系列稠密解码器专用推理大模型,提供 3B、8B、30B 三种规模,基于约 15T token 从头预训练,支持 512K 上下文。模型支持思考/非思考切换、低功耗模式和原生工具调用,8B/30B 进一步通过多阶段强化学习训练智能体能力,并以 Apache 2.0 开源。

AI 问答

Granite 4.2 有哪些模型尺寸?

Granite 4.2 提供 3B、8B 和 30B 三种稠密模型尺寸。

Granite 4.2 支持多长的上下文窗口?

通过五阶段预训练策略,上下文窗口扩展至 512K tokens。

Granite 4.2 的强化学习训练使用了什么算法?

采用异步 GRPO(组相对策略优化),并包含多阶段多环境训练流水线。

打开原文