AMD 和 Cerebras 搞了个"分离式推理"方案,号称每瓦 token 速度提升 5 倍

0 条回复
13 次浏览

Advancing AI 2026 消息,AMD 和 Cerebras 官宣合作了,搞了个挺有意思的 AI 推理架构,简单说下要点:

核心思路:把推理拆成两段,各用各的硬件

  • Prefill 阶段(处理 prompt、大上下文窗口)→ 交给 AMD Helios 机架级方案(Instinct GPU),主打高吞吐
  • Decode 阶段(逐 token 生成)→ 交给 Cerebras Wafer-Scale Engine,主打超低延迟

两边通过一个统一的推理 workflow 串起来,官方说法是"disaggregated inference"(分离式推理)。

关键数据:

  • 对比纯 Cerebras WSE 方案,联合方案预计 每瓦 token 生成速度(T/s/W)提升最高 5 倍(基于 Kimi 2.6 1T 模型建模,2026 年 7 月 AMD 性能实验室数据)
  • 不牺牲吞吐的前提下拿到超低延迟

落地时间:

Cerebras 计划在自己数据中心部署 AMD Helios,联合方案预计 2026 下半年 先通过 Cerebras Cloud 上线。

Lisa Su 原话大意:

AI 推理正在成为 AI 领域最大的基础设施机会之一,工作负载越来越多样化,需要更灵活的方案。和 Cerebras 合作是把 AMD 的领导力延伸到最敏感的延迟场景,给实时 Agent AI 造一个新平台。

原始 PR

发表一个评论

R保持