AMD 和 Cerebras 搞了个"分离式推理"方案,号称每瓦 token 速度提升 5 倍
Advancing AI 2026 消息,AMD 和 Cerebras 官宣合作了,搞了个挺有意思的 AI 推理架构,简单说下要点:
核心思路:把推理拆成两段,各用各的硬件
- Prefill 阶段(处理 prompt、大上下文窗口)→ 交给 AMD Helios 机架级方案(Instinct GPU),主打高吞吐
- Decode 阶段(逐 token 生成)→ 交给 Cerebras Wafer-Scale Engine,主打超低延迟
两边通过一个统一的推理 workflow 串起来,官方说法是"disaggregated inference"(分离式推理)。
关键数据:
- 对比纯 Cerebras WSE 方案,联合方案预计 每瓦 token 生成速度(T/s/W)提升最高 5 倍(基于 Kimi 2.6 1T 模型建模,2026 年 7 月 AMD 性能实验室数据)
- 不牺牲吞吐的前提下拿到超低延迟
落地时间:
Cerebras 计划在自己数据中心部署 AMD Helios,联合方案预计 2026 下半年 先通过 Cerebras Cloud 上线。
Lisa Su 原话大意:
AI 推理正在成为 AI 领域最大的基础设施机会之一,工作负载越来越多样化,需要更灵活的方案。和 Cerebras 合作是把 AMD 的领导力延伸到最敏感的延迟场景,给实时 Agent AI 造一个新平台。