AMD 与 Cerebras 合作发布超低延迟高吞吐 AI 推理解耦方案
AMD 与 Cerebras 宣布技术合作,在 Advancing AI 2026 上发布解耦式 AI 推理方案:AMD Helios 机架级方案负责高吞吐 prompt 处理,Cerebras 晶圆级引擎负责超低延迟的 token 生成,双方建模显示组合方案每瓦 token 生成速率最高可达单用 Cerebras WSE 的 5 倍。
AI 生成摘要 · 以原文为准
关注理由:两家公司以解耦推理组合高吞吐 GPU 与低延迟晶圆级引擎,为推理基础设施按负载分层选型提供了新的架构方向,并明确部署时间点。