推理前沿:从每秒 100 个 token 到 10,000 个 token——Cerebras CTO Sean Lie | Latent Space
Cerebras 联合创始人兼 CTO Sean Lie 认为,AI 推理的“快”正在发生数量级变化:100–200 tokens/s 很快会像过去的批处理速度,而 CS4 已演示超过 4,400 tokens/s,CS5 的目标则是让中型模型逼近 10,000 tokens/s、前沿模型达到约 5,000 tokens/s。访谈从晶圆级计算、OpenAI 的超高速推理合作和 Jalapeño 芯片一路谈到 Groq/SRAM 的规模限制、prefill/decode 与 attention/FFN 解耦、模型—硬件协同设计、3D DRAM、供电散热以及中美 AI 软硬件竞争。Sean 的核心判断是:下一阶段的突破不会只来自“更好的单颗芯片”,而是来自数据中心级异构系统、封装、互连、内存和模型架构共同设计。