推理前沿:从 10× 加速到自我优化 AI
这期从一个 20 万 token 请求进入推理系统后发生什么讲起,拆开 cache-aware routing、prefill/decode disaggregation、speculative decoding、量化、模型并行与 KV cache 移动等生产细节。Philip Kiely 与 Ali Taha 反复强调,所谓“10× 更快”必须带上硬件与 baseline 条件;同硬件下更常见的提升约为 2–4×。后半段把视野扩展到 Rubin、ASIC、视频 diffusion 与自回归生成,并落到训练与推理逐渐合流:模型已经开始参与分析 profile、改写 GPU kernel,而 continual learning 可能更多依赖持续的 KV 状态与 compaction,而不是不断重写 weights。