LLM

2026年

2025年

大语言模型推理加速之 KV Cache

大模型推理过程 大模型的推理可以分为两个阶段: Prefill: 基于全部Prompt进行前向推理, 得到第一个token。计算密集。 Decoding: 通过自回归方式, 递归输出新的token。内…

3 分钟

搜索文章

让好奇心,找到下一篇好文章。