大模型推理优化
排队方式一变,同一张推理卡的吞吐可能差出几倍。连续批处理、推测解码、KV Cache 与上下文缓存各自省下的是哪一段开销,算子库和稀疏架构又能压到什么程度,拆开来看。
排队方式一变,同一张推理卡的吞吐可能差出几倍。连续批处理、推测解码、KV Cache 与上下文缓存各自省下的是哪一段开销,算子库和稀疏架构又能压到什么程度,拆开来看。
连续批处理(Continuous Batching)是大模型服务端的一种动态调度方式:系统不必等同一批请求全部生成完才换下一批,而是在每个生成步结束后移出已完成请求、补入新请求。它主要提高 GPU 利用率和整体吞吐量,面向的是多人同时调用模型时的服务效率。 静态批处理为何容易空等 传统批处理会先凑齐...
推测解码(Speculative Decoding)是一种大模型推理加速方法:先让更轻、更快的草稿模型连续提出几个候选 Token,再由目标大模型一次并行检查。候选被接受时,目标模型一次前向计算就能推进多个位置;不合格的部分则由目标模型纠正。它优化的是生成等待时间,不是把两个模型的答案简单拼接。 慢...
Context Caching 指的是把一段会被反复发送给模型的上下文先缓存起来,后续请求尽量复用,而不是每次都重新处理一遍。它最近会突然变热,原因非常现实:长上下文产品越来越多,但谁都不想重复为同一大段文档、规则或代码库反复付钱。 这个概念经常被误听成“模型记住了我的全部内容”。其实不是。Cont...
混合专家(MoE,Mixture of Experts)是一种“不是每次都让整套模型一起上”的模型架构。它最关键的特点,是把模型里的某些层拆成多个专家模块,再由一个路由器决定当前 token 该走哪些专家。这样模型总参数可以做得很大,但一次真正参与计算的参数没那么大,所以你才会看到很多热门模型写着几...
KV Cache 是 Transformer 推理阶段里非常关键的一层缓存机制。简单说,它会把模型已经算过的一部分 Key 和 Value 先存起来,后面继续生成时直接复用,而不是每次都从头重算。也正因为这样,只要一谈到长对话、长上下文和推理速度,KV Cache 几乎一定会出现。 它为什么能加速 ...
稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。 为什么“全看一遍”会越来越贵 在标准注意力里,文本越长,彼此之间需要计算的关系...
一、摘要 HPC-Ops 是腾讯混元(Hunyuan)AI Infra 团队开源的生产级 LLM 推理算子库,目标是让主流推理卡(尤其是 NVIDIA Hopper/SM90,如 H20)更接近硬件峰值利用率。项目主打从零用 CUDA + CuTe/CUTLASS 打磨 SOTA 内核,并提供相对干...
Moonshot AI宣布发布Kimi Linear技术报告与开放权重,核心为线性注意力模块Kimi Delta Attention(KDA)与“线性+全注意力(MLA)”的分层混合架构。技术报告(2025年10月30日提交)称,在相同训练配方与规模下,Kimi Linear在短上下文、长上下文与R...