ToolNavs 发现实用AI工具
提交工具 登录

大模型推理优化

排队方式一变,同一张推理卡的吞吐可能差出几倍。连续批处理、推测解码、KV Cache 与上下文缓存各自省下的是哪一段开销,算子库和稀疏架构又能压到什么程度,拆开来看。

连续批处理把调度粒度缩到单个生成步;推测解码让小模型起草、大模型一次验收;KV Cache 复用注意力状态,Context Caching 留下长文档的重复结果。MoE 每次只激活少数专家,Kimi Linear 把百万上下文的 KV 缓存砍掉约 75%。收益看任务:代码吃长草稿,发散创作未必。
连续批处理是什么?大模型服务为何要按生成步调度请求

连续批处理是什么?大模型服务为何要按生成步调度请求

连续批处理(Continuous Batching)是大模型服务端的一种动态调度方式:系统不必等同一批请求全部生成完才换下一批,而是在每个生成步结束后移出已完成请求、补入新请求。它主要提高 GPU 利用率和整体吞吐量,面向的是多人同时调用模型时的服务效率。 静态批处理为何容易空等 传统批处理会先凑齐...

Admin
143
Context Caching 是什么?为什么它正在成为长上下文产品的成本关键字

Context Caching 是什么?为什么它正在成为长上下文产品的成本关键字

Context Caching 指的是把一段会被反复发送给模型的上下文先缓存起来,后续请求尽量复用,而不是每次都重新处理一遍。它最近会突然变热,原因非常现实:长上下文产品越来越多,但谁都不想重复为同一大段文档、规则或代码库反复付钱。 这个概念经常被误听成“模型记住了我的全部内容”。其实不是。Cont...

Admin
129
混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE,Mixture of Experts)是一种“不是每次都让整套模型一起上”的模型架构。它最关键的特点,是把模型里的某些层拆成多个专家模块,再由一个路由器决定当前 token 该走哪些专家。这样模型总参数可以做得很大,但一次真正参与计算的参数没那么大,所以你才会看到很多热门模型写着几...

Admin
123
稀疏注意力(Sparse Attention)是什么?为什么长上下文和推理成本问题总会谈到它

稀疏注意力(Sparse Attention)是什么?为什么长上下文和推理成本问题总会谈到它

稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。 为什么“全看一遍”会越来越贵 在标准注意力里,文本越长,彼此之间需要计算的关系...

Admin
124