vLLM
吞吐、显存和并发,是 vLLM 关心的三件事。它不提供聊天界面,只把开源模型跑成能扛住线上流量的 API;工具调用、MoE 后端和长上下文缓存都在持续补。
吞吐、显存和并发,是 vLLM 关心的三件事。它不提供聊天界面,只把开源模型跑成能扛住线上流量的 API;工具调用、MoE 后端和长上下文缓存都在持续补。
vLLM 在 9 月 24 日的官方博客中宣布,推理引擎正式支持基于 Gumbel-max 的文本水印功能。这项技术的目标很直接:让模型生成文本的来源可被追溯,同时保证加水印不改变模型的输出分布、不拖慢推理速度。按官方实测,Qwen3.5-27B 开启水印后,各项基准成绩都在误差范围内,吞吐变化在 ...
Hermes Agent 接 vLLM 后如果模型只把工具调用当文字输出,通常不是 Hermes 没接上,而是 vLLM 服务启动时少了工具调用参数。Hermes 默认会用 tool_choice: auto ,vLLM 端也要显式开启。 先检查启动命令 vllm serve meta-llama/...
vLLM 的热度一直很高,因为它踩中的不是“有没有聊天界面”这种上层需求,而是更底层、也更贵的那个问题:模型服务怎么跑得更快、更省显存、更能扛并发。只要你准备自己托管模型 API,而不是单纯本地玩玩,vLLM 基本都会进入候选名单。 官方仓库: https://github.com/vllm-pro...
vLLM 0.17.1 是建立在 0.17.0 之上的补丁版本,但修的都是推理底层很实在的问题。官方列出的内容包括 TRTLLM fused MoE、非 gated fused moe triton、TRTLLM MoE FP8 backend、Mamba/Qwen3.5 SSM cache blo...
vLLM 0.17.0 的价值,依然落在“怎么把大模型推理更稳定地跑进服务里”这件事上。对需要高吞吐、低延迟和更强部署效率的团队来说,vLLM 每一次版本推进都不只是研究层更新,而是会影响线上推理服务质量的基础设施演进。 随着模型体量、并发请求和推理复杂度持续上升,企业越来越难用临时拼接的方式维持服...
vLLM 发布 v0.17.0 版本,官方通过 GitHub Release 公布最新更新。作为大模型高性能推理框架,vLLM 的版本变化通常直接影响吞吐、部署兼容性与推理工程体验,因此在模型服务和推理基础设施圈层里具有很高关注度。 从应用价值看,vLLM 的核心定位不是面向普通用户界面,而是为开发...
Moonshot AI宣布发布Kimi Linear技术报告与开放权重,核心为线性注意力模块Kimi Delta Attention(KDA)与“线性+全注意力(MLA)”的分层混合架构。技术报告(2025年10月30日提交)称,在相同训练配方与规模下,Kimi Linear在短上下文、长上下文与R...