vLLM发布0.17.1:TRTLLM MoE与MTP补丁集中落地,高性能推理继续补稳定性
vLLM 0.17.1 是建立在 0.17.0 之上的补丁版本,但修的都是推理底层很实在的问题。官方列出的内容包括 TRTLLM fused MoE、非 gated fused moe triton、TRTLLM MoE FP8 backend、Mamba/Qwen3.5 SSM cache blo...
vLLM 0.17.1 是建立在 0.17.0 之上的补丁版本,但修的都是推理底层很实在的问题。官方列出的内容包括 TRTLLM fused MoE、非 gated fused moe triton、TRTLLM MoE FP8 backend、Mamba/Qwen3.5 SSM cache blo...
CrewAI 在 1.10.2a1 里把重点放在工具层和并发稳定性上。官方新增了通过保存 token 动态注入合适工具的搜索能力,也扩充了 Brave Search 工具,这说明框架正在把工具调用做得更细,而不是只停留在固定挂载工具列表。 同一版里,CrewAI 还修复了多进程并发下的 LockEx...
OpenHands 发布 1.5.0 后,最值得看的不是单个模型适配,而是它把开发代理的交互与执行层一起往前推了一步。官方把任务列表面板、规划代理、技能斜杠菜单和现有会话切换 Git 仓库的能力都放进了这一版,说明产品正在从“能跑一段任务”转向“能长期管理任务流”。 从 release notes ...
LangChain 这次的 1.2.12 虽然是小版本,但更新点很集中:官方明确提到给 wrap model 和 tool call 补 tracing。对 AI 应用框架来说,这类能力不是锦上添花,而是定位问题和解释链路行为的基础设施。 随着工作流越来越复杂,开发者最怕的往往不是功能不够,而是调用...
Google 在关于年轻用户生成式 AI 安全的最新文章里,把路线图拆成几条很清晰的线:年龄适配、隐私保护、内容分类器、对抗测试、人格防护,以及帮助家庭和学生理解 AI 的教育资源。对平台型公司来说,这说明未成年人保护已经不再是附属合规项,而是产品策略的一部分。 文章提到 Google 会通过政策限...
OpenAI 发布了关于 Responses API 计算机环境的新文章,重点不是再讲一次“模型能调工具”,而是把文件、Shell 工具和托管容器一起接进代理运行时。对做自动化助手和 Agent 工作流的团队来说,这代表代理不再只停留在单轮调用,而是开始具备可执行、可持久和可回放的真实工作环境。 这...