vLLM发布0.17.1:TRTLLM MoE与MTP补丁集中落地,高性能推理继续补稳定性
vLLM 0.17.1 是建立在 0.17.0 之上的补丁版本,但修的都是推理底层很实在的问题。官方列出的内容包括 TRTLLM fused MoE、非 gated fused moe triton、TRTLLM MoE FP8 backend、Mamba/Qwen3.5 SSM cache blo...
vLLM 0.17.1 是建立在 0.17.0 之上的补丁版本,但修的都是推理底层很实在的问题。官方列出的内容包括 TRTLLM fused MoE、非 gated fused moe triton、TRTLLM MoE FP8 backend、Mamba/Qwen3.5 SSM cache blo...
CrewAI 在 1.10.2a1 里把重点放在工具层和并发稳定性上。官方新增了通过保存 token 动态注入合适工具的搜索能力,也扩充了 Brave Search 工具,这说明框架正在把工具调用做得更细,而不是只停留在固定挂载工具列表。 同一版里,CrewAI 还修复了多进程并发下的 LockEx...
OpenHands 发布 1.5.0 后,最值得看的不是单个模型适配,而是它把开发代理的交互与执行层一起往前推了一步。官方把任务列表面板、规划代理、技能斜杠菜单和现有会话切换 Git 仓库的能力都放进了这一版,说明产品正在从“能跑一段任务”转向“能长期管理任务流”。 从 release notes ...
LangChain 这次的 1.2.12 虽然是小版本,但更新点很集中:官方明确提到给 wrap model 和 tool call 补 tracing。对 AI 应用框架来说,这类能力不是锦上添花,而是定位问题和解释链路行为的基础设施。 随着工作流越来越复杂,开发者最怕的往往不是功能不够,而是调用...
Google 在关于年轻用户生成式 AI 安全的最新文章里,把路线图拆成几条很清晰的线:年龄适配、隐私保护、内容分类器、对抗测试、人格防护,以及帮助家庭和学生理解 AI 的教育资源。对平台型公司来说,这说明未成年人保护已经不再是附属合规项,而是产品策略的一部分。 文章提到 Google 会通过政策限...
OpenAI 发布了关于 Responses API 计算机环境的新文章,重点不是再讲一次“模型能调工具”,而是把文件、Shell 工具和托管容器一起接进代理运行时。对做自动化助手和 Agent 工作流的团队来说,这代表代理不再只停留在单轮调用,而是开始具备可执行、可持久和可回放的真实工作环境。 这...
Google 发布一篇关于 AI 帮助改善澳大利亚农村地区心脏健康的官方文章,把 AI 的价值从模型能力展示拉向更具体的医疗服务场景。相比常见的效率类叙事,这类案例更强调 AI 在公共健康覆盖与基层服务中的现实作用。 从公开内容看,Google 关注的是如何借助 AI 提升心脏健康筛查与医疗触达能力...
OpenAI 发布 Rakuten 使用 Codex 的案例,把焦点放在企业研发效率提升上。相比单纯展示模型能力,这类客户案例更直接说明 AI 编程代理正在进入真实软件团队,并开始影响故障修复、评审和交付节奏。 按照公开描述,Rakuten 借助 Codex 缩短了问题修复时间,也让代码审查与交付流...