视觉—语言一体化升级:Qwen3-VL-Flash 提供代理控制、长上下文与视频时序理解
阿里云宣布 Qwen3-VL-Flash 已在 Model Studio 上线,面向图像与视频理解提供“思考模式/非思考模式”两种推理路径。官方文档显示,qwen3-vl-flash 系列在非思考/思考模式下的上下文上限分别约为 260,096/258,048 tokens(按区间计费),并支持每张...
阿里云宣布 Qwen3-VL-Flash 已在 Model Studio 上线,面向图像与视频理解提供“思考模式/非思考模式”两种推理路径。官方文档显示,qwen3-vl-flash 系列在非思考/思考模式下的上下文上限分别约为 260,096/258,048 tokens(按区间计费),并支持每张...
多家科技媒体转述《The Information》报道称,OpenAI 正向部分公司推介在其网站提供“Sign in with ChatGPT”(用 ChatGPT 登录)的选项,使用方式类似“用 Google/Facebook 登录”。报道还称,合作方可将调用 OpenAI 模型所产生的成本转移给...
2025 年 10 月 17 日,Manus 官方发布 Manus 1.5。根据发布页与更新日志,1.5 版本在架构上重构以提升速度与稳定性,官方称平均任务用时较早期版本显著下降,并在内部基准中带来质量提升与用户满意度改善。新版本同时扩大了单次任务的可用上下文,面向较长对话与更复杂流程,减少信息丢失...
Kiro 宣布移除候补名单,即日起面向所有用户开放注册与使用。官方博客与社交账号同步确认,新的激活用户在限时活动期内可获 500 点免费额度,用于体验其“规范驱动开发”(Spec-Driven Development)与“vibe coding”等能力。额度以单一积分池计量,不同任务按复杂度消耗,便...
Google 宣布将最新图像编辑模型 Nano Banana 接入搜索场景,在 Google 应用的 Lens 与 AI Mode 中即可生成或编辑图像。根据官方说明与多家科技媒体报道,用户在 Android 或 iOS 打开 Lens,进入新上线的 Create 模式(黄色香蕉图标),可直接输入提...
2025 年 10 月 16 日,PaddleOCR 宣布推出多模态文档解析模型 PaddleOCR-VL,并在 3.3.0 版本中作为核心能力上线。该模型规模约 0.9B,采用 NaViT 风格的动态分辨率视觉编码器,结合 ERNIE-4.5-0.3B 语言模型,实现对文本、表格、公式、图表与手写...