腾讯混元 HunyuanImage 3.0开源,80B MoE 文生图模型,长提示与内嵌文字更强
一、摘要 HunyuanImage 3.0 是腾讯混元开源的原生多模态文生图模型,采用 MoE 架构与 Transfusion 思路统一训练文本与图像。据官方信息:总参数超 80B,推理每 token 激活约 13B;支持理解千词级提示、在图像中精准生成文字,并强调“具备世界知识的推理”。当前版本聚...
一、摘要 HunyuanImage 3.0 是腾讯混元开源的原生多模态文生图模型,采用 MoE 架构与 Transfusion 思路统一训练文本与图像。据官方信息:总参数超 80B,推理每 token 激活约 13B;支持理解千词级提示、在图像中精准生成文字,并强调“具备世界知识的推理”。当前版本聚...
一、摘要 Hunyuan3D-Part 是腾讯混元开源的部件级 3D 形状生成与分解方案,由 P3-SAM (原生 3D 部件分割)与 X-Part (可控部件生成)组成。其训练不依赖 2D SAM,基于约 370 万形状与干净部件标注,提供自动化 3D 分割与扩散式部件生成。论文报告在多个基准上达...
一、摘要 Qwen3-VL 是阿里云 Qwen 团队开源的视觉-语言模型,面向图像、视频与文本的统一理解与推理。其亮点包括:原生 256K(可扩展至 1M)上下文、最长期约 2 小时视频的事件“精定位”、OCR 语种由 19 扩展至 32(含稀有字符与倾斜文本)、在真实场景风险检测上的领先表现;并展...
Qwen3-Omni把多模态AI与端到端推理结合到一起:用一个模型统一文本、图像、音频、视频的输入输出,兼顾速度与准确率。在公开测试中,Qwen3-Omni在大量音频与音视频基准上达到领先,并开放多款可用权重,适合快速上手与二次开发。 一、为什么这次的“端到端多模态AI”重要 1、真正统一的多模态A...
通义 Tongyi DeepResearch 正式开源,作为面向长链路检索与推理的 Web Agent,在相同任务下接近 OpenAI Deep Research。官方披露 Humanity’s Last Exam 32.9、BrowseComp 45.3、xbench-DeepSearch 75....
面向 RL 与大规模 LLM 推理的需求,checkpoint-engine 作为轻量中间件,实现“in-place 就地权重更新”,支持 broadcast 同步与 P2P 动态路由,结合通信与拷贝重叠优化。在数千 GPU 集群上,1T 模型权重更新可在约 20 秒内完成,帮助 RL 策略快速闭环...
Youtu-agent开源:几句YAML就能让AI上网、分析表格、整理文件的智能体框架 这款由腾讯优图推出的AI工具,把人工智能与大模型落到“配置即智能体”的范式:用少量YAML即可生成可上网检索、表格分析与文件整理的多步骤Agent。基于DeepSeek-V3家族,WebWalkerQA准确率达6...
AgentScope 1.0开源:面向开发者的可控多智能体框架,覆盖构建、部署与监控全生命周期 这是一套为开发者打造的AI与大模型基础设施。AgentScope 1.0以三层架构覆盖智能体构建与编排、生产级部署与安全执行、可视化开发与监控评测,强调模块化、异步化与智能化上下文管理,适配多Agent与...