LongCat-Flash-Lite 解读:用 N-gram Embeddings 走出稀疏 MoE 的新效率路径
一、摘要 LongCat-Flash-Lite 是一个以高稀疏 MoE 场景为目标的开源大模型:总参数 68.5B,但每 token 仅激活约 2.9B~4.5B。它的关键思路不是继续堆 MoE 专家数,而是在特定稀疏区间通过扩容 N-gram Embedding(约 30B+ 参数用于 embed...
一、摘要 LongCat-Flash-Lite 是一个以高稀疏 MoE 场景为目标的开源大模型:总参数 68.5B,但每 token 仅激活约 2.9B~4.5B。它的关键思路不是继续堆 MoE 专家数,而是在特定稀疏区间通过扩容 N-gram Embedding(约 30B+ 参数用于 embed...
一、摘要 HunyuanImage 3.0-Instruct 是腾讯混元团队开源的图像生成与图像编辑(Image-to-Image)模型,强调“理解+生成”的统一多模态能力,并通过 Instruct(带推理/指令跟随)形态更适配创意编辑与交互式改图。在 Image Edit Arena(lmaren...
一、摘要 Z-Image(造相)是 Tongyi-MAI 开源的 6B 参数图像生成基础模型家族,采用单流扩散 Transformer(Single-Stream Diffusion Transformer / S3-DiT)架构。与强调速度的 Z-Image-Turbo 不同,Z-Image定位为...
一、摘要 Kimi Code 是 Moonshot AI 推出的开源编程智能体(Coding Agent),采用 Apache 2.0 许可证,强调透明、安全与可扩展性。项目以 Python 为核心实现,原生支持多模态输入,并可无缝集成多种主流开发环境,开箱即用,面向真实软件工程场景设计。 二、核心...
一、摘要 HPC-Ops 是腾讯混元(Hunyuan)AI Infra 团队开源的生产级 LLM 推理算子库,目标是让主流推理卡(尤其是 NVIDIA Hopper/SM90,如 H20)更接近硬件峰值利用率。项目主打从零用 CUDA + CuTe/CUTLASS 打磨 SOTA 内核,并提供相对干...
一、摘要 DeepSeek-OCR 2 是 DeepSeek 开源的 OCR/文档理解模型版本升级,项目以 “DeepSeek-OCR 2: Visual Causal Flow” 为主题,强调更贴近人类的视觉编码方式,面向复杂版式(文档、图表、混排页面等)提供更强的结构化抽取与理解能力。官方仓库与...
一、摘要 Kimi K2.5 是 Moonshot AI 发布的开源“视觉 + 智能体(Agentic)”多模态模型,支持图像/视频与文本统一输入,并提供对话模式与 Agent 模式。其重点方向包括:视觉驱动的编码与视觉调试、长链路工具调用、以及可自编排的并行多智能体机制(Agent Swarm,测...
一、摘要 Qwen3-TTS 是 Qwen 团队开源的文本转语音(TTS)模型系列,包含 VoiceDesign(文字描述生成新音色)、CustomVoice(指令控制既定高质量音色)与 Base(快速音色克隆与微调基座)。项目同时开源代码与权重,并提供 12Hz 语音 tokenizer 以实现更...