一、摘要
LongCat-Image 是美团 LongCat 团队开源的中英双语图像生成与编辑模型,参数约 6B,采用混合 DiT 架构,在多项公开基准上可比肩甚至超过部分 20B 级别开源模型。项目重点提升多语言文本渲染、图像一致性和写实效果,并兼顾推理速度与显存占用,适合研究与业务落地。
二、核心特性
1、中英双语文本能力:针对复杂中文汉字(含生僻字)进行专项优化,在中文文字渲染指标上表现突出。
2、生成与编辑统一:提供 LongCat-Image、LongCat-Image-Dev、LongCat-Image-Edit 等版本,覆盖文生图、整体/局部编辑、文字修改等任务。
3、轻量高效推理:6B 混合 DiT 架构,支持低精度推理,在有限显存上兼顾速度与质量。
4、写实与对齐:结合数据策略和 RL 训练,增强物体结构、风格与指令对齐,在 GenEval、DPG 等基准上与头部模型处于同一梯队。
5、完整工具链:在开源协议下提供训练代码、示例和中间 checkpoint,方便继续训练、LoRA 与 DPO 等研究。
三、安装
1、环境准备:建议使用 Python 3.10 和支持 CUDA 的 NVIDIA GPU,显存 16–24GB 起更为稳妥。
2、克隆仓库:
git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Image
cd LongCat-Image
3、安装依赖:
conda create -n longcat-image python=3.10
conda activate longcat-image
pip install -r requirements.txt
python setup.py develop
4、下载权重:
使用 huggingface-cli 从对应仓库下载 LongCat-Image / LongCat-Image-Dev / LongCat-Image-Edit 权重到本地目录,并在配置中指向该路径。
四、典型用例
1、中文/英文文生图:海报、电商图、运营素材等,对中文字形、排版和主题一致性要求较高的内容生产。
2、自然语言图像编辑:根据文本进行全局风格替换、局部修改、物体增删、文字内容替换等。
3、品牌视觉定制:结合 LoRA 或继续训练,固化品牌角色、配色、构图风格,用于长期统一输出。
4、学术与工程基线:作为中英双语图像模型的开源基线,验证新损失、新数据配比或新 RL 策略。
五、生态与竞品
1、生态:官方提供训练 pipeline、推理脚本,并逐步与 Diffusers、ComfyUI 等生态集成,方便接入现有 AIGC 流程。
2、竞品对比:与 Qwen-Image、HunyuanImage、Seedream、FLUX 等模型相比,LongCat-Image 在中文文本渲染和编辑基准上优势明显,而参数更小,部署门槛更低;具体效果仍需结合业务数据和主观评估。
六、局限与注意事项
1、算力要求:高分辨率生成和多步编辑仍需要较高显存,小显存设备需降低分辨率、步数或批大小。
2、语言与场景范围:主要针对中英优化,其他语种或极端视觉场景可能表现不稳定。
3、内容合规:模型可能生成不当内容,实际部署需配合安全审核、关键字过滤与人工复核。
4、基准外不确定性:公开基准成绩不完全代表业务场景表现,建议进行 A/B 测试和人工质检。
七、项目地址
https://github.com/meituan-longcat/LongCat-Image
八、常见问题
Q: LongCat-Image 支持哪些核心任务?
A: 支持中英双语 Text-to-Image 生成、整体/局部图像编辑、文字内容修改、参考图约束编辑等,不同版本在生成、开发调试和编辑任务上各有侧重。
Q: LongCat-Image 推理大概需要多少显存?
A: 官方未给出硬性下限,一般经验是单卡 16–24GB 显存即可运行常规分辨率任务;如需高分辨率或批量生成,可使用多卡或降低分辨率与步数。
Q: LongCat-Image 在中文文字生成上的优势体现在哪里?
A: 其在中文字符准确率、复杂字形还原和图文一致性等基准指标上优于多款开源模型,同时兼顾整体图像质量与可读性。
Q: LongCat-Image 是否便于继续训练或 LoRA 微调?
A: 是。项目开放训练工具链和中间 checkpoint,可用于 SFT、LoRA、DPO 和编辑训练,但需要准备相应算力与高质量数据集。