12月8日,美团 LongCat 团队正式发布并开源其自主研发的图像生成模型 LongCat-Image。该模型参数规模为6B,在文生图与图像编辑两项核心能力上表现优异,旨在弥合当前开源与闭源模型之间的性能鸿沟。

LongCat-Image 采用文生图与图像编辑同源的混合骨干架构(MM-DiT + Single-DiT),并集成了视觉语言模型(VLM)条件编码器,支持通过自然语言指令实现多轮图像编辑7。在多个开源基准测试中,该模型在图像编辑任务上已达到 SOTA(State-of-the-Art)水平,展现出卓越的指令遵循能力和视觉一致性。
特别值得注意的是,LongCat-Image 在中文文本渲染方面进行了专项优化。通过课程学习策略,模型显著提升了对汉字复杂笔画结构的处理能力,能高精度生成海报、广告等场景所需的中文图文内容。

为提升用户真实体验,团队还引入主观评分机制对生成结果进行评估,确保图像在真实感与视觉合理性方面达到高水平6。此外,美团同步升级 LongCat APP,新增图生图功能并提供24个易用模板,进一步降低 AI 图像创作门槛。
目前,LongCat-Image 已在 Hugging Face 与 GitHub 全面开源,包含完整训练工具链,支持中英双语输入,鼓励开发者共建开放协作的 AI 生态。