LongCat-Image Technical Report
论文导读
提出 LongCat-Image,一个仅6B参数的轻量级扩散模型,在图像生成与编辑任务上实现SOTA性能,尤其在中文文本渲染和视觉一致性方面表现突出,并开源完整训练工具链。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LongCat-Image 技术报告:高效双语图像生成与编辑模型
一句话定位
提出 LongCat-Image,一个仅6B参数的轻量级扩散模型,在图像生成与编辑任务上实现SOTA性能,尤其在中文文本渲染和视觉一致性方面表现突出,并开源完整训练工具链。
小学生也能听懂
这篇论文做了一个叫LongCat-Image的小巧模型,只有6B大小,但能画出带中文字的图,还能按指令修改图片,效果比更大的模型还好,而且把训练方法全公开了。
为什么值得记录
- 挑战当前盲目扩大模型参数的趋势,证明6B规模模型通过优化设计与训练策略可超越数十亿参数模型
- 在中文文本渲染上达到行业领先水平,支持复杂与罕见汉字,优于主流开源与商业模型
- 图像编辑任务中实现SOTA性能,尤其在多轮编辑和视觉一致性方面显著优于其他开源方案
- 首次全面开源包括中间检查点、完整训练代码和工具链,极大降低研究与复现门槛
核心方法
- 采用混合MM-DiT与Single-DiT架构(类似FLUX.1-dev),核心扩散模型仅6B参数
- 使用Qwen2.5VL-7B作为统一文本编码器,增强中英文多语言理解能力
- 数据层面实施严格过滤:剔除AIGC污染数据、水印图像、低分辨率样本,并基于LAION-Aesthetics评分筛选高质量图像
- 引入多粒度图像标注(MGC)框架,生成从实体级到摄影级四类描述,提升语义密度与知识嵌入
- 训练分三阶段:预训练(渐进多分辨率)、中期训练(质量提升与风格注入)、后训练(SFT + RLHF with DPO/GRPO)
- 图像编辑模型以T2I中期检查点初始化,结合多任务联合训练防止灾难性遗忘
- 在RL阶段引入AIGC检测器作为对抗性奖励模型,引导生成更真实纹理
关键结果
- 在GenEval、DPG-Bench、WISE等文本-图像对齐基准上超越多数更大规模开源模型
- 中文文本渲染准确率与覆盖率行业领先,支持超5000个罕见汉字
- 图像编辑在CEdit-Bench、GEdit-Bench、ImgEdit-Bench上均达SOTA,整体得分分别为7.65、7.64、4.50
- 人类评估显示其在综合质量与一致性上优于Qwen-Image-Edit和FLUX.1 Kontext,接近商业系统如Nano Banana
- 多轮编辑与复合指令执行中保持高语义与结构一致性
局限与风险
- 尽管性能优异,但在极端复杂编辑场景下仍略逊于顶级商业模型(如Seedream 4.0)
- 合成文本数据虽提升字符学习效率,但可能影响整体视觉和谐,需动态采样策略缓解
- 未公开具体训练硬件配置与总计算成本,复现门槛仍较高
适合沉淀的概念
diffusion-models, text-to-image-generation, image-editing, chinese-text-rendering, multimodal-diffusion-transformer, reinforcement-learning-from-human-feedback, data-curation-pipeline, open-source-ai-model
阅读注意
- 重点关注第2节数据构建策略,尤其是AIGC过滤与多粒度标注机制
- 第4节训练流程中的渐进式分辨率设计与动态合成数据采样值得深入理解
- 第6节图像编辑部分强调‘一致性优先’的训练范式,对实际应用有重要启示
- 附录中的人类评估协议与CEdit-Bench构建方法具有较高参考价值
质量说明
- 采用来源:
clean,papers/2025/12/2512.07584.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文内容完整,结构清晰,实验详实,数据与模型设计描述充分,具备可复现性基础。