LongCat-Video Technical Report
论文导读
LongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型,支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LongCat-Video 技术报告
一句话定位
LongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型,支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。
小学生也能听懂
这篇论文造了一个叫LongCat-Video的“视频画家”,它能听懂文字或图片指令,一口气画出长达1分钟的高清视频,就像搭积木一样先画大概再补细节,还用多种奖励机制教它画得更逼真、动作更流畅,速度比原来快10倍以上。
为什么值得记录
- 首次将 Text-to-Video、Image-to-Video 和 Video-Continuation 任务统一于单一模型,提升通用性与部署效率
- 原生支持分钟级高质量长视频生成,缓解传统方法中的颜色漂移与质量退化问题
- 提出 coarse-to-fine 生成策略与 block sparse attention 机制,实现 720p@30fps 视频在数分钟内生成,效率提升超 10 倍
- 引入多奖励 GRPO 训练框架,结合视觉质量、运动质量与文本对齐奖励,有效防止单奖励过优化(reward hacking)
核心方法
- 基于 DiT 架构构建单流 Transformer,使用 3D RoPE 位置编码与 AdaLN-Zero 调制,共 48 层,隐藏维度 4096
- 采用 WAN2.1 VAE 进行时空压缩(4×16×16),配合 umT5 多语言文本编码器处理中英文提示
- 统一输入表示:将 condition frames(0/1/多个)与 noisy frames 拼接为混合序列,通过 timestep 分区区分任务类型
- 设计 Block Causal Attention 机制,condition tokens 自注意力独立计算,noisy tokens 可访问全部 KV,支持 KVCache 加速推理
- GRPO 训练中固定随机 timestep 于前 T′=6 步,仅在该步引入 SDE 噪声,其余使用 ODE 采样,实现精确信用分配
- 提出 policy 与 KL loss 重加权策略,消除梯度在 high-noise 和 small Δt 下的消失问题,提升训练稳定性
- 使用 max group std 替代 per-group std 计算优势函数,增强对奖励模型误差的鲁棒性
关键结果
- 在 720p@30fps 视频生成中,结合 LCM、coarse-to-fine 与 BSA,延迟从 1429.5s 降至 135.3s,加速 10.6×
- 多奖励 GRPO 训练后,模型在内部 benchmark 上达到与 Sora、Veo 等闭源模型相当的性能水平
- 长视频生成(>1分钟)无显著颜色漂移或质量下降,验证了 Video-Continuation 预训练的有效性
- Block Sparse Attention 将注意力计算量降至标准 dense attention 的 <10%,同时保持生成质量
局限与风险
- 未公开具体 benchmark 指标数值(如 FVD、IS),仅提供相对性能描述,难以量化对比
- 多奖励权重设置(HPSv3-general/percentile、MQ、TA 各为 1)缺乏消融实验支持,最优组合尚不明确
- Block Sparse Attention 的 top-r 掩码策略在训练时固定稀疏模式,可能限制动态上下文建模能力
适合沉淀的概念
diffusion-transformer, video-generation, long-video-generation, multi-reward-rlhf, block-sparse-attention, coarse-to-fine-generation, unified-video-model, grpo-for-flow-matching
阅读注意
- 重点关注 3.3.1 节中 GRPO 的梯度推导(附录 A.1.2),理解重加权系数如何解决梯度消失问题
- 注意 coarse-to-fine 策略中 refinement 阶段使用 expert LoRA 模块,而非直接微调 base model
- 数据标注部分提到使用 Qwen2.5VL 进行 cinematography 与 visual style 标注,体现多模态模型在数据构建中的作用
- 评估部分缺乏公共 benchmark(如 VBench)的具体分数,需结合后续开源代码验证实际表现
质量说明
- 采用来源:
clean,papers/2025/10/2510.22200.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,方法描述详实,包含大量技术细节与实验设置。虽缺少部分量化指标,但整体信息充分,可复现性强。