论文
arXiv2510.22200
时间2025-10
来源Markdown
页面质量中文卡片
阅读量级131 分钟

LongCat-Video Technical Report

论文导读

LongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型,支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LongCat-Video 技术报告

一句话定位

LongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型,支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。

小学生也能听懂

这篇论文造了一个叫LongCat-Video的“视频画家”,它能听懂文字或图片指令,一口气画出长达1分钟的高清视频,就像搭积木一样先画大概再补细节,还用多种奖励机制教它画得更逼真、动作更流畅,速度比原来快10倍以上。

为什么值得记录

  • 首次将 Text-to-Video、Image-to-Video 和 Video-Continuation 任务统一于单一模型,提升通用性与部署效率
  • 原生支持分钟级高质量长视频生成,缓解传统方法中的颜色漂移与质量退化问题
  • 提出 coarse-to-fine 生成策略与 block sparse attention 机制,实现 720p@30fps 视频在数分钟内生成,效率提升超 10 倍
  • 引入多奖励 GRPO 训练框架,结合视觉质量、运动质量与文本对齐奖励,有效防止单奖励过优化(reward hacking)

核心方法

  • 基于 DiT 架构构建单流 Transformer,使用 3D RoPE 位置编码与 AdaLN-Zero 调制,共 48 层,隐藏维度 4096
  • 采用 WAN2.1 VAE 进行时空压缩(4×16×16),配合 umT5 多语言文本编码器处理中英文提示
  • 统一输入表示:将 condition frames(0/1/多个)与 noisy frames 拼接为混合序列,通过 timestep 分区区分任务类型
  • 设计 Block Causal Attention 机制,condition tokens 自注意力独立计算,noisy tokens 可访问全部 KV,支持 KVCache 加速推理
  • GRPO 训练中固定随机 timestep 于前 T′=6 步,仅在该步引入 SDE 噪声,其余使用 ODE 采样,实现精确信用分配
  • 提出 policy 与 KL loss 重加权策略,消除梯度在 high-noise 和 small Δt 下的消失问题,提升训练稳定性
  • 使用 max group std 替代 per-group std 计算优势函数,增强对奖励模型误差的鲁棒性

关键结果

  • 在 720p@30fps 视频生成中,结合 LCM、coarse-to-fine 与 BSA,延迟从 1429.5s 降至 135.3s,加速 10.6×
  • 多奖励 GRPO 训练后,模型在内部 benchmark 上达到与 Sora、Veo 等闭源模型相当的性能水平
  • 长视频生成(>1分钟)无显著颜色漂移或质量下降,验证了 Video-Continuation 预训练的有效性
  • Block Sparse Attention 将注意力计算量降至标准 dense attention 的 <10%,同时保持生成质量

局限与风险

  • 未公开具体 benchmark 指标数值(如 FVD、IS),仅提供相对性能描述,难以量化对比
  • 多奖励权重设置(HPSv3-general/percentile、MQ、TA 各为 1)缺乏消融实验支持,最优组合尚不明确
  • Block Sparse Attention 的 top-r 掩码策略在训练时固定稀疏模式,可能限制动态上下文建模能力

适合沉淀的概念

diffusion-transformer, video-generation, long-video-generation, multi-reward-rlhf, block-sparse-attention, coarse-to-fine-generation, unified-video-model, grpo-for-flow-matching

阅读注意

  • 重点关注 3.3.1 节中 GRPO 的梯度推导(附录 A.1.2),理解重加权系数如何解决梯度消失问题
  • 注意 coarse-to-fine 策略中 refinement 阶段使用 expert LoRA 模块,而非直接微调 base model
  • 数据标注部分提到使用 Qwen2.5VL 进行 cinematography 与 visual style 标注,体现多模态模型在数据构建中的作用
  • 评估部分缺乏公共 benchmark(如 VBench)的具体分数,需结合后续开源代码验证实际表现

质量说明

  • 采用来源:cleanpapers/2025/10/2510.22200.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,方法描述详实,包含大量技术细节与实验设置。虽缺少部分量化指标,但整体信息充分,可复现性强。