---
title: "LongCat-Video Technical Report"
title_zh: "LongCat-Video 技术报告"
arxiv_id: "2510.22200"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/10/2510.22200.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Video 技术报告

## 一句话定位

LongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型，支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。

## 小学生也能听懂

这篇论文造了一个叫LongCat-Video的“视频画家”，它能听懂文字或图片指令，一口气画出长达1分钟的高清视频，就像搭积木一样先画大概再补细节，还用多种奖励机制教它画得更逼真、动作更流畅，速度比原来快10倍以上。

## 为什么值得记录

- 首次将 Text-to-Video、Image-to-Video 和 Video-Continuation 任务统一于单一模型，提升通用性与部署效率
- 原生支持分钟级高质量长视频生成，缓解传统方法中的颜色漂移与质量退化问题
- 提出 coarse-to-fine 生成策略与 block sparse attention 机制，实现 720p@30fps 视频在数分钟内生成，效率提升超 10 倍
- 引入多奖励 GRPO 训练框架，结合视觉质量、运动质量与文本对齐奖励，有效防止单奖励过优化（reward hacking）

## 核心方法

- 基于 DiT 架构构建单流 Transformer，使用 3D RoPE 位置编码与 AdaLN-Zero 调制，共 48 层，隐藏维度 4096
- 采用 WAN2.1 VAE 进行时空压缩（4×16×16），配合 umT5 多语言文本编码器处理中英文提示
- 统一输入表示：将 condition frames（0/1/多个）与 noisy frames 拼接为混合序列，通过 timestep 分区区分任务类型
- 设计 Block Causal Attention 机制，condition tokens 自注意力独立计算，noisy tokens 可访问全部 KV，支持 KVCache 加速推理
- GRPO 训练中固定随机 timestep 于前 T′=6 步，仅在该步引入 SDE 噪声，其余使用 ODE 采样，实现精确信用分配
- 提出 policy 与 KL loss 重加权策略，消除梯度在 high-noise 和 small Δt 下的消失问题，提升训练稳定性
- 使用 max group std 替代 per-group std 计算优势函数，增强对奖励模型误差的鲁棒性

## 关键结果

- 在 720p@30fps 视频生成中，结合 LCM、coarse-to-fine 与 BSA，延迟从 1429.5s 降至 135.3s，加速 10.6×
- 多奖励 GRPO 训练后，模型在内部 benchmark 上达到与 Sora、Veo 等闭源模型相当的性能水平
- 长视频生成（>1分钟）无显著颜色漂移或质量下降，验证了 Video-Continuation 预训练的有效性
- Block Sparse Attention 将注意力计算量降至标准 dense attention 的 <10%，同时保持生成质量

## 局限与风险

- 未公开具体 benchmark 指标数值（如 FVD、IS），仅提供相对性能描述，难以量化对比
- 多奖励权重设置（HPSv3-general/percentile、MQ、TA 各为 1）缺乏消融实验支持，最优组合尚不明确
- Block Sparse Attention 的 top-r 掩码策略在训练时固定稀疏模式，可能限制动态上下文建模能力

## 适合沉淀的概念

`diffusion-transformer`, `video-generation`, `long-video-generation`, `multi-reward-rlhf`, `block-sparse-attention`, `coarse-to-fine-generation`, `unified-video-model`, `grpo-for-flow-matching`

## 阅读注意

- 重点关注 3.3.1 节中 GRPO 的梯度推导（附录 A.1.2），理解重加权系数如何解决梯度消失问题
- 注意 coarse-to-fine 策略中 refinement 阶段使用 expert LoRA 模块，而非直接微调 base model
- 数据标注部分提到使用 Qwen2.5VL 进行 cinematography 与 visual style 标注，体现多模态模型在数据构建中的作用
- 评估部分缺乏公共 benchmark（如 VBench）的具体分数，需结合后续开源代码验证实际表现

## 质量说明

- 采用来源：`clean`，`papers/2025/10/2510.22200.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述详实，包含大量技术细节与实验设置。虽缺少部分量化指标，但整体信息充分，可复现性强。
