美团发布LongCat-Video视频生成模型，支持5分钟级连贯输出_互联网_资讯

10月27日消息，美团 LongCat 团队正式发布 LongCat-Video 视频生成模型，该模型支持文生视频、图生视频及视频续写。美团强调，LongCat-Video 可稳定输出5分钟级别的长视频，且无质量损失。

据介绍，在文生视频方面， LongCat-Video可生成 720p、30fps 高清视频，能精准解析文本中物体、人物、场景、风格等细节指令，语义理解与视觉呈现能力达开源 SOTA 级别。

图生视频， LongCat-Video严格保留参考图像的主体属性、背景关系与整体风格，动态过程符合物理规律，支持详细指令、简洁描述、空指令等多类型输入，内容一致性与动态自然度表现优异。

视频续写是LongCat Video的核心差异化能力，可基于多帧条件帧续接视频内容，为长视频生成提供原生技术支撑。

另外，依托视频续写任务预训练、Block-Causual Attention 机制和 GRPO 后训练，LongCat-Video 可稳定输出5分钟级别的长视频。

模型结合块稀疏注意力（BSA）与条件 token 缓存机制，大幅降低长视频推理冗余 —— 即便处理 93 帧及以上长序列，仍能兼顾效率与生成质量稳定，打破长视频生成 “时长与质量不可兼得” 的瓶颈。

美团发布的数据显示，通过全面的评估显示，LongCat-Video 通用性能优秀，综合能力跻身开源 SOTA：

136 亿参数的视频生成基座模型，在文生视频、图生视频两大核心任务中，综合性能均达到当前开源领域 SOTA 级别；

通过文本-视频对齐、视觉质量、运动质量、整体质量四大维度评估，其性能在文本对齐度、运动连贯性等关键指标上展现显著优势；

在 VBench 等公开基准测试中，LongCat-Video 在参评模型中整体表现优异。

转载请注明出处。