LongCat-Video
PulseAugur coverage of LongCat-Video — every cluster mentioning LongCat-Video across labs, papers, and developer communities, ranked by signal.
- 2026-09-06 product_launch Meituan released the open-source LongCat-Video model for video generation. 来源
2 天有情绪数据
-
VC-Attention 框架通过优化低比特注意力来加速视频生成
研究人员推出了一种新颖的 VC-Attention 框架,旨在提高扩散 Transformer 中注意力机制的效率和准确性,这对于最先进的视频生成至关重要。该方法解决了两个主要瓶颈:长序列导致的注意力计算成本以及 softmax 函数施加的速度限制。VC-Attention 采用双管齐下的方法:值平滑 (V-Smooth) 通过重新排序值 token 来减少量化误差,以及融合概率转换 (ExpCast-FP8),该方法绕过了 soft…
-
美团和字节跳动发布用于视频和智能体任务的开源AI模型
美团发布了LongCat-Video,一个开源AI模型,能够根据文本、图像或音频生成具有唇形同步功能的视频。该模型支持在MIT许可下生成720p分辨率、30fps的多分钟视频,并支持多GPU。另外,字节跳动推出了DeerFlow,一个开源的超级智能体,用于深度研究、代码生成、数据分析和任务自动化,拥有大量GitHub星标和Docker安装支持。
-
MeanFlowNFT 将前向过程强化学习应用于平均速度生成器
研究人员推出了一种名为 MeanFlowNFT 的新颖框架,该框架将强化学习(RL)技术应用于 MeanFlow 生成器,以实现更快、更高效的内容生成。该方法弥合了瞬时速度和平均速度预测之间的差距,使 MeanFlow 生成器能够在无需复杂逆向过程计算的情况下,与人类偏好和特定任务目标保持一致。实验表明,MeanFlowNFT 显著提高了基线性能,甚至可以在使用更少的采样步骤的情况下超越多步 RL 调优的扩散模型,在图像和视频生成应用…
-
美团发布 LongCat-Video-Avatar 1.5,用于稳定、音频驱动的视频生成
美团发布了 LongCat-Video-Avatar 1.5,这是一个用于生成音频驱动的人类视频的开源框架。此升级版本强调生产就绪性和稳定性,采用改进的 Whisper-Large 音频编码器,可实现更自然的唇形同步和具有一致身份的鲁棒长视频生成。该模型支持音频-文本到视频和视频续写等多种任务,能够泛化到各种风格和条件,并实现高效的 8 步推理。