Advanced Video Coding
PulseAugur coverage of Advanced Video Coding — every cluster mentioning Advanced Video Coding across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Web 技术赋能实时浏览器内视频编辑,降低云成本
开发人员现在可以通过利用新的 Web 技术构建实时、浏览器内视频编辑器,将处理从昂贵的云服务器转移到用户的本地硬件。通过利用 WebCodecs API、HTML5 Canvas 和 WebGPU,这种方法绕过了与云基础设施相关的传统瓶颈,例如延迟和高成本。这些工具允许直接访问硬件加速编解码器,并在浏览器内实现零拷贝帧操作,显著提高性能并减少对服务器端转码的需求。
-
MVTrack:从压缩视频中进行超快无外观目标跟踪
研究人员开发了MVTrack,一种直接在压缩视频比特流上运行的新型移动目标跟踪系统,无需进行像素重建。与传统的基于RGB的目标检测器相比,这种方法显著降低了计算成本和延迟。MVTrack结合了用于运动矢量场检测的MVDet和用于运动关联的MVLink,在VIRAT数据集上取得了优于现有方法(如YOLO26n)的性能,同时使用的参数和FLOPs要少得多。
-
MLVC:学习视频编解码器实现NPU上的实际部署
研究人员开发了MLVC,这是一种面向实际部署的多平台学习视频编解码器,解决了阻碍基于AI的编解码器取代传统编解码器的关键挑战。MLVC解决了计算效率和跨平台兼容性问题,而这些问题历来有利于H.264等手工设计的编解码器。通过超先验传输熵模型尺度参数,MLVC确保了在不同NPU上获得一致的结果,而无需进行比特精确的模型执行。这项创新使得在消费级NPU上实现约100 FPS的360p/540p视频的编码和解码速度,使学习视频编解码器更接近实际应用。
-
码本容量在视频压缩质量上超越分辨率
研究人员发现,在分层离散视频压缩中,码本容量是影响感知质量的主要因素,而非空间分辨率。使用MS-VQ-VAE模型在不同码本大小和分辨率下进行的实证研究表明,增加码本容量可显著提高质量,而空间分辨率的变化影响甚微。与H.264和H.265编解码器相比,这些模型在匹配或较低比特率下的感知质量方面表现更优,这表明码本大小是生成视频模型中可扩展离散分词器的更关键设计变量。
-
神经网络将视频和音频存储为网络权重,实现2.61倍压缩
研究人员开发了一种新颖的视频编解码器,它将视频和音频存储为神经网络的权重,而不是压缩的像素数据。该方法使用正弦表示网络(SIREN)将时空坐标映射到视频和音频值。训练后,使用知识蒸馏、量化和LZMA2编码对网络进行压缩。结果得到的压缩表示在保持28.72 dB视频和24.18 dB音频的PSNR的同时,文件大小显著减小,在压缩比方面优于H.264和HEVC等传统编解码器。
-
新基准诊断视频大语言模型的视觉基础能力
一篇新论文引入了视觉依赖差距(VDG)来评估视频大语言模型(LLMs)的视觉基础能力。VDG衡量了模型处理原始视频和黑屏时的准确率差异,揭示了许多模型的性能提升并非源于视觉理解,而是帧多样性。研究发现,时间推理对准确率的贡献很小,即使稳定的聚合准确率也可能掩盖重大的问题级别答案翻转。VDG被提议作为评估视频大语言模型视觉基础能力的标准审计。
-
新的H.264自适应量化方法提高了视频编码效率
研究人员开发了一种新的H.264视频编码自适应量化控制方法,解决了为感知质量或机器视觉任务等特定目标优化编解码器参数的挑战。他们的方法利用了一个可微代理,该代理近似H.264的率失真行为,从而实现基于梯度的优化。这种基于代理的自适应量化框架在率-任务权衡方面显示出改进,在语义分割和MS-SSIM方面实现了显著的BD率降低。
-
新的MS-VQ-VAE方法实现了超低比特率视频压缩
研究人员开发了一种使用称为MS-VQ-VAE的离散潜在表示的新型视频压缩方法,该方法在低于每像素0.1比特的超低比特率下有效运行。该方法通过采用学习到的自回归先验来克服连续潜在表示的局限性,该先验利用码本使用模式来实现显著压缩。与H.264和H.265等成熟标准相比,该方法在UCF101数据集上实现了更高的感知质量和显著更低的比特率,表现优越。
-
新指标预测视频压缩下rPPG算法性能
研究人员开发了一种名为空间伪影相干性(SAC)的新指标,用于预测远程光电容积脉搏波描记法(rPPG)算法在视频压缩下的性能。SAC通过视频块的协方差矩阵计算得出,能有效区分不同的编解码器家族及其对rPPG准确性的影响。研究发现,某些条件,如低到中度运动和特定的SAC值,是基于块的方法优于全局投影技术的必要条件,为在临床应用中选择鲁棒算法提供了指导。
-
新神经网络框架NeR-SC增强屏幕内容视频压缩
研究人员开发了NeR-SC,一个新颖的神经网络表示框架,专门用于屏幕内容视频压缩。该框架基于SNeRV骨干网络,并引入了三个关键模块:一个可学习的颜色调色板来模拟离散颜色结构,一个多门控密集融合模块以增强特征交互,以及一个嵌入级帧跳过策略来绕过静态帧,从而实现实时解码。实验表明,NeR-SC在DSCVC和VCD数据集上,优于现有的神经视频表示方法,并在低比特率下超越了H.264和H.265,实现了具有竞争力的PSNR值。
-
AV1视频编解码器取代H.264成为新的行业标准
AV1视频编解码器正崭露头角,成为新的行业标准,取代长期占据主导地位的H.264在视频监控领域的地位。AV1由开放媒体联盟(Alliance for Open Media)开发,在压缩效率方面有了显著提升,能够以比H.264高30-50%的性能处理高分辨率和8K视频。其开源和免版税的特性使其成为企业经济实惠且易于集成的选择,预计到2026年将在各种视频系统中获得广泛支持。
-
Dwarkesh Patel 在 Lex Fridman Podcast 上讲解视频编解码器和压缩技术
Lex Fridman Podcast 的主持人 Dwarkesh Patel 发布了多期讨论视频编解码器和压缩技术的节目。这些节目深入探讨了 AV2、H.265 (HEVC)、H.266 (VVC) 和 AV1 等各种标准。讨论中也涉及了黑客如何窃取数据,但主要焦点似乎是视频技术。
-
新的 CFE-PPAR 方法支持通过压缩实现隐私保护的视频行为识别
研究人员推出了一种新颖的隐私保护视频行为识别方法 CFE-PPAR,即使在压缩后仍能保持有效。与先前在加密视频压缩时性能显著下降的方法不同,CFE-PPAR 允许视频 Transformer 直接识别加密内容。这是通过使用与视频加密相同的密钥转换的参数来实现的,在 Motion-JPEG 和 H.264 等常见压缩标准下,在 UCF101 和 HMDB51 数据集上表现出优越的性能。
-
新数据集GameScope助力跨编解码器的游戏视频质量评估
研究人员推出了GameScope,这是一个新基准数据集,旨在评估各种编解码器和内容类型下游戏视频的质量。该数据集是同类中最大的,包含4,048个视频样本,平均有37名参与者进行主观评分(MOS),并附带详细的质量属性。它支持H.264、H.265和AV1等编解码器,初步研究表明,视觉语言模型取得了优越的性能。