Vad
PulseAugur coverage of Vad — every cluster mentioning Vad across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究利用因果模型和改进的评估方法解决视频异常检测问题
研究人员正在探索视频异常检测的新方法,重点是提高效率和准确性。一篇论文介绍了一种严格因果流异常检测器,该检测器使用类似Mamba的状态空间模型,每帧更新时间恒定,在边缘硬件上实现了高吞吐量,但准确性低于非因果基线。另一项研究批判性地审查了弱监督视频异常检测的评估指标,发现常用的帧级指标通常反映视频级排名,而不是精确的时间定位。第三篇论文研究了视觉语言模型(VLM)在无训练异常检测中的应用,并强调了如何将VLM输出转换为异常分数会显著影…
-
语音AI在轮流对话方面存在困难,需要更好的终点检测模型
当前的语音AI系统常常过早地结束对话,仅仅依赖静默检测,导致用户在思考过程中被打断。增加静默阈值以防止中断会引入一个更糟糕的问题:不可接受的延迟,这会让系统感觉像是坏了。一种更有效的方法是使用一个轻量级模型,该模型分析语法、韵律和语义来预测轮流对话的完成,而不仅仅是计时停顿。
-
新的VAD方法在多模态AI蒸馏中分离视觉证据
研究人员开发了视觉归因蒸馏(VAD),一种用于多模态策略内蒸馏的新颖方法。VAD旨在分离支持教师模型纠正学生模型输出的视觉证据,并将其与语言先验或教师特有的偏差区分开来。通过在有和没有相关视觉证据的情况下评估教师模型,VAD估计了可归因于视觉的纠正分量。与直接蒸馏方法相比,该方法在4B和9B参数模型的六个视觉基准测试中表现出优越的性能。
-
视觉归因蒸馏 (VAD) 增强多模态知识迁移
研究人员推出了一种名为视觉归因蒸馏 (VAD) 的新算法,旨在通过在知识迁移中分离视觉证据来改进多模态策略内蒸馏。VAD 通过根据教师纠正中可归因于视觉的部分来重构目标,从而有效地区分受视觉线索支持的纠正与受语言先验或教师特定偏差影响的纠正。与现有蒸馏技术相比,该方法在六个视觉基准测试的 4B 和 9B 规模上均表现出优越的性能,尤其是在视觉证据与教师的初始纠正相矛盾时。
-
BEVLM框架增强大语言模型在自动驾驶中的推理能力
研究人员开发了BEVLM,一个将大语言模型(LLMs)与鸟瞰图(BEV)表示相结合的新框架,用于自动驾驶。该方法旨在克服当前独立处理视觉数据的局限性,从而提高空间一致性和语义丰富性。BEVLM利用BEV特征作为大语言模型的统一输入,增强其在复杂驾驶场景中的推理能力,并提高端到端驾驶性能,尤其是在安全关键型情况下。
-
新的REDDIT框架纠正ASR模型中的时间戳漂移
研究人员开发了REDDIT,一个新颖的训练后框架,旨在修复自回归自动语音识别(ASR)系统中的时间戳不准确问题。该方法解决了时间戳漂移问题,即解码的时间轴偏离实际音频,尤其是在长无语音片段中。REDDIT采用两阶段过程,使用模型自身的重放上下文和冻结的基础分布来编辑时间戳目标,同时还包含一个精炼阶段。这种方法在不引起其他ASR功能灾难性遗忘的情况下成功纠正了时间戳漂移,这一点在Whisper-tiny模型上得到了证明。
-
新的REDDIT框架可在不遗忘模型的情况下纠正ASR时间戳漂移
研究人员开发了REDDIT,一个新颖的训练后框架,旨在纠正自动语音识别(ASR)系统中的时间戳漂移,而不会导致灾难性遗忘。该方法使用基于重放的分布编辑技术,通过重放模型自身的解码器上下文来精炼时间戳,同时保留非时间戳标记的分布。该框架在Whisper-tiny上将长间隔mIoU从38.7%提高到95.0%,参数更新极少,同时显著减少了域外时间戳错误。
-
Wan-Streamer v0.1:统一模型实现实时视听交互
研究人员推出了 Wan-Streamer v0.1,这是一种新颖的端到端多模态基础模型,专为实时、低延迟的视听交互而设计。与传统的级联系统不同,Wan-Streamer 在单一 Transformer 架构中集成了语言、音频和视频处理,并利用块因果注意力实现增量流式传输。这种统一的方法显著降低了管道延迟和错误累积,实现了亚秒级的双向视听通信,模型端响应延迟约为 200 毫秒。
-
GraphBEV++框架解决了自动驾驶感知中的特征不对齐问题
研究人员推出了GraphBEV++,一个旨在解决自动驾驶系统鸟瞰图(BEV)感知中特征不对齐问题的新型框架。该框架包含两个主要模块:LocalAlign-v2,它使用图匹配来处理邻域感知的深度特征,以纠正局部不对齐;以及GlobalAlign-v2,它提供可变形和扩散变体来解决全局不对齐问题。GraphBEV++在nuScenes和Waymo等数据集上展示了最先进的性能,在感知、预测和规划任务中提高了准确性和鲁棒性,即使在校准不确定性下也是如此。
-
语音AI悖论:高级对话,基础故障
像Yandex的Alisa这样的语音AI助手表现出一种悖论:它们拥有高级的对话能力,却在基本功能上出现故障,这源于其复杂的架构。这种混合系统结合了语音识别、推荐算法、LLM和启发式方法,创造出一种人格的幻觉,使用户对错误更加宽容。底层的LLM通过预测下一个词元来生成响应,导致产生听起来自信的幻觉,并在不同处理阶段之间丢失上下文,而语音活动检测(VAD)可能导致意外激活。
-
统一地图先验编码器增强自动驾驶建图与规划
研究人员开发了一种统一地图先验编码器(UMPE),旨在将高清/标清矢量地图、栅格地图和卫星图像等多样化的地图数据整合到自动驾驶系统中。该编码器通过为矢量和栅格数据采用独立的分支,并配备对齐和融合机制,解决了数据异构性和姿态漂移等挑战。UMPE在nuScenes和Argoverse2等数据集上显著提高了建图精度,并在端到端规划任务中显著降低了轨迹误差和碰撞率。
-
新的大语言模型统一音频和语言处理,支持全双工和医疗应用
研究人员开发了UAF,这是一种新颖的统一音频前端大语言模型,专为全双工语音交互而设计。该模型将语音活动检测和轮流发言等各种音频前端任务整合到一个序列预测问题中。UAF旨在降低对话式AI系统的延迟并提高中断准确性。此外,Au-M-ol被提出作为一种多模态架构,将大语言模型扩展到医疗音频和语言理解领域,显著降低了医疗转录的词错误率。