Qwen3-Omni
PulseAugur coverage of Qwen3-Omni — every cluster mentioning Qwen3-Omni across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
音频大语言模型“读心术”揭示语言无关的内部概念
研究人员开发了一种通过检查音频大语言模型的中层来“读懂”其心思的方法。该技术揭示,在生成任何输出标记之前,概念就已经在模型内部形成和处理。研究结果表明,这些内部表征是语言无关的,可以推断出输入中不存在的信息,并且会受到说话者情绪等副语言线索的影响。
-
VoxZip框架将音频大模型键值缓存需求降低20倍
研究人员开发了VoxZip,一个新颖的两阶段框架,旨在压缩语音大模型中长上下文音频推理的键值缓存。该方法使用自动语音识别(ASR)转录作为语义锚点来对齐和压缩音频令牌,然后采用动态过滤策略移除非必需令牌。在Qwen3-Omni上的评估表明,VoxZip可以在长上下文场景下实现20倍的键值缓存压缩,同时保持超过90%的未压缩基线性能;在4倍压缩下,它可将推理吞吐量提高1.9倍,并将内存开销降低3.3倍。
-
用户寻求使用本地LLM进行原生长视频分析
一位Reddit r/LocalLLaMA板块的用户正在寻求关于使用本地大型语言模型(LLM)处理长视频(6-10小时)进行多模态分析的建议。他们已经开发了一个复杂的流程,包括音频转录、帧采样和分块,以适应上下文窗口的限制。用户正在尝试Qwen3-Omni和Gemma4 12B等模型,并正在寻找更高效的原生解决方案,能够无需大量手动处理即可处理如此大量的视频输入。
-
在巴巴多斯报纸上训练的AI模型在本地语境识别方面显示出潜力
研究人员正在探索领域自适应预训练,以提高音频模型在特定地区的准确性,并以巴巴多斯为例。通过在大量巴巴多斯报纸档案语料库上训练Qwen3-Omni模型,目标是让模型能够理解本地语境,例如标准模型经常识别错误的地点名称、机构和文化活动。虽然初步结果显示在提高本地实体知识探测得分方面有希望,但对实际音频转录准确性的影响仍在调查中。
-
Thinking Machines 发布 Inkling,一个开源的原生音频大语言模型
由前OpenAI首席技术官Mira Murati创立的实验室Thinking Machines发布了Inkling,这是一个具有原生音频处理能力的开源模型。这个拥有9750亿参数、410亿活跃参数的模型可以直接处理文本、图像和音频,无需外部编码器,这是以前只有闭源模型才具备的功能。虽然Inkling在理解音频、转录语音和处理语音指令方面表现出色,但目前它只能以文本形式响应,而非合成语音。该模型在AudioMC等基准测试上的表现远超开源…
-
Google DeepMind 发布适用于笔记本电脑的 Gemma 4 12B 多模态模型
Google DeepMind 发布了 Gemma 4 12B,这是一款专为在具有 16GB VRAM 的笔记本电脑上本地运行而设计的新型多模态模型。该模型采用新颖的统一架构,将音频和视觉输入直接集成到 LLM 主干中,无需单独的编码器,从而降低了延迟和内存使用量。Gemma 4 12B 旨在将先进的代理多模态能力带到日常硬件上,其性能接近其较大的 26B MoE 版本,并通过开放许可和与流行工具的集成获得广泛的开发者支持。
-
新研究发现模态对齐会迁移人工智能音频攻击
一篇新研究论文引入了“对齐诅咒”原则,该原则证明了全模态模型中改进的文本-音频模态对齐如何会无意中将安全漏洞从文本迁移到音频。研究人员发现,文本迁移的音频攻击与仅音频攻击一样有效,甚至常常更优越,这表明当前的音频安全评估可能低估了风险。该研究分析了Qwen2.5-Omni和Qwen3-Omni等模型,发现更紧密的模态对齐与更有效的跨模态攻击迁移之间存在持续的相关性。
-
新方法利用仅解码器LLM增强同步语音翻译
研究人员正在开发新的同步语音翻译方法,重点关注仅解码器的大型语言模型。一种名为AlignAtt4LLM的方法,通过调整这些模型的注意力机制来提高德语和意大利语等语言的翻译质量,即使在低延迟场景下也是如此。另一种名为DOA的方法,在SpeechLLMs内部使用自注意力机制,在无需重新训练的情况下获得长文本翻译的对齐信号。此外,一个名为Canary的系统,拥有10亿参数,提供了多种语言的离线同步翻译能力。
-
SEATS 方法通过修剪音视频 Token 削减大语言模型计算量
研究人员开发了一种名为 SEATS 的新方法,以提高全模态大语言模型(om-LLMs)的效率。SEATS 在模型的各个层中修剪冗余的音视频 Token,并根据跨模态融合自适应地调整 Token 选择过程。这种方法在保持高性能的同时,显著降低了计算负荷并加快了推理速度。
-
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
研究人员开发了一种名为 Token-Aware Gradient Optimization (TAGO) 的新方法,以提高音频语言模型 (ALM) 越狱攻击的效率。TAGO 仅识别并利用最具影响力的音频 token 梯度,显著降低了这些攻击所需的计算量。该方法保持了高成功率,表明密集波形更新在很大程度上是不必要的,并建议未来的研究应侧重于音频安全对齐的 token 级梯度结构。
-
NVIDIA 发布 Nemotron 3 Nano Omni,统一多模态 AI 以提高效率
NVIDIA 发布了 Nemotron 3 Nano Omni,这是一个开放的多模态模型,能够处理文本、图像、音频和视频。该模型旨在将这些模态统一到单一架构中,从而提高效率并实现更复杂的人工智能智能体。Nemotron 3 Nano Omni 在文档智能、音频理解和视频分析的基准测试中表现出色,与之前的模型和替代方案相比,在吞吐量和推理速度方面均有显著提升。
-
阿里云发布7个新AI模型及520亿美元路线图
阿里云宣布其AI能力迎来重大扩展,在四天内发布了七个新模型。其中包括Qwen3-Max、Qwen3-Omni和Qwen3-VL模型,预示着在各个AI领域取得的进展。该公司还公布了高达520亿美元的重大路线图,表明了其对AI开发和基础设施的长期承诺。