PulseAugur
实时 18:38:20
实体 GigaChat Audio

GigaChat Audio

PulseAugur coverage of GigaChat Audio — every cluster mentioning GigaChat Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
时间线
  1. 2026-08-01 product_launch Sber updated GigaChat Audio to handle longer audio recordings and added new features for speaker separation and fact retention. 来源
  2. 2026-07-19 product_launch Sber updated its GigaChat Audio model and released an open-source version, GigaChat3.1-Audio-10B, along with the GigaAM Multilingual speech recognition family. 来源
  3. 2026-07-11 research_milestone Researchers released GigaChat Audio, a time-aware large audio language model capable of processing up to two hours of audio. 来源
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_176675 ·

    Sber 的 GigaChat 音频现可处理 3 小时录音,支持说话人分离

    Sber 更新了其 GigaChat 音频服务,增强了其处理长达三小时音频的能力。更新后的版本现在可以区分说话人、生成带时间戳的摘要、识别情绪语气,并保留语音对话中的事实信息。这项进步使得更有效地处理长时间会议成为可能,提供摘要并使用户能够根据原始录音验证关键点。然而,建议用户谨慎处理敏感信息,因为系统对情绪语气的解读是主观的,并且事实的保留需要仔细管理和验证。

  2. SIGNIFICANT · CL_151022 ·

    Sber发布开源GigaChat Audio,支持情绪检测和时间戳

    Sber更新了其GigaChat Audio模型,增强了其直接处理音频文件而无需完整转录的能力,并能检测语音中的情绪基调。更新后的模型现在可以识别说话人、总结内容,并在长达三小时的录音中为特定时刻提供时间戳。此外,Sber还发布了开源版本GigaChat3.1-Audio-10B,以及支持多种语言的GigaAM多语言语音识别系列。

  3. RESEARCH · CL_141512 ·

    新研究解决音频语言模型在指令遵循和评估方面的局限性

    研究人员正在开发新方法来改进大型音频语言模型(LALM)的功能。一种方法侧重于使用音频感知LLM为文本到音频生成中的指令遵循提供细粒度反馈,特别是在涉及多个声音事件和时间顺序的任务中。另一项研究调查了LALM在语音评估中可能采取的潜在捷径,发现一些模型依赖于协议级别的线索,而不是真正地收听音频。此外,还引入了新的基准和模型来评估和增强长音频录音中的多音频理解和时间定位能力。

  4. TOOL · CL_155061 ·

    GigaChat Audio 10B 模型提供长达2小时音频的时间感知理解能力

    研究人员开发了GigaChat Audio,这是一种新颖的时间感知大型音频语言模型,能够理解长达两小时的音频录音并回答相关问题。该模型通过将周期性时间标记与音频标记交错,解决了长音频中的时间定位挑战。它在时间定位方面取得了显著的准确性,优于其他开源模型,并支持包括自动语音识别(ASR)、翻译和问答在内的各种音频任务。模型权重和数据集正在发布,以促进时间感知音频理解的进一步研究。