PulseAugur
实时 12:39:32
实体 GigaChat3.1-Audio-10B-A1.8B

GigaChat3.1-Audio-10B-A1.8B

PulseAugur coverage of GigaChat3.1-Audio-10B-A1.8B — every cluster mentioning GigaChat3.1-Audio-10B-A1.8B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_163943 ·

    ai-sage 发布 GigaChat3.1-Audio-10B-A1.8B,一款原生音频大语言模型

    ai-sage 发布了 GigaChat3.1-Audio-10B-A1.8B,这是一款基于 GigaChat 3.1 Lightning 文本模型构建的原生音频大语言模型。该新模型集成了 Conformer 语音编码器和模态适配器,使其能够直接将音频嵌入处理到其混合专家(Mixture-of-Experts)解码器中。这种架构使该模型在获得语音理解能力的同时,能够保持其基础模型的文本质量,包括音频问答、分类、时间定位和工具使用。

  2. TOOL · CL_155061 ·

    GigaChat Audio 10B 模型提供长达2小时音频的时间感知理解能力

    研究人员开发了GigaChat Audio,这是一种新颖的时间感知大型音频语言模型,能够理解长达两小时的音频录音并回答相关问题。该模型通过将周期性时间标记与音频标记交错,解决了长音频中的时间定位挑战。它在时间定位方面取得了显著的准确性,优于其他开源模型,并支持包括自动语音识别(ASR)、翻译和问答在内的各种音频任务。模型权重和数据集正在发布,以促进时间感知音频理解的进一步研究。