实体
GigaChat3.1-Audio-10B-A1.8B
GigaChat3.1-Audio-10B-A1.8B
PulseAugur coverage of GigaChat3.1-Audio-10B-A1.8B — every cluster mentioning GigaChat3.1-Audio-10B-A1.8B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
ai-sage 发布 GigaChat3.1-Audio-10B-A1.8B,一款原生音频大语言模型
ai-sage 发布了 GigaChat3.1-Audio-10B-A1.8B,这是一款基于 GigaChat 3.1 Lightning 文本模型构建的原生音频大语言模型。该新模型集成了 Conformer 语音编码器和模态适配器,使其能够直接将音频嵌入处理到其混合专家(Mixture-of-Experts)解码器中。这种架构使该模型在获得语音理解能力的同时,能够保持其基础模型的文本质量,包括音频问答、分类、时间定位和工具使用。
-
GigaChat Audio 10B 模型提供长达2小时音频的时间感知理解能力
研究人员开发了GigaChat Audio,这是一种新颖的时间感知大型音频语言模型,能够理解长达两小时的音频录音并回答相关问题。该模型通过将周期性时间标记与音频标记交错,解决了长音频中的时间定位挑战。它在时间定位方面取得了显著的准确性,优于其他开源模型,并支持包括自动语音识别(ASR)、翻译和问答在内的各种音频任务。模型权重和数据集正在发布,以促进时间感知音频理解的进一步研究。