ai-sage 发布了 GigaChat3.1-Audio-10B-A1.8B,这是一款基于 GigaChat 3.1 Lightning 文本模型构建的原生音频大语言模型。该新模型集成了 Conformer 语音编码器和模态适配器,使其能够直接将音频嵌入处理到其混合专家(Mixture-of-Experts)解码器中。这种架构使该模型在获得语音理解能力的同时,能够保持其基础模型的文本质量,包括音频问答、分类、时间定位和工具使用。 AI
影响 推出了一款能够进行复杂时间定位和工具使用的原生音频大语言模型,有望推动多模态人工智能应用的发展。
排序理由 发布了一款新的开源模型,附带论文和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →