来自SNU的一位研究员开发了一个名为Sori-1B的新的10亿参数音频语言模型。与典型模型不同,Sori-1B的解码器完全从零开始在音频配对文本上进行训练,旨在将其响应与音频联系起来,而不是依赖纯文本先验。该模型重用了NVIDIA的冻结的Audio Flamingo Next编码器,并使用三块RTX 4090 GPU在约7.4k小时的数据上进行了训练。Sori-1B支持多种模式,包括多项选择题、开放式问题、字幕生成和自动语音识别,但其权重仅限于非商业和学术用途。 AI
影响 引入了一种新颖的音频基础语言模型训练方法,有望提高其将语言与听觉信息联系起来的能力。
排序理由 发布了一个具有新颖训练方法的新型专业语言模型。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →