研究人员开发了GigaChat Audio,这是一种新颖的时间感知大型音频语言模型,能够理解长达两小时的音频录音并回答相关问题。该模型通过将周期性时间标记与音频标记交错,解决了长音频中的时间定位挑战。它在时间定位方面取得了显著的准确性,优于其他开源模型,并支持包括自动语音识别(ASR)、翻译和问答在内的各种音频任务。模型权重和数据集正在发布,以促进时间感知音频理解的进一步研究。 AI
影响 该模型推进了音频大型语言模型中的时间定位能力,有望改进需要分析长音频录音的应用。
排序理由 该条目描述了一篇新的研究论文和用于音频理解的模型发布。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- ai-babai/gigachat-audio-mlx-q8-bf16
- ai-sage/TimeGround-1M
- gigaampere
- GigaChat3.1-Audio-10B-A1.8B
- GigaChat Audio
- GigaChat Audio 10B (A1.8B)
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →