Sber更新了其GigaChat Audio模型,增强了其直接处理音频文件而无需完整转录的能力,并能检测语音中的情绪基调。更新后的模型现在可以识别说话人、总结内容,并在长达三小时的录音中为特定时刻提供时间戳。此外,Sber还发布了开源版本GigaChat3.1-Audio-10B,以及支持多种语言的GigaAM多语言语音识别系列。 AI
影响 此次发布增强了开发者的音频处理能力,可能改进会议摘要和通话分析等应用。
排序理由 该集群描述了来自主要AI实验室(Sber)的新模型发布和开源可用性。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Arena Hard Audio
- arXiv
- CNews
- GigaAM Multilingual
- GigaChat3.1-Audio-10B
- GigaChat Audio
- OpenRouter
- provod.ai
- Sber
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →