OpenMOSS-Team发布了MOSS-Transcribe-Diarize 0.9B,这是一款专为全面音频理解设计的端到端模型。该模型一次性完成转录、说话人分离和时间戳生成,为长篇音频和视频内容生成结构化、说话人感知的文本。它特别适用于会议、通话和讲座等应用,还可以识别声音事件。 AI
影响 该模型提供了一种简化的音频转录和说话人分离方法,有望提高内容分析和会议摘要工具的效率。
排序理由 发布具有技术细节和使用说明的新模型。
- GitHub
- Google Colab
- Hugging Face
- Kaggle
- MOSS-Transcribe-Diarize 0.9B
- OpenMOSS-Team
- OpenMOSS-Team/MOSS-Transcribe-Diarize
- PyTorch
- transformers
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →