NVIDIA 推出了 NemotronLabs VoiceChat 11B,一个开源的全双工语音到语音模型,专为实时对话式 AI 设计。这个统一的模型集成了语音识别、语言理解和语音合成,实现了大约 448 毫秒的轮流延迟。一个关键特性是它能够在对话进行的同时执行工具调用,从而在不中断对话的情况下无缝集成外部功能。 AI
影响 通过降低延迟并允许在对话式 AI 应用中使用并发工具,实现更自然、更具响应性的语音交互。
排序理由 NVIDIA 发布了一个具有详细技术规格和性能指标的新开源模型。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- A100
- Audio Flamingo 3
- Full-Duplex-Bench 1.0
- NemotronLabs VoiceChat 11B
- Nemotron-Speech-Streaming-En-0.6b
- NVIDIA
- Nvidia B200
- NVIDIA H100
- NVIDIA Nemotron Nano v2
- RTX 6000 Pro
- SALM-Duplex
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →