研究人员推出Realtime-Venus,一个旨在实现更自然人机交互的新型全双工交互系统。该系统利用两个专门的9B模型:Realtime-Venus-Omni用于视听任务,Realtime-Venus-Audio用于语音交互。这些模型通过共享时间线整合了连续感知、对话控制和语音生成,允许在不中断前景对话的情况下进行异步后台推理和工具执行。Realtime-Venus-Omni在视频基准测试中表现强劲,而Realtime-Venus-Audio在音频理解和语音问答方面处于领先地位,在续接指标上优于Gemini 3.1 Live和GPT-4o等模型。 AI
影响 为交互式AI系统树立了新标准,可能影响未来的多模态和对话式代理开发。
排序理由 发布论文,详细介绍了一个新AI系统及其在基准测试中的性能。
在 Hugging Face Daily Papers 阅读 →
- Daily-Omni
- Full-Duplex-Bench v1.5
- Gemini 3.1 Live
- GPT-4o
- Llama Questions
- MMAU-Pro
- OVO-Bench
- Realtime-Venus
- Realtime-Venus-Audio
- Realtime-Venus-Harness
- Realtime-Venus-Omni
- Speech CMMLU
- StreamingBench
- VoiceBench AlpacaEval
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →