Alibaba 的 Qwen 团队发布了 Qwen-Audio-3.1,这是一套包含五个音频模型的套件,其中包括一个名为 Qwen-Audio-3.1-Realtime 的全双工语音模型,专为与工具交互的语音代理而设计。该新模型拥有 262K 的上下文窗口,并具备函数调用和网络搜索等功能。该系统基于“思考、行动、说话”架构运行,利用多个模型进行决策、语音转文本转换和文本转语音渲染。Alibaba 还大幅降低了其音频模型的定价,其中 Qwen-Audio-3.1-Realtime 的价格降低了约 85%。 AI
影响 通过全双工交互和工具调用增强语音代理功能,有望改善对话式 AI 应用中的用户体验。
排序理由 前沿实验室模型发布,附带系统卡 [lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Alibaba Group
- Core-Cocktail SFT
- Full-Duplex-Bench v1.5
- Full-Duplex-Bench v3.0
- Grpo
- M²-OPD
- Qwen
- Qwen-Audio-3.1
- Qwen-Audio-3.1-ASR-Flash-Filetrans
- Qwen-Audio-3.1-Realtime
- QwenCloud
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →