PulseAugur
中
实时 00:05:11
English(EN) Alibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speak

Alibaba Qwen 发布全双工语音模型 Qwen-Audio-3.1-Realtime

Alibaba 的 Qwen 团队发布了 Qwen-Audio-3.1,这是一套包含五个音频模型的套件,其中包括一个名为 Qwen-Audio-3.1-Realtime 的全双工语音模型,专为与工具交互的语音代理而设计。该新模型拥有 262K 的上下文窗口,并具备函数调用和网络搜索等功能。该系统基于“思考、行动、说话”架构运行,利用多个模型进行决策、语音转文本转换和文本转语音渲染。Alibaba 还大幅降低了其音频模型的定价,其中 Qwen-Audio-3.1-Realtime 的价格降低了约 85%。 AI

影响 通过全双工交互和工具调用增强语音代理功能,有望改善对话式 AI 应用中的用户体验。

排序理由 前沿实验室模型发布,附带系统卡 [lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 MarkTechPost 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Alibaba Qwen 发布全双工语音模型 Qwen-Audio-3.1-Realtime

报道来源 [1]

  1. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    阿里巴巴通义发布Qwen-Audio-3.1-Realtime:一款经过训练、能思考、能行动、能决定何时说话的全双工语音模型

    <p>Alibaba's Qwen team released Qwen-Audio-3.1-Realtime, a full-duplex voice model trained to reason, call tools and decide when to speak. On a τ-Voice adaptation, task success rises to 82.0% from 78.4%. Replies to background speech drop from 73% to 13%. It is available now as an…