PulseAugur
实时 06:39:44
English(EN) PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response

PolyAI 发布 Dialog-RSN-1 原生音频对话模型

PolyAI 发布了 Dialog-RSN-1,这是一款原生音频对话模型,可直接处理原始音频输入,无需转录。该模型将轮次切换、语音识别、函数调用和响应生成整合到一个系统中,目标响应时间低于 300 毫秒。虽然目前仅支持英语,并且仅通过 PolyAI 的平台提供,但它已在企业客户的实时生产通话中部署。 AI

影响 这款模型的原生音频方法有望为实时对话式 AI 树立新标准,可能降低延迟并改善语音应用的 用户体验。

排序理由 AI 实验室发布新模型。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 MarkTechPost 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

PolyAI 发布 Dialog-RSN-1 原生音频对话模型

报道来源 [1]

  1. MarkTechPost TIER_1 English(EN) · Michal Sutter ·

    PolyAI发布Dialog-RSN-1:融合轮次切换、语音识别、函数调用和响应的原生音频对话模型

    <p>PolyAI has introduced Dialog-RSN-1, a dialog model that perceives caller audio directly instead of reading an ASR transcript. It fuses turn-taking, speech recognition, function calling, and response generation into a single audio-native model, keeps TTS separate so the output …