PolyAI 发布了 Dialog-RSN-1,这是一款原生音频对话模型,可直接处理原始音频输入,无需转录。该模型将轮次切换、语音识别、函数调用和响应生成整合到一个系统中,目标响应时间低于 300 毫秒。虽然目前仅支持英语,并且仅通过 PolyAI 的平台提供,但它已在企业客户的实时生产通话中部署。 AI
影响 这款模型的原生音频方法有望为实时对话式 AI 树立新标准,可能降低延迟并改善语音应用的 用户体验。
排序理由 AI 实验室发布新模型。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →