PulseAugur
实时 07:04:21
English(EN) Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

新的LLM框架可处理嘈杂环境下的多说话人对话

研究人员开发了Cocktail-Talker,一个新颖的语音LLM框架,旨在处理嘈杂社交环境下的多说话人对话。该系统可以决定何时响应、倾听或忽略语音,并仅在适当的时候生成语音响应。为了训练Cocktail-Talker,创建了一个名为Cocktail-DialogGen的数据管道,以模拟具有不同说话人角色和背景噪音的逼真多说话人对话。 AI

影响 该框架有望在复杂的社交场景中实现更自然、更具选择性的语音对话系统交互。

排序理由 该集群包含一篇详细介绍新LLM框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的LLM框架可处理嘈杂环境下的多说话人对话

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Xilin Jiang, Riki Shimizu, Sukru Samet Dindar, Junkai Wu, Zhongweiyang Xu, Nima Mesgarani ·

    Cocktail-Talker:嘈杂社交环境下的多说话人对话建模与回合动作GRPO

    arXiv:2607.27756v1 Announce Type: cross Abstract: Spoken dialog systems are typically designed for clean, dyadic interactions in which a single user and an assistant take turns speaking. Real-world social conversations, however, are often more ambiguous: multiple speakers may par…