实体
Serialized Output Training
Serialized Output Training
PulseAugur coverage of Serialized Output Training — every cluster mentioning Serialized Output Training across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的LLM框架TagSpeech增强了多说话人ASR和说话人分割
研究人员推出TagSpeech,一个新颖的端到端框架,用于联合自动语音识别(ASR)和说话人分割。这个基于LLM的系统利用时间锚点定位来精确识别“谁在何时说了什么”。TagSpeech采用参数高效的训练方法,冻结LLM主干,仅训练轻量级投影器,从而以较低的计算成本获得强大的性能。在AMI和AliMeeting基准上的实验表明,TagSpeech在复杂语音重叠场景下优于现有的端到端基线,包括Qwen Omni和Gemini。
-
LibriConvo 语料库推动 ASR 和说话人日志发展
研究人员开发了 LibriConvo,这是一个新颖的合成对话语音语料库,旨在改进自动语音识别 (ASR) 和说话人日志系统。该语料库通过改编 Speaker-Aware Simulated Conversation 框架创建,处理现有的 English CallHome 数据以获取对话时序,并使用按书籍分组的 LibriTTS 发音单元以获得语义连贯性。LibriConvo 包含超过 240 小时的音频,涉及 830 位说话人,基线结…