实体
AudioLLMs
AudioLLMs
PulseAugur coverage of AudioLLMs — every cluster mentioning AudioLLMs across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新arXiv论文概述多轮多模态对话式AI的挑战
一篇新的arXiv论文详细介绍了多轮对话式AI的进展和剩余挑战,该技术正从单一文本提示演变为持续的多模态交互。研究按数据集、模型、训练策略和评估方法对现有工作进行了分类,并指出尽管多模态感知有所改善,但系统在持久记忆、跨轮次关联和文化对齐方面仍面临困难。论文最后概述了一个研究议程,重点是开发能够跨越不同轮次、模态和文化进行记忆、修改、关联、说话、倾听、行动和适应的AI。
-
新的MMAC基准评估AudioLLMs的字幕可靠性
研究人员推出MMAC,一个旨在跨多个维度评估音频字幕模型的新基准。该基准包含来自不同来源的5,638个音频片段,并根据15个评估维度和6个能力类别的信信息覆盖率和可靠性来评估字幕。使用MMAC进行的初步评估显示,开源和专有的AudioLLMs在性能上存在显著差异。