PulseAugur
实时 21:11:29
English(EN) Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

Gemini-3.1-Pro-Preview 在音频分类基准测试中领先,超越竞争对手

一项新的基准测试评估了包括多个Gemini模型和Kimi-Audio-7B-Instruct在内的十一种音频分类方法在声源识别任务上的表现。表现最佳的模型Gemini-3.1-Pro-Preview在类别级F1分数上达到了85.6%,在细粒度F1分数上达到了56.7%。研究还发现,Gemini模型经常给出自信但错误的答案,并且响应长度与准确性不相关。 AI

影响 为音频-语言模型的性能设定了新的基准,突显了Gemini的能力并为未来模型开发提供信息。

排序理由 该集群描述了一篇研究论文,该论文在一个特定的基准测试上评估了多个音频分类模型。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Gemini-3.1-Pro-Preview 在音频分类基准测试中领先,超越竞争对手

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    基础模型能否听出声音的来源?用于闭集声源识别的音频-语言模型与传统分类器的分层基准测试

    We benchmark eleven audio classification methods: five task-aware closed-set LLMs (four Gemini models plus open-weight Kimi-Audio-7B-Instruct), four fixed-vocabulary taggers (YAMNet, PANNs, Whisper-AT, and SSLAM), a zero-shot audio-text model (CLAP), and an audio-grounded LLM (BA…