研究人员发现,在时间笑声定位中,标注者之间的分歧是结构化的,而非随机的。一项对SMILE-Temporal基准进行的重新标注研究发现,分歧在笑声的结束点比开始点更常见且幅度更大,并且对于轻笑比完全的笑声更频繁。这种结构化的分歧显著影响系统评估,导致分数根据所选的真实标注而变化。研究人员提出了一种分歧校准的评估方法,使用共形校准的容差带(tolerance bands)来解释这些系统性模式。 AI
影响 这项研究强调了在依赖人类标注的AI系统中,需要更鲁棒的评估指标,尤其是在时间事件定位等细微任务上。
排序理由 该集群包含一篇学术论文,详细介绍了一种评估AI模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Eyal Hanania
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
- SMILE-Temporal
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →