实体
IntentBench
IntentBench
PulseAugur coverage of IntentBench — every cluster mentioning IntentBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架 AffectOmni 通过可验证的人类线索增强 LLM 的情感推理能力
研究人员开发了 AffectOmni,一个旨在提高多模态大语言模型 (MLLM) 情感推理能力的框架。该新系统专注于人们常常忽略的以人为中心的线索,如微表情和肢体语言。AffectOmni 使用强化学习,对证据选择和时间推理进行特定奖励,并采用比较评分方法来增强奖励信号的可辨别性。为了进行外部验证,它使用 SAM3 将推理过程转换为基于像素级证据的、可执行的指令,从而创建了一个可审计的接口。
-
在多模态大语言模型(MLLM)社交理解存在缺陷之际,发布了新的基准测试 Intentbench-Prime
一篇新论文强调了用于评估多模态大语言模型(MLLM)在社交视听理解方面能力的 IntentBench 基准测试存在重大问题。研究人员发现,IntentBench 中的大部分问题存在缺陷,或者无需视频输入即可回答,这促使研究人员发布了一个改进后的基准测试,名为 Intentbench-Prime。该研究还揭示,当前的链式思考(chain-of-thought)推理方法成本高昂且效果出奇地不佳,一个简单的 Vanilla SFT 基线模型…