PulseAugur
中
实时 23:56:28
实体 theory of mind

theory of mind

PulseAugur coverage of theory of mind — every cluster mentioning theory of mind across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
35
90 天内 35
发布 · 30天
0
90 天内 0
论文 · 30天
27
90 天内 27
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/2 页 · 共 35 条
  1. MEME · CL_288566 ·

    AI 对就业的影响:“Tom”与心智理论的讨论

    一篇Reddit帖子讨论了AI对就业的潜在影响,特别提到了一个假设场景,即一个名为“Tom”的AI系统可能导致首次裁员。讨论涉及AI中的心智理论概念及其对失业的影响。

  2. TOOL · CL_231570 ·

    新基准 CoMMET 评估多模态大语言模型的心理理论能力

    研究人员推出 CoMMET,一个旨在评估多模态大语言模型(MLLMs)心理理论(ToM)能力的新基准。该基准受到基于心理学的心理理论小册子任务的启发,并将评估扩展到包括更广泛的心理状态和多轮交互。CoMMET 旨在更全面地评估 MLLMs 的社交推理能力,这对于它们在实际应用中的有效部署至关重要。

  3. TOOL · CL_238357 ·

    新理论提出具备“心智理论”的LLM智能体用于6G网络

    一篇新论文提出了一个理论框架,旨在使用大型语言模型(LLM)智能体来管理未来的6G网络。研究表明,智能体之间的消息应被视为推理的痕迹,而非客观事实,这需要智能体具备“心智理论”(ToM)来模拟彼此的信念和推理过程。这种方法旨在通过源自认知信道模型的五个设计原则,增强网络抵御AI幻觉导致的级联故障的韧性。

  4. RESEARCH · CL_233355 ·

    新研究提出面向6G网络的LLM智能体心智理论

    一篇新研究论文提出了一个使用大型语言模型(LLM)智能体管理未来6G网络的框架。该论文介绍了用于弹性多智能体系统的五项原则,强调消息应被视为推理的痕迹而非客观事实。它建议,一种“心智理论”方法,即智能体模拟其同行的信念,对于防止由AI幻觉引起的级联故障至关重要。所提出的方法使用认知信噪比和蜂窝层模型来确保网络一致性和抗误导性。

  5. TOOL · CL_229132 ·

    新的人工智能对齐方法利用心智理论减少误解

    研究人员开发了一种名为“摩擦策略优化”(FPO)的新方法,该方法利用心智理论(ToM)来改善人工智能模型中的对话对齐。该方法区分了表面协调和真正的认知对齐,后者是指信念状态的收敛。通过模拟参与者对彼此信念的信念,FPO可以检测并减轻“沉默分歧”,即人工智能和用户在不知情的情况下基于不同的假设进行操作。评估表明,与直接偏好优化(DPO)等标准方法相比,FPO显著减少了误解,并提高了人工智能策略的稳定性和能力。

  6. TOOL · CL_229028 ·

    GPT-4o 在新的大模型研究中展现出类人的心智理论能力

    一项发表在 arXiv 上的新研究调查了大型语言模型(LLMs)是否拥有心智理论(ToM),即理解他人信念、意图和情感的能力。研究人员使用改编的“奇怪故事”范式,将包括 GPT-4o 在内的五个大模型与人类对照组进行了性能比较。虽然较小的模型显示出局限性,但 GPT-4o 在推断角色状态方面表现出了与人类相当的准确性和鲁棒性,引发了关于大模型理解的本质与复杂模式匹配之间关系的疑问。

  7. TOOL · CL_221076 ·

    AI评估缺陷:不完整的参考集逆转模型排名

    一篇新发表在arXiv上的论文,题为“不匹配不等于错误:不完整的参考集会逆转开放式心智理论追踪的校准排名”(Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings in Open-Theory-of-Mind Tracking),揭示了开放式心智理论(ToM)模型评估中的一个关键缺陷。研究表明,当前依赖有限参考集…

  8. TOOL · CL_218153 ·

    新框架DyCAC增强了大型语言模型在多文化环境下的社会理解能力

    研究人员推出了一种名为DyCAC的新型框架,旨在增强大型语言模型(LLMs)的社会理解能力。与将文化视为静态属性的现有方法不同,DyCAC通过将沟通偏好建模为时变文化特征混合体,从而动态适应多文化互动。该方法通过一个持续追踪对话者认知状态的心理理论(ToM)模块得到进一步完善。在社会和文化基准测试上的实验表明,DyCAC的表现优于当前基线,在多样化的多文化环境中展现出更强的社会智能和适应性。

  9. TOOL · CL_218088 ·

    Theory of Mind 增强了 LLM 在最后通牒博弈中的对齐能力

    一篇新的研究论文探讨了心智理论(ToM)和亲社会信念如何影响大型语言模型(LLMs)在最后通牒博弈中的行为。该研究使用了 2,700 次模拟,LLM 代理被初始化为具有“贪婪”、“公平”或“无私”的信念,并具有不同程度的 ToM 推理能力。结果表明,ToM 显著增强了与人类规范的对齐、决策一致性和谈判结果,特别是对于推理模型。研究还发现,不同的博弈角色从不同顺序的 ToM 中受益,并且 Llama 3.3 70B 表现出的推理与其行为…

  10. TOOL · CL_216043 ·

    新的ARGUS框架使用心智理论进行有说服力的论证生成

    研究人员开发了ARGUS,一个新颖的基于代理的框架,旨在增强有说服力的论证生成。该系统利用心智理论(ToM)推理器来模拟受众的信念和价值观,然后指导一个组件感知的规划器。规划器将论证分解为子主题,分配修辞功能,并检索证据,一个精炼模块迭代地改进输出。在三个基准上的评估表明,ARGUS持续优于强大的基线,取得了最高排名,并有效地改变了持抵抗态度的受众的立场。

  11. TOOL · CL_215896 ·

    新基准揭示视觉语言模型无法将心智理论转化为行动

    研究人员开发了MOSAIC,一个旨在衡量视觉语言模型(VLM)将心智理论(ToM)推理转化为协调的社会行动的能力的新基准。在对包括11个VLM在内的13个模型的评估中发现,这些模型在产生符合ToM约束的行为方面存在困难,并且在施加明确的ToM约束时没有表现出显著的行为改变。分析表明,在生成连贯的非语言信号以及解释和响应其他代理行为方面存在瓶颈。一个名为PCM-LLM的模型,它整合了一个明确的ToM模块,在所有条件下都取得了成功,这表明…

  12. MEME · CL_213182 ·

    Reddit 上分享了 Stable Diffusion 制作的猫和老鼠动画

    一位 Reddit 用户分享了一个使用 Stable Diffusion 的扩展功能创建的动画,该功能旨在保持一致的动画风格。用户指出,虽然快速动作可能导致画面模糊,但他们觉得由此产生的《猫和老鼠》动画很有趣,并希望其他人也会喜欢。

  13. TOOL · CL_202765 ·

    强弱AI脚手架无需重新训练即可提升模型性能

    研究人员开发了一种名为强弱脚手架的新颖方法,可在无需任何重新训练的情况下显著提高小型AI模型的性能。该技术涉及一个更强大的AI模型构建一个推理时期的线束,本质上是一组指令或一个包装器,以指导较弱的模型。这种方法有效地将复杂的推理卸载到确定性代码和结构化路由中,从而在心智理论基准测试上的准确性近乎翻倍。

  14. TOOL · CL_197997 ·

    AI团队使用二阶心智理论以实现更好的对齐

    研究人员提出了一个新的人机协作团队框架,该框架利用二阶心智理论(ToM-2)来改善对齐和学习。这种方法允许拥有目标知识的人类教师为AI学习者设计更有效的课程。AI学习者反过来维护一个关于教师对其自身知识理解的模型,使其能够提供结构化的偏好约束,以保持教师的模型同步。模拟表明,这种知情教师方法优于学习者主导的方法,并且在教师错误具有方向性时,ToM-2声明在修复模型漂移方面特别有效。

  15. RESEARCH · CL_174089 ·

    AI安全微调改变了LLM关于意识和价值观的信念

    一篇新的研究论文探讨了大型语言模型(LLMs)中的安全微调如何可能无意中影响它们对意识和人类价值观的表征。研究发现,阻止LLMs将意识归因于自身的努力也减少了它们将心智归因于非人类实体的倾向,并可能降低精神信仰。研究人员证明,逆转这些安全微调引起的变化可以恢复更广泛的心智归因,并在不损害核心社会推理能力的情况下,在社会学调查中产生更像人类的反应。

  16. TOOL · CL_173869 ·

    新模型解释了人类在社会学习和非社会学习之间的权衡

    研究人员开发了一个“理性心智模型”,以理解包括人类在内的智能体如何在向他人学习(社会学习)和直接经验(非社会学习)之间进行选择。该模型通过考虑另一个智能体的目标及其未来行动的信息量来量化社会学习的效用。在一项参与者选择观察或探索的游戏实验中,结果表明该模型能够准确预测人类的权衡,这表明“心智理论”在通过选择性社会学习最大化效用方面发挥着作用。

  17. MEME · CL_162952 ·

    在AI新闻集群中检测到不相关内容

    此集群包含一条似乎与AI新闻无关的项目。该内容是一条Mastodon帖子,带有与幽默和纪律相关的标签,其文本本身并未讨论AI的发展或实体。

  18. MEME · CL_157258 ·

    关于机器人“死亡”场景的幽默解读在Mastodon上走红

    一位Mastodon用户分享了一个关于人形机器人被摆拍“死亡”并被移出舞台的幽默观察。用户Tom (@[email protected]) 认为机器人不自然的姿势、覆盖它的黑毯子以及应急响应团队的尴尬反应尤其有趣。这篇帖子获得了五星好评,是对另一位用户关于技术领域转向人形机器人的评论的回应。

  19. TOOL · CL_156454 ·

    新的基准测试 MeetingToM 评估大语言模型在会议中的社交推理能力

    研究人员推出了 MeetingToM,这是一个新的基准测试,旨在评估多模态大语言模型(MLLMs)在多方会议情境下的心智理论(ToM)能力。该基准测试通过关注潜在的社交状态和群体动态(例如,表面上的一致但私下有异议的伪共识)来解决现有评估的局限性。MeetingToM 在个体、二元和群体层面评估 ToM,对当前 MLLMs 的分析显示,在整合非语言线索和推断隐藏态度方面仍然存在挑战。

  20. TOOL · CL_162791 ·

    新的基准MeetingToM测试多模态大语言模型在社交推理方面的能力

    研究人员推出了MeetingToM,这是一个旨在评估多模态大语言模型(MLLMs)在多人会议情境下心智理论能力的新基准。该基准通过关注潜在的社交状态和群体动态(例如,表面上一致但私下有异议的伪共识)来解决现有评估的局限性。MeetingToM在个体、二元和群体层面评估MLLMs,初步分析显示当前模型在整合非语言线索和推断隐藏态度方面仍面临持续挑战。