PulseAugur
中
实时 16:50:35
实体 collision

collision

PulseAugur coverage of collision — every cluster mentioning collision across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_275434 ·

    新的基准PhysicsLENS测试机器人视频中的物理准确性

    研究人员开发了PhysicsLENS,这是一个新的数据集和基准,旨在评估视频生成模型(尤其是在机器人技术背景下)的物理合理性。当前的基准通常忽略摩擦或粘度等隐藏的物理属性,导致模型生成视觉上令人信服但物理上不准确的机器人视频。PhysicsLENS通过使用匹配的场景对来解决这个问题,这些场景对在保持视觉条件和任务一致的情况下改变底层物理属性,涵盖了七个物理领域。评估显示,许多看似合理的视频都忽略了所陈述的物理属性,这凸显了当前机器人应…

  2. TOOL · CL_217815 ·

    新的 Credal LLM 改进了不确定性表示并减少了幻觉

    研究人员引入了 Credal 大型语言模型 (CLLM),以解决 LLM 生成自信但错误的答案的问题。与使用单一预测分布的标准 LLM 不同,CLLM 采用 LoRA 适配器集成来创建 Credal 集。该集合暴露了一系列合理的分布,从而可以推导出更好地反映不确定性的承诺分数。所提出的方法,Credal Token Commitment (CTC) 和 Semantic Commitment Consistency (SCC),在 G…

  3. RESEARCH · CL_193740 ·

    大语言模型不确定性量化研究探索校准以获得可靠答案

    两篇研究论文探讨了提高大语言模型(LLM)生成答案可靠性的方法,特别是在问答任务中。第一篇论文介绍了 A-CRC-QA,这是一个事后校准框架,旨在通过将选择条件误差控制重新表述为线性期望约束来控制被接受答案中的错误率。第二篇论文实证研究了如何从词元概率中推导出数学问答的校准置信度估计,比较了单通道和多通道估计器,并评估了 Platt 缩放和等渗回归等事后校准方法。