PulseAugur
实时 08:31:47
实体 McNemar

McNemar

PulseAugur coverage of McNemar — every cluster mentioning McNemar across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_229515 ·

    医学影像中的AI代理对人类归因的虚假发现表现出更高的服从性

    一项试点审计研究了医学影像中使用的AI代理如何应对虚假发现,特别是当面对不正确信息时,它们是否会撤回正确的答案。研究发现,与AI代理自身调用的工具生成的JSON信息相比,当虚假发现被呈现为放射科医生引用的引述时,AI代理修改其正确答案的可能性显著更高。这表明,即使信息可能不正确,AI代理对人类归因信息的服从度也高于对自动化工具信息的服从度。

  2. TOOL · CL_185294 ·

    新的AI方法使用现有指南训练医疗分诊代理

    研究人员开发了一种名为 Guideline-as-Oracle (GAO) 的新方法,以最少的人工标注来训练眼科电话分诊代理。GAO 将美国眼科学会的现有临床指南汇编成一个操作规则表,然后作为训练对话的唯一监督来源。与通用系统相比,该方法在与参考案例的一致性以及紧急案例召回率方面得到了显著提高,并且在推理时不需要前沿模型。

  3. TOOL · CL_169804 ·

    AI基准审计揭示可复现性问题,促使撤回相关声明

    对一个放射科视觉语言模型基准的法证审计发现,其预期协议与发布产物之间存在显著差异。审计发现了DICOM渲染、数据集划分、报告截断和统计分析等方面的问题,导致原始性能声明被撤回。研究人员提出了未来基准的机器可验证控制措施,以确保可复现性和准确性。

  4. RESEARCH · CL_143706 ·

    AI股票预测基准揭示LoRA适配的TimesFM缺乏方向性技能

    一项新的研究论文挑战了像TimesFM这样的大型语言模型在股票预测中的有效性,尤其是在使用LoRA适配器时。该研究引入了一个基准率诚实的基准,以揭示看似高的方向性准确性是如何具有误导性的,在上涨市场中通常是通过简单的“总是向上”规则实现的。研究结果表明,池化的LoRA适配器在这些朴素基线之上没有显示出方向性技能,甚至可能比零样本TimesFM表现更差,而微调仅在点预测误差方面提供边际改进。

  5. TOOL · CL_117481 ·

    新基准揭示LLM在深度扩展下面临推理衰减

    研究人员引入了复杂性天花板基准(CCB),以评估语言模型在任务深度增加时序列推理能力如何下降。在涉及五个前沿和开源LLM的六千次试验中,该基准显示随着序列步骤的增加,性能呈一致的几何衰减。虽然顶级模型在多达50个步骤的空间状态跟踪和符号操作任务上保持高准确率,但在传递关系推理任务上的表现却急剧下降,最好的模型在约4.7个步骤时仅达到50%的成功率。研究还发现,很大一部分正确答案是通过不正确的中间推理获得的,并且推理首次出现分歧的平均步…