实体
Junhao Chen
Junhao Chen
PulseAugur coverage of Junhao Chen — every cluster mentioning Junhao Chen across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM 为内部计算形成隐式离散状态表示
研究人员发现,大型语言模型(LLM)可以在没有明确的思维链推理的情况下,在内部执行扩展计算。这表明模型可能在其隐藏状态中形成隐式离散状态表示(IDSR),以进行符号计算。研究发现,虽然这些表示用于内部计算,但在当前的开源模型中它们并非完美无损,会导致最终输出出现错误。这项研究初步探索了 LLM 的符号计算能力和底层机制。
-
新的基准测试探究医疗AI的推理和可信度
发布了两个新的基准测试Med-R2和MedVIGIL,用于评估医疗视觉语言模型(VLMs)的可信度和证据基础推理能力。Med-R2关注临床工作流程不同阶段的对抗鲁棒性,揭示了当前模型常常依赖于虚假先验而非视觉证据。MedVIGIL专门测试VLM识别视觉证据是否失效或具有误导性的能力,这是安全临床部署的关键因素。两个基准测试都突显了当前医疗VLM的显著局限性,并旨在推动其可靠性和临床适用性的改进。