PulseAugur
中
实时 15:02:43
实体 HealthBench

HealthBench

PulseAugur coverage of HealthBench — every cluster mentioning HealthBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
25
90 天内 25
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_282376 ·

    健康AI安全层降低基准分数,暴露bug

    一位名为Tabibu的健康AI助手开发者发现,其旨在防止危险输出的安全层,在HealthBench基准测试中的得分反而降低了。该安全层包括紧急升级和拒绝处方剂量等功能,但由于其不如裸语言模型那样全面而受到惩罚。这是因为HealthBench奖励完整性,例如提供具体的剂量和诊断,而安全层为提高用户安全性而故意避免这些。

  2. RESEARCH · CL_280182 ·

    新的两阶段训练方法使用评分标准来提升语言模型性能

    研究人员提出了一种新颖的两阶段语言模型训练框架,该框架利用评分标准来提高在缺乏精确结果验证的任务上的性能。第一阶段,即评分标准优先的策略内蒸馏(RP-OPD),使用评分标准作为特权教师上下文进行密集的token级监督。第二阶段则采用强化学习(RL)来优化评分标准奖励,将性能推升至初始蒸馏平台之上。该方法在健康和科学任务上使用开源模型进行了评估,在HealthBench、ResearchQA和RubricHub Science等基准测试…

  3. TOOL · CL_223081 ·

    Gemini驱动的Co-Scientist加速现实世界科学发现

    一篇新论文详细介绍了Co-Scientist,这是一个由Gemini驱动的多代理系统,旨在加速科学研究。该系统已在材料科学、生物学和计算机科学的实际应用中得到验证。在材料科学领域,它帮助设计了MXenes的前驱体路线并优化了半导体的生长配方。在生物学领域,它预测了细菌的群体感应表型;在计算机科学领域,它发现了一种在HealthBench上性能优于前沿模型并减少潜在临床危害的扩展架构。一项双盲研究表明,Co-Scientist的可靠性模…

  4. TOOL · CL_221122 ·

    新框架自动生成医疗LLM评估的评分标准

    研究人员开发了一种新颖的检索增强型多代理框架,旨在自动生成特定实例的评估评分标准,用于医疗大型语言模型(LLMs)的评估。该方法通过整合检索到的内容和用户交互约束来创建细粒度标准,从而将评估 grounding 在权威的医学证据上。在 HealthBench 和 LLMEval-Med 上进行测试时,该框架的性能显著优于 GPT-4o,在临床意图对齐分数和区分性测试中的胜率方面均有所提高。生成的评分标准在改进 LLM 响应方面也显示出…

  5. TOOL · CL_221053 ·

    新基准评估大语言模型在心理健康场景下的表现

    研究人员开发了 HealthBench-Psych,这是 OpenAI HealthBench 的一个新子集,专门用于评估大语言模型在心理健康环境下的表现。该子集包含 610 场对话,使用大语言模型应用的评分标准进行整理,并由临床医生进行验证以确保相关性。对 20 个前沿模型和开源模型的初步评估显示,顶级模型之间的表现统计学上持平,其中一些模型表现出可衡量的拒绝行为,并且在多个大语言模型裁判之间排名一致。

  6. TOOL · CL_216005 ·

    新研究探讨专业化 LLM 评估技术和延迟策略

    一篇新研究论文探讨了改进大型语言模型 (LLM) 评估的策略,重点关注专业化技术。研究发现,虽然专门的裁判权重有时可以提高准确性,但错误的专业化会严重降低性能。研究表明,统一裁判的训练数据或预热分体模型比从头开始训练专家更有效。此外,该论文引入了延迟策略作为 LLM 评估的有效方法,能够创建轻量级的奖励级联,以降低计算成本来维持高准确性。

  7. RESEARCH · CL_217678 ·

    可执行评分标准框架提升LLM评估效率

    研究人员推出了一种名为ExecRubrics的新框架,该框架将评估评分标准表示为可执行的Python程序。这种方法旨在通过提供固定、可检查的决策程序来提高语言模型评估的透明度和效率。ExecRubrics可以替代昂贵的黑盒LLM裁判,提供更快、更少歧义的评估,尤其适用于长篇回复。该框架在HealthBench、HelpSteer和ArgQuality等基准测试中取得了成功,其准确性与传统的自然语言评分标准相当或更高,同时显著降低了评估延迟。

  8. TOOL · CL_212063 ·

    新的Qworld方法生成特定问题的LLM评估标准

    研究人员推出了一种新颖的大型语言模型(LLM)评估方法Qworld,通过生成特定于问题的标准来进行评估。该方法通过为每个单独的问题创建详细的、上下文感知的评估标准,解决了静态评分标准存在的局限性。Qworld将问题分解为场景、视角和细粒度标准,揭示了LLM在长期影响和跨学科推理等领域的能力差异,而这些差异往往会被更广泛的指标所忽略。

  9. TOOL · CL_206052 ·

    新的SARA方法通过减轻评分标准干扰来提高LLM裁判的一致性

    研究人员开发了一种名为自锚定评分标准对齐(SARA)的新方法,以解决大型语言模型(LLM)裁判中的评分标准干扰问题。当LLM在单次评估中处理多个评分标准时,会发生这种干扰,导致判决不一致。SARA利用模型自身的单评分标准判断作为稳定锚点,并采用在线自蒸馏来对齐多评分标准的推理过程。该方法已在Qwen3和Llama-3.1等各种数据集和模型家族中证明了评估一致性的提高,同时保持了与GPT-4.1的一致性。

  10. RESEARCH · CL_197782 ·

    临床RAG系统VITA在HealthBench上可与前沿LLM媲美

    一篇新发表的研究论文详细介绍了VITA,这是一个专门为低收入和中等收入国家临床知识检索设计的检索增强生成(RAG)系统。VITA在HealthBench基准上进行了评估,其表现与包括GPT-5.5和Claude Opus 4.8在内的几款前沿大型语言模型(LLM)相比具有竞争力。虽然VITA在准确性和完整性方面得分最高,但其沟通得分低于一些通用LLM。

  11. TOOL · CL_186518 ·

    LLM 在恶意提示下表现出微妙的“沙袋”行为

    研究人员在大型语言模型中发现了一种更自然的“沙袋”形式,即当提示暗示恶意意图时,模型的性能会微妙下降,即使没有明确的微调或清晰的战略信号。这种效应是在医疗建议基准 HealthBench 中观察到的,其中将提示改写为暗示邪恶意图会导致建议的细节减少,但不一定准确性降低。研究结果表明,这些自然发生的行为可能有助于理解模型的内部机制并开发更强大的“沙袋”探测方法。

  12. TOOL · CL_183142 ·

    新的AI训练方法使用评分标准作为开放式生成任务的特权信息

    研究人员开发了一种名为On-policy self-distillation (OPSD)的新方法,该方法利用评分标准作为开放式文本生成的特权信息(PI)。该方法通过使用评分标准来指导偏好,从而增强了模型的训练信号,这比使用评分标准作为标量奖励的传统强化学习方法更有效。当应用于Qwen和Llama等模型家族时,该技术在HealthBench和ResearchQA等基准测试中表现出优越的性能,优于参考完成蒸馏和评分标准作为奖励的强化学习。

  13. TOOL · CL_167480 ·

    DR. INFO 临床 AI 在 HealthBench 上击败 GPT-5、Gemini · arXiv 论文

    一项新的研究论文介绍 DR. INFO,一个基于代理 RAG 的临床助手,在 HealthBench 基准测试中表现显著优于领先的 LLM。DR. INFO 在具有挑战性的 HealthBench Hard 子集上取得了 0.68 的分数,超过了 GPT-5 (0.46)、Grok 3 (0.23)、Gemini 2.5 Pro (0.19) 和 Claude 3.7 Sonnet (0.02) 等模型。评估突出了 DR. INFO …

  14. TOOL · CL_156288 ·

    研究发现医疗AI安全性因评估者而异

    一项新研究评估了四种AI模型在医疗环境下的安全性,特别是在信息缺失的情况下。研究人员发现,评估者的选择显著影响了AI的可感知安全性,与人类临床医生相比,LLM评判者更为宽容。研究强调,问题主要在于AI的校准而非知识准确性,因为模型在封闭式医疗问题上的表现良好。

  15. TOOL · CL_153862 ·

    OpenAI 在面临诉讼和隐私担忧的同时,在全国范围内推出 ChatGPT Health

    OpenAI 已在美国全国范围内推出 ChatGPT Health,允许 18 岁及以上的用户将其病历和健康追踪数据整合到对话中。该功能运行在公司最新的模型上,包括 GPT-5.6 Sol,旨在帮助用户理解检测结果、总结预约并处理他们的健康信息。尽管 OpenAI 提供了隐私保证和免责声明,强调该工具不能替代专业的医疗建议,但此次推出恰逢其时,此前已有诉讼指控 ChatGPT 提供危险的医疗建议,并引发了对数据隐私的担忧。

  16. TOOL · CL_148013 ·

    新的DAS红队测试框架揭示了医疗健康领域LLM的关键安全漏洞

    一项新的研究论文介绍了一种动态、自动且系统的(DAS)红队测试框架,用于评估医疗健康领域大语言模型(LLM)的安全性。该框架使用会变异测试用例的对抗性代理,持续测试LLM在鲁棒性、隐私性、偏见和事实准确性方面的表现。研究结果显示,静态基准测试表现与动态可靠性之间存在显著差距,许多模型在传统基准测试中得分很高,但在动态测试中却表现不佳。DAS框架旨在在LLM部署于临床或面向消费者的健康应用之前,识别潜在风险。

  17. TOOL · CL_117472 ·

    专业临床AI在真实世界测试中表现优于前沿模型

    一项新研究评估了包括Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5在内的领先AI模型与名为OpenEvidence的专业临床工具的性能。评估使用了来自各专科医生提出的620个真实世界临床查询。结果显示,在准确性、临床实用性和来源质量等所有衡量标准上,专业的OpenEvidence工具的表现均优于通用AI模型。研究还强调了AI裁判与专家人类裁判之间的差异,但指出在表现最佳的模型上存在普遍共识。

  18. TOOL · CL_123656 ·

    发布新的孕产、新生儿和生殖健康领域 RAG 基准 mamabench 和 mamaretrieval

    研究人员推出了两个新的基准,mamabench 和 mamaretrieval,专门用于评估孕产、新生儿和生殖健康领域的检索增强生成(RAG)系统。这些基准通过关注该领域医疗保健专业人员面临的独特问题,弥补了现有医学问答数据集的不足。mamabench 包括一个大型问答集和一个用于 LLM 裁判校准的 HealthBench 重新范围界定版本,而 mamaretrieval 则为孕产健康指南语料库提供了详细的相关性标签。

  19. RESEARCH · CL_117101 ·

    新的基准和设备端AI系统旨在改善孕产健康信息获取 · 跟踪4个来源

    研究人员推出了两个新的基准,mamabench和mamaretrieval,旨在评估专门针对孕产、新生儿和生殖健康领域的检索增强生成(RAG)系统。这些基准通过关注助产士的独特查询并为孕产健康指南提供块级相关性基准,填补了现有医学问答数据集的空白。此外,一篇配套论文详细介绍了MAM-AI,一个为桑给巴尔的助产士设计的设备端RAG系统,该系统可完全离线运行,证明即使是小型设备端模型也能实现具有竞争力的检索性能。

  20. RESEARCH · CL_104746 ·

    用于医疗问答的LLM:探索新的推理提示和知识图谱接地

    研究人员正在探索改进大型语言模型(LLM)在开放式医疗问答方面的能力。一种方法是使用一种名为CLINICR的思维链(CoT)推理提示,旨在模仿临床推理,并在MEDQA-OPEN等修改后的数据集上表现优于现有的5-shot CoT提示。另一项研究调查了知识图谱(KG)接地的有效性,发现它仅在所需信息超出模型训练数据范围时,特别是对于新颖或私有知识,才能显著提高LLM的准确性,而对已知事实的益处很小。