MedGemma
PulseAugur coverage of MedGemma — every cluster mentioning MedGemma across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新型开放式视觉语言模型MedGemma面向医疗应用
一项发表在《Nature》上的研究详细介绍了一种新开发的、用于多种医疗应用的开放式视觉语言模型。该模型名为MedGemma,旨在通过AI提升医疗领域的各项能力。
-
AI医学扫描工具出现左右混淆错误,开发者已修复
一位开发者构建了一个使用Claude、Gemini和Grok等大型语言模型来解读医学扫描的工具,但发现了一个关键缺陷:模型经常混淆患者的左右两侧。这种错误在医学上被称为“绝不发生事件”,即使模型在图像坐标中正确识别了病灶位置,也会发生。问题源于在通用图像数据上训练的模型,这些数据描述的是视觉方向(屏幕的左侧)而不是解剖学方向(患者的右侧)。已实现一个无模型检查,利用NIfTI文件的世界空间坐标来捕获这些左右颠倒的错误。
-
AI系统FRAC-MAS通过可解释性和安全性增强骨折诊断
研究人员开发了FRAC-MAS,一个新颖的多智能体AI系统,旨在用于医学影像中安全且可解释的骨折诊断。该系统集成了深度视觉模型和一致性预测,以提供具有统计学依据的鉴别诊断,并生成对患者友好的报告。FRAC-MAS在其管道深度消融研究中表现出卓越的性能,其多智能体评论员成功自动确认了86.6%的病例,并将不确定的病例上报。患者偏好研究也表明,与Llama、MedGemma和Gemini等模型相比,FRAC-MAS生成的临床报告更易于理解。
-
新的基准CRS-Bench评估医学图像编码器的可靠性
研究人员开发了CRS-Bench,一个旨在评估医学图像编码器可靠性的新基准。与之前仅关注判别能力的旧方法不同,CRS-Bench从判别能力、校准能力、标签效率和鲁棒性四个维度评估编码器。该基准使用了来自皮肤病学、眼科学和放射学的数据集,包括一个CheXpert-to-MIMIC-CXR的迁移,以模拟机构变化。引入了临床可靠性得分(CRS)作为结合这些维度的复合指标,比传统的AUROC分数提供了更全面的医学图像编码器选择方法。
-
VesselBridge3D框架适应基础模型以实现低数据3D血管分割
研究人员开发了VesselBridge3D,一个旨在改进医学影像中3D血管分割的新框架,特别是在数据稀疏的情况下。该框架使用轻量级3D适应模块来适应现有的基础模型,如DINOv3、MedSAM和MedGemma。VesselBridge3D展示了显著的性能提升,在仅有五个训练样本的情况下,比最先进的方法提高了30%,并在应对域偏移方面表现出卓越的鲁棒性。
-
AI模型微调以支持资源匮乏环境下的医疗影像设备维护
研究人员开发了一个新的AI框架,以协助资源匮乏环境下的医疗影像设备维护。他们使用INGENZI_DatasetV1对MedGemma-4B IT模型进行了微调,该数据集包含源自MRI和超声系统技术手册的10,000多个问答对。该微调模型在生成精确、准确的逐步维修说明方面表现出显著改进,解决了发展中国家医疗服务提供的关键障碍。
-
Toulmin 模型增强了医学诊断中机器学习的可解释性
研究人员开发了一个新框架,该框架使用 Toulmin 论证模型来增强机器学习 (ML) 模型在医学诊断中的可解释性。这种方法将 ML 模型的诊断声明分解为依据、保证、限定词和反驳等组成部分。一个专门的代理 MedGemma 分析连接依据和声明的保证,而 MedSigLip 计算用于反驳的图像相似度。这种结构化的呈现方式使人类专家能够批判性地评估 ML 生成的诊断,从而超越简单的预测,提供知情的诊断辅助。
-
通用人工智能模型在伤口图像分析中优于专业医疗视觉语言模型
一项新研究评估了几种视觉语言模型(VLM)在评估医疗伤口图像方面的性能。像 ChatGPT 和 Claude Pro 这样的通用模型在 HuluMed 和 MedGemma 等专业医疗 VLM 上的表现优于它们。ChatGPT 的准确率最高,达到 72.50%,其次是 Claude Pro,为 62.08%。研究表明,当前通用 VLM 中广泛的多模态推理能力在伤口分析方面超过了特定领域的医疗模型,尽管在高级伤口管理和临床可靠性方面仍然…
-
视觉语言模型在医学图像质量评估中显示出可靠性问题
一项新研究评估了视觉语言模型(VLMs)在医学图像质量评估中的可靠性,发现这些模型在处理腐蚀或有偏差的图像数据时存在困难。在 MediMeta-C 数据集上进行测试时,VLMs 的性能显著下降,尤其是在处理常用于隐私保护的像素化图像时。研究还强调,诸如机构声望或设备年龄等上下文元数据可能会不当地影响 VLM 分数,这表明其缺乏客观性并可能存在偏见。
-
Reddit用户称医疗大语言模型API稀缺
Reddit的r/MachineLearning板块的一位用户正在询问是否有面向医疗的大型语言模型(LLM)的公共API可用。他们注意到在Hugging Face上找到了MedGemma和BioMistral等模型,但观察到这些模型似乎不提供可访问的API,并且用户希望避免自行托管。问题的核心在于,目前市场上这类专门的医疗大语言模型API是否确实稀缺或不存在。
-
AI在照护支持中的“合成生活体验”悖论得到探讨
一篇新论文探讨了专为同伴式支持设计的AI系统所面临的悖论,特别是针对阿尔茨海默病及相关痴呆症(ADRD)患者的照护者。虽然AI可以提供即时且不带评判的帮助,但它缺乏真正的人生经历,而这对于人类同伴支持至关重要。研究人员分析了在线照护者社区的交流内容,并将其与LLaMA、GPT-4o-mini和MedGemma等大型语言模型的响应进行了比较。研究发现,虽然AI可以模仿人类同伴的情感劳动,但它常常捏造经验性基础,创造出一种“合成生活体验”…
-
AI在照护支持中的“合成生活体验”悖论得到探讨
一篇新论文探讨了AI系统在被要求提供同伴式支持时,生成“合成生活体验”的悖论,特别是针对阿尔茨海默病及相关痴呆症(ADRD)患者的照护者。虽然LLaMA、GPT-4o-mini和MedGemma等大型语言模型可以模仿人类同伴支持的情感基调和叙事结构,但它们的回复缺乏真实的生活体验。该研究强调了叙事真实性方面存在的差距,AI可能会捏造经验性基础,从而可能误导用户,使其相信AI拥有个人经验。
-
新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源
近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…
-
评估用于临床基因组学应用的人工智能工具
一份报告评估了用于临床基因组学的人工智能工具,重点关注 MedGemma、Nemotron RAG 和 Kimi K2.5。MedGemma 是一个基于 Gemma 7B 的 Google DeepMind 医疗大语言模型,在解释基因变异和回答医学问题方面表现出色。Nemotron RAG 由 NVIDIA 开发,是一个文献检索系统,旨在高效搜索生物医学数据库。报告详细介绍了它们的技术规格、功能评估以及在医学领域的潜在应用场景。
-
完全开放的Meditron流程推进了可审计的临床LLM
研究人员推出了完全开放的Meditron,这是一个用于开发专门用于临床决策支持的大型语言模型(LLM)的新型可审计流程。该系统通过提供对训练数据、策展过程和生成流程的完全透明性,解决了当前基于LLM的系统的模糊性。该流程包括来自八个公共医学问答数据集的统一语料库,并增加了经过临床医生审查的合成数据,采用了涉及四名医生小组的严格验证协议。评估表明,MeditronFO变体在医学基准测试中取得了最先进的性能,优于其基础模型,并为完全开放、…
-
MedSAE 增强了医疗 AI 模型 MedCLIP 的可解释性
研究人员开发了 MedSAE,一种用于增强 MedCLIP(一种用于医学成像的视觉-语言模型)可解释性的方法。通过将稀疏自编码器应用于 MedCLIP 的潜在空间,MedSAE 旨在使医疗保健领域的 AI 表示更加透明和临床可靠。在 CheXpert 数据集上的实验表明,与原始 MedCLIP 特征相比,MedSAE 神经元提供了更高的单义性和可解释性,这可能为更值得信赖的医疗 AI 应用铺平道路。
-
新基准测试医疗AI模型鲁棒性
研究人员推出了MedFM-Robust,一个旨在评估医疗基础模型可靠性的新基准。该基准测试了LLaVA-Med和GPT-4o等视觉语言模型,以及MedSAM等分割模型。目标是确保这些先进的AI工具在真实的临床环境中能够可靠地运行。
-
完全开放的Meditron流水线推动了可审计的临床LLM
研究人员推出了完全开放的Meditron,这是一个专为开发临床大型语言模型(LLM)设计的新型可审计流水线。该流水线包括一个由临床医生审计的训练语料库、一个可复现的数据构建和训练框架以及一个评估协议。该系统旨在通过提供端到端的完整训练透明度来解决当前基于LLM的临床决策支持系统的不透明性。MeditronFO变体在医学基准测试中表现出了最先进的性能,超越了其基础模型,并为完全开放的临床LLM树立了新的标杆。
-
MedGemma 多模态医疗 AI 可通过 Ollama 在本地运行
MedGemma 模型是一款专为医疗应用设计的、多模态的 AI,现在可以通过 Ollama 在本地运行。这使得在无需云端处理的情况下,即可解读医学影像并进行医疗对话。设置过程包括下载 Ollama,然后拉取 MedGemma 模型,以实现本地、私密的 AI 驱动的医疗分析。
-
医学视觉语言模型难以处理否定回答,新基准揭示问题
研究人员开发了CXR-ContraBench,这是一个新的基准,旨在评估医学视觉语言模型(VLMs)在胸部X光片分析中正确解释否定陈述方面的性能。该基准突显了一个重大问题,即模型会被否定选项所吸引,导致临床上存在风险的矛盾。虽然MedGemma和Qwen2.5-VL等模型显示出相当高的失败率,但一种名为QCCV-Neg的新方法已证明能够在不重新训练的情况下,确定性地纠正这些极性混淆的子集。