研究人员开发了ALTAS,一种用于提高大型语言模型(LLM)在临床问答中可靠性的新方法。ALTAS利用一个轨迹门控路由器,通过分析单次前向传播的终端熵和晚期线性度来决定是否对模型的输出进行校正。该方法在真实性基准测试上显著提高了准确性,将各种模型尺寸的TruthfulQA提高了10个百分点以上,同时在临床选择题数据集上的表现误差范围很小。 AI
影响 增强了LLM在临床问答等关键应用中的安全性和可靠性。
排序理由 该集群包含一篇详细介绍LLM可靠性新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- ALTAS
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- MedHallu
- MedQA
- PubMedQA
- ScienceCast
- TruthfulQA
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →