Triage
PulseAugur coverage of Triage — every cluster mentioning Triage across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的TRIAGE框架以更少标记数据提升OCT分类准确性
研究人员开发了TRIAGE,一个新颖的半监督框架,旨在提高视网膜光学相干断层扫描(OCT)分类的准确性。该方法通过采用具有不对称成本矩阵的风险控制方法来解决标记数据不足的挑战,该矩阵考虑了不同类型的分类错误。TRIAGE集成了分层分类器、患者分组的保形风险控制器以及用于跨切片验证的Transformer教师。该框架已展示出显著的性能提升,在标记数据最少的情况下实现了高准确率和AUC分数,并且优于现有的半监督方法,特别是在降低低估率方面。
-
开发者被敦促对 AI 系统提示词进行版本控制,以实现更好的日志记录和调试
开发者常常忽视系统提示词在 AI 应用中的关键作用,将其视为简单的文本字符串而没有进行适当的版本控制。这可能导致 AI 行为发生不易察觉且未被记录的变更,难以追溯其根源。作者提出了一种结构化方法,使用版本化的提示词对象,包括唯一的 ID 和版本号,以确保每次 AI 交互都被记录并附带相应的提示词。这种方法可以实现更好的调试、审计,并通过将提示词验证集成到构建过程中来防止静默回归。
-
研究发现:大型语言模型尚不能安全用于自主临床分诊
一篇新论文认为,尽管大型语言模型(LLMs)可以通过医学执业考试并协助完成临床任务,但它们尚不能安全地用于自主患者分诊。核心问题不在于缺乏医学知识,而在于模型在不确定情况下安全收集信息以及识别关键的、可能被忽略的诊断的能力不足。为预测可能文本而优化的LLMs可能无法表现出安全分诊所必需的行为,例如扩大鉴别诊断范围、寻找危险信号以及在排除高风险诊断之前升级担忧。
-
TRIAGE 框架增强了 Graph-RAG 系统的可信度
研究人员推出 TRIAGE,一个旨在评估和确保用于基于图的检索增强生成 (Graph-RAG) 系统的知识图谱可信度的新框架。该框架通过为知识图谱的实现、验证和使用提供特定阶段的指标,解决了自动生成的知识图谱的挑战。TRIAGE 旨在定位 Graph-RAG 管道中的故障,从而能够针对提取、图构建或检索中的问题进行有针对性的补救。
-
新的大型语言模型框架TRIAGE通过辩证推理增强医疗风险预测
研究人员开发了一个名为TRIAGE的新框架,利用大型语言模型来改进医疗时间序列数据的风险预测。TRIAGE通过训练大型语言模型生成辩证推理来解决其过度自信地预测二元结果的问题,从而引发特定结果的合理性解释。这种方法可以提高风险评分的校准度,并提高解释中临床推理的质量,在多个基准测试中优于现有方法。
-
新的大型语言模型框架TRIAGE通过辩证推理改进医疗风险预测
研究人员开发了一个名为TRIAGE的新框架,利用大型语言模型进行风险预测,以增强临床预警系统。TRIAGE训练大型语言模型生成辩证推理,权衡相互竞争的临床结果,以产生更校准和可解释的连续风险评分。这种方法解决了大型语言模型中常见的风险两极分化问题,即分级风险被压缩为过于自信的二元预测。在医疗时间序列基准测试上的评估显示,TRIAGE将平均AUPRC提高了3.3%,并将校准误差降低了81%,人类评估认为其推理质量比基线事后解释提高了20%。
-
新论文显示,大语言模型在规划和承认无知方面存在不足
两篇新论文评估了大语言模型的元认知能力,特别是它们的规划和弃权能力。TRIAGE 论文发现,大多数前沿和开源大语言模型在没有反馈的情况下,在规划问题解决序列和分配 token 预算的任务上表现不佳,而经过推理训练的模型表现不如标准模型。AbstentionBench 显示,当前的大语言模型难以识别不可回答的问题,并且推理微调会损害它们弃权的能力,因为强化学习方法缺乏直接的“我不知道”梯度。
-
新研究探究大型语言模型的元认知和策略性任务管理
两篇新研究论文引入了评估大型语言模型元认知能力的框架。第一篇,TRIAGE,评估大型语言模型在资源受限的情况下策略性地选择和排序任务的能力,揭示了当前模型在前瞻性控制方面存在显著差距。第二篇,《元认知探针》,提供了一种诊断工具,将大型语言模型的置信度行为分解为五个不同的维度,强调标准基准未能捕捉模型对其自身错误的自我认知。