实体
MedCalc
MedCalc
PulseAugur coverage of MedCalc — every cluster mentioning MedCalc across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的评估方法超越正确性评估生物医学LLM裁判器
研究人员开发了一个新的生物医学大型语言模型(LLM)评估流程,旨在超越简单的正确性来评估其性能,尤其是在人类判断有限的情况下。该流程引入了确定性突变到现有基准测试中,以创建可审计的偏好对。评估侧重于三个关键维度:与指标派生标签的正确性、对采样变化的鲁棒性以及输出格式的合规性。当应用于 Llama 3.1 8B-Instruct 时,研究发现,按顺序使用监督微调(SFT)和强化学习(RL)训练的模型(SFT$ ightarrow$RL)…
-
新的Anchored Learning框架稳定LLM微调,减少灾难性遗忘
研究人员开发了一个名为Anchored Learning的新框架,以减轻大型语言模型在监督微调过程中灾难性遗忘的问题。该方法通过使用动态移动锚点显式控制分布更新,该锚点在当前模型和冻结的参考模型之间进行插值。该方法在理论上保证了模型分布之间的稳定过渡,并在iGSM和MedCalc等基准测试中实证证明了性能下降的显著减少,同时保持了接近最优的收益。