PulseAugur
中
实时 13:54:36
实体 Mohamad Amin Mohamadi

Mohamad Amin Mohamadi

PulseAugur coverage of Mohamad Amin Mohamadi — every cluster mentioning Mohamad Amin Mohamadi across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_284757 ·

    新的训练方法教会LLM在不确定时弃权

    研究人员开发了一种名为强化犹豫(RH)的新训练方法,通过教会语言模型在不确定时放弃回答,使其更加值得信赖。与奖励任何回答的传统方法不同,RH使用三元奖励,对错误回答的惩罚比弃权更严重。在逻辑谜题、医学问题和高等数学问题上的实验表明,RH能有效训练模型校准其诚实度,不同的惩罚级别可以产生针对不同风险容忍度的优化模型。该研究还引入了级联和自级联等推理策略,利用弃权作为协调信号,以更低的计算成本优于多数投票。