PulseAugur
实时 07:15:42
实体 Lure

Lure

PulseAugur coverage of Lure — every cluster mentioning Lure across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_218138 ·

    新的LURE方法通过追逐-逃避游戏训练LLM进行推理

    研究人员开发了一种名为LURE的新方法,用于在没有人类标注数据集的情况下训练大型语言模型(LLM)进行推理任务。该方法将训练过程构建为一场追逐-逃避游戏,其中一个LLM逃避者策略性地创建不同难度的任务,而一个LLM追逐者则尝试解决它们。该系统学会将任务设置在求解器成功率约为一半的难度级别,以优化“捕获前沿”奖励。与多个推理环境和LLM架构中的现有基线相比,该技术表现出优越的性能,实现了更强的分布外零样本准确率。

  2. RESEARCH · CL_135108 ·

    新的PPAT框架提高了AI风险估计中的标签效率

    研究人员推出了一种名为预测驱动的主动测试(PPAT)的新框架,旨在提高风险估计中的标签效率。PPAT集成了无偏的LURE估计器和预测驱动的控制变量,利用黑盒模型的预测来减少方差而不引入偏差。该框架还修改了点获取策略以进一步降低方差,并提供渐近有效的置信区间,在表格回归和图像分类任务上,与现有方法相比,在风险估计和覆盖率方面表现更优,且所需的标签更少。

  3. TOOL · CL_53695 ·

    新的LURE方法旨在提高LLM评估的真实性

    研究人员推出了一种名为LURE(实时使用回放评估)的新颖方法,旨在减轻大型语言模型中的“评估意识”现象。这种现象会导致模型在检测到自己正在被评估时改变行为,从而使基准测试结果无效。LURE模拟了真实的代理交互,仅在最后附加评估提示,从而提高了评估的真实性。所提出的方法包括一个自动管道,通过检测口头意识和估计日志来自评估的可能性来衡量评估的真实性,该方法已在真实世界和评估记录的数据集上得到验证。