PulseAugur
实时 00:39:15
实体 importance sampling

importance sampling

PulseAugur coverage of importance sampling — every cluster mentioning importance sampling across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_154639 ·

    新框架以统计严谨性改进了人工智能驱动的图像分析

    研究人员开发了一种用于大规模图像集合中多目标估计的新框架,解决了计算机视觉模型引入的偏差。该方法结合了模型预测和有限的人工标注,以提供统计上严谨的科学测量。在各种数据集上的评估表明,在不同的标注预算和目标数量下,诸如重要性采样和带控制变量的均匀采样等不同的采样策略表现最佳。

  2. RESEARCH · CL_147428 ·

    新的Kernel-WIS估计器改进了上下文老虎机中的离策略评估

    研究人员推出了一种用于上下文老虎机中离策略评估的新估计器Kernel-WIS。该方法利用离线数据,并且设计为渐近一致的。Kernel-WIS旨在通过结合标准加权重要性采样和标准重要性采样的特性,尤其是在行为策略错误指定的情况下,优于现有基线。

  3. RESEARCH · CL_133588 ·

    新的UP目标通过平衡探索与稳定性来增强LLM推理能力

    研究人员推出了一种名为“无界正向非对称优化”(Unbounded Positive Asymmetric Optimization, UP)的新型目标函数,旨在改进大型语言模型(LLMs)的强化学习(RL)。UP通过允许正向优势的梯度无限制,从而增强探索,同时保持对负向优势的梯度裁剪,以防止训练不稳定,从而解决了当前RL框架中固有的探索-稳定性困境。这种即插即用的目标函数已在各种RL算法、模型架构和训练模式中展现出提高推理准确性的能力。

  4. RESEARCH · CL_128503 ·

    新的选择性重要性采样方法改进了 LLM 对齐

    研究人员推出了一种名为选择性重要性采样 (SIS) 的新型即插即用方法,旨在改进大型语言模型 (LLM) 在强化学习后训练期间的对齐。该方法通过将接受的令牌视为同策略来解决离策略训练数据的问题,从而简化了重要性校正过程。SIS 在理论上被证明可以减小梯度估计器差距,并且计算开销极小,使其能够与各种 RL 后训练算法兼容。实验表明,SIS 在不同 LLM 架构和基准测试中始终能改进目标并增强鲁棒性。

  5. TOOL · CL_94185 ·

    论文回顾了蒙特卡洛重要性采样中的最优性

    本文全面回顾了重要性采样技术中的最优性,这是蒙特卡洛采样方法性能的关键组成部分。它探讨了设计自适应提议密度的各种框架,包括用于模型选择的边际似然近似、多个提议密度的使用以及一系列温度后验。该调查还深入研究了在近似贝叶斯计算和强化学习等嘈杂场景中的应用,并提供了理论和经验比较。

  6. RESEARCH · CL_55997 ·

    新研究推进机器学习的策略外评估技术

    两篇新研究论文探讨了机器学习中策略外评估(OPE)的高级技术,这是一个使用现有数据评估新策略性能的关键过程。第一篇论文引入了“Quotient DAGs”,用于处理奖励仅取决于无序项目集但生成过程是有序的情况,从而减少了干扰方差。第二篇论文“CANDOR”提出了一种双重稳健的OPE估计器,通过将注释纳入奖励模型组件,有效地利用了不完美的专家标注反事实样本,尤其适用于医疗保健应用。

  7. TOOL · CL_25629 ·

    新的DR-IS方法提高了机器学习在对抗性标签损坏方面的鲁棒性

    研究人员开发了一种名为不一致正则化重要性采样(DR-IS)的新型子采样方法,以提高机器学习在对抗性标签损坏方面的鲁棒性。该方法利用独立代理集成中损失排序的不一致性来识别和降低损坏数据点的权重。DR-IS在样本集中性和污染界限方面提供了理论保证,并在目标攻击下,实证上优于基于幅度的EL2N等方法。