PulseAugur
实时 00:54:31
实体 Ouyang et al.

Ouyang et al.

PulseAugur coverage of Ouyang et al. — every cluster mentioning Ouyang et al. across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_188639 ·

    LLM 中的灾难性遗忘:微调如何侵蚀能力

    微调大型语言模型可能导致灾难性遗忘,即模型在针对新目标进行优化时会丢失先前获得的能力。这种现象源于梯度下降,会导致模型的输出分布向微调数据的特征坍塌。研究人员在 InstructGPT 等模型中发现了这个问题,并探索了诸如混合预训练梯度或惩罚重要参数更改等缓解措施,尽管量化遗忘的确切程度仍然具有挑战性,需要针对特定任务进行评估。

  2. COMMENTARY · CL_92899 ·

    AI对齐:RLHF、DPO、IPO和KTO的权衡分析

    AI模型对齐方法的选择——RLHF、DPO、IPO或KTO——会显著影响项目时间表和资源分配。RLHF是一个多阶段过程,涉及奖励模型和PPO,计算量大且可能不稳定。DPO通过使用偏好数据直接优化策略模型,简化了这一过程,无需单独的奖励模型。IPO提供了一种比DPO更稳定的替代方案,并包含一个正则化项,而KTO适用于配对比较数据有限的场景。