实体
Jiacheng Wang
Jiacheng Wang
PulseAugur coverage of Jiacheng Wang — every cluster mentioning Jiacheng Wang across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
RL代理重写LLM训练数据以提高SFT稳定性
研究人员开发了一种新颖的强化学习(RL)代理,旨在改进大型语言模型(LLM)的监督微调(SFT)。该代理使用LoRA进行训练,旨在通过重写训练数据以减少分布不匹配来缓解灾难性遗忘。该方法在保持任务一致性的同时,优化了分布对齐和语义多样性,从而在各种骨干模型上实现了与标准SFT相当的下游性能,但非下游任务的性能下降减少。初步证据表明,这种重写策略可以跨不同领域为同一模型重复使用。
-
新的HINTBench基准评估AI代理的内在安全风险
研究人员推出HINTBench,一个旨在评估AI代理内在安全风险的新基准。与以往关注外部威胁的评估不同,HINTBench解决了在良性条件下,由于潜在故障在长执行过程中传播,AI代理可能进入不安全轨迹的问题。该基准包含596个代理轨迹,分为合成和重建的风险及安全场景,并支持风险检测、定位和故障类型识别等任务。