实体
Jiaming Li
Jiaming Li
PulseAugur coverage of Jiaming Li — every cluster mentioning Jiaming Li across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的 RLVR 框架 PACS 增强了 LLM 的推理能力
研究人员推出 PACS,一个用于可验证奖励强化学习 (RLVR) 的新颖框架,旨在提高大型语言模型 (LLM) 的推理能力。PACS 将 RLVR 重构为一项监督学习任务,使用交叉熵损失优化评分函数,从而固有地恢复稳定的策略梯度更新。实验表明,PACS 在现有开源模型和 RLVR 基线模型上的表现显著优于它们,在 4B 和 8B 模型上分别取得了超过 8% 和 9% 的显著提升。
-
新的FAST训练方法增强了指令模型的稀疏自编码器
研究人员开发了一种名为“微调对齐顺序训练”(FAST)的新训练范式,以改进指令模型的稀疏自编码器(SAE)。传统的阻塞训练方法由于注意力泄露会引入梯度噪声,而FAST通过将SAE训练与指令模型的数据分布和激活模式对齐来解决这个问题。这种方法显著提高了重建保真度和特征可解释性,在Llama-3.2-3B-it等模型上实现了更低的均方误差(MSE)并产生了更高比例的高质量特征。