实体
Bartolomeo Schedoni
Bartolomeo Schedoni
PulseAugur coverage of Bartolomeo Schedoni — every cluster mentioning Bartolomeo Schedoni across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM 后训练技术通过新的蒸馏和优化方法取得进展
LLM 后训练技术近期取得了进展,重点关注参数高效微调、偏好优化和蒸馏。DIAL-OPD 等新方法在蒸馏中展示了从更少 token 中学习能力的提高,而 LSC-DPO 则为直接偏好优化提供了一种学习信号控制的方法。此外,对 Group Policy Optimization (GRPO) 的研究已识别出故障模式并提出了解决方案,GRPO 也被应用于生产 OCR 任务。
-
新研究使 AI 代理能更有效地学习和管理技能
近期研究探索了提高 AI 代理所用技能的有效性和管理性的方法。论文介绍了诸如 SGUID 用于选择最佳技能子集进行蒸馏,SkillMorph 用于基于执行反馈进行引导式技能演化,以及 SkillGraph 用于将技能表示为有向图以管理依赖关系等技术。其他工作侧重于通过动态场景合成(SkillSandbox)验证技能的可重用性,并理解 GitHub 等平台上共享的代理技能的供应链和安全影响。此外,研究还解决了技能投毒攻击以及在代理框架内…