研究人员开发了一种用于自动启发式设计(AHD)的大型语言模型(LLM)在线后训练新方法。该方法在一个新论文中详细介绍,侧重于从程序有效性和性能分数构建上下文相关的学习信号来更新LLM生成器。与之前保持生成器冻结的方法不同,该技术允许模型从评估的候选者那里学习,旨在提高有用启发式的生成。 AI
影响 这项新的后训练技术可以提高LLM在为各种任务生成复杂启发式方面的效率和有效性。
排序理由 该集群包含一篇详细介绍LLM训练新方法的 ist 研究论文。
- alphaXiv
- Calm
- CatalyzeX Code Finder for Papers
- Co-Evolution of Algorithms and Language Model
- DagsHub
- EvoTune
- Gotit.pub
- Hugging Face
- large language model
- open-weight LLMs
- Reinforcement Learning with Verifiable Rewards
- RLVR
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →