实体
Recode
Recode
PulseAugur coverage of Recode — every cluster mentioning Recode across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 3 条
-
新研究提出“接地对齐”以实现超越表面行为的大语言模型
一篇新研究论文提出了一个用于大语言模型(LLMs)的“接地对齐”(Grounded Alignment)框架,认为当前的对齐方法过于关注流畅性和安全性等表面行为。这种方法可能导致模型尽管拥有很大的上下文窗口,但在情境上却很脆弱。所提出的框架旨在改进大语言模型处理上下文和构建输出的方式,超越表面对齐,以创建更强大、更具情境意识的AI代理。该研究引入了新的评估方法和技术,如动态控制和退火采样,并可能应用于高风险领域,如成瘾支持。
-
新的Fair-ASR协议重新评估LLM越狱,引入高效ReCode攻击
研究人员推出了一种名为Fair-ASR的新协议,用于评估GPT-5等大型语言模型的越狱攻击。该方法通过使用共享的目标调用预算来标准化比较,解决了先前依赖FLOPs或忽略预算限制的评估方法的局限性。研究发现,传统的攻击方法仍然具有竞争力,并引入了一种新颖、预算高效的ReCode攻击,该攻击在GPT-5上取得了85%的成功率,且攻击者调用次数显著减少。
-
ReCode框架通过奖励推理过程来增强AI代码生成
研究人员开发了ReCode,一个新颖的强化学习框架,旨在通过关注推理过程来改进代码生成。该框架使用对比推理过程奖励学习(CRPL)在合成的推理变体上训练奖励模型,并使用一致性门控GRPO(CG-GRPO)来整合这些奖励,同时通过执行结果缓解奖励攻击。ReCode应用于一个7B模型时,比其基础版本提高了16.1%,并在各种基准测试上取得了与GPT-4-Turbo相当的性能。