PulseAugur
中
实时 07:50:19
实体 code generation

code generation

PulseAugur coverage of code generation — every cluster mentioning code generation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 16
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. RESEARCH · CL_284267 ·

    新研究探索LLM的高级自蒸馏技术 · 跟踪3个来源

    三篇新研究论文介绍了通过自蒸馏改进大型语言模型(LLM)的先进方法,自蒸馏是指模型从自身的输出来学习的过程。SAPD专注于使用固定的演示和步调一致的指导来增强数学推理能力,其性能优于标准的微调,并与在线策略强化学习保持竞争力。SPECTRUM通过调节光谱几何来保留解决方案的多样性,解决了自蒸馏导致正确解决方案范围变窄的问题,在代码生成基准测试中表现出改进的性能。ReSAIL通过优先考虑信息丰富的交互步骤并保留特权信息来解决迭代自蒸馏中…

  2. RESEARCH · CL_271168 ·

    新的CorrGRPO方法增强了语言模型的多元奖励学习

    研究人员推出了一种名为相关性归一化GRPO(CorrGRPO)的新方法,用于训练具有多个奖励信号的推理语言模型。这种新方法解决了标准组相对策略优化(GRPO)中大规模奖励可能掩盖较小奖励的局限性。CorrGRPO将成对协方差归一化为皮尔逊相关系数,确保不同奖励成分的影响更加均衡。该方法已在0.5B到8B参数的模型上,在代码生成、工具调用和代理安全任务中展现出改进。

  3. RESEARCH · CL_269373 ·

    LLM偏好生成与校准研究显示模型不一致性及改进方法

    近期研究探讨了大型语言模型(LLM)生成偏好的可靠性和校准性。一项研究发现,虽然LLM在偏好上表现出自洽性,但在不同模型和规模之间存在显著的不一致性,表明提示词措辞的影响不如模型选择大。另一篇论文证明,较小的、冻结的模型可以生成比自身生成更有效的“拒绝”样本用于偏好蒸馏,从而降低计算成本。第三项研究引入了基于评分卡的偏好(Rubric-Calibrated Preferences, RCP),以提高LLM在信息检索中判断的质量和跨查询…

  4. TOOL · CL_268252 ·

    新的熵正则化方法改进了可验证任务的AI模型训练

    研究人员发现,在标准交叉熵(CE)训练与在数学推理和代码生成等可验证领域生成正确输出的目标之间存在不匹配。这个问题之所以出现,是因为即使CE训练能够准确模仿专家演示,它也可能无意中为不正确的输出分配更高的概率。为了解决这个问题,提出了一种名为熵正则化交叉熵(ER-CE)的新方法,该方法使用令牌级别的香农熵作为代理来控制策略的支持并防止质量扩散到不支持的输出。在数学推理和代码生成基准上的实验表明,与标准CE相比,ER-CE始终能提高验证器的准确性。

  5. RESEARCH · CL_252081 ·

    新研究推进用于LLM训练的on-policy distillation · 追踪6个来源

    研究人员正在开发用于on-policy distillation (OPD) 的先进技术,这是一种用于改进大型语言模型的方法。$\\gamma$OPD和STRIDE等新方法旨在通过改进时间信用分配方式以及何时停止或重启训练来提高优化稳定性和效率。其他研究探索了无数据蒸馏,即模型生成自己的训练问题,以及SCOPE-OPSD等利用特权子空间改进自蒸馏的方法,这些方法在数学推理和代码生成等领域显示出前景。

  6. TOOL · CL_247644 ·

    新的CS-Guard基准测试显示,LLM防护栏未能阻止恶意代码生成

    一个名为CS-Guard的新基准测试已被开发出来,用于评估大型语言模型(LLM)防护栏在防止生成恶意代码方面的有效性。该基准测试包括超过1000个文本到代码生成的提示和331个代码到代码生成的提示,并结合了越狱攻击和一种新颖的虚构场景攻击。对七个LLM上的九个防护栏进行的实证测试显示出显著的漏洞,文本到代码生成的攻击成功率高达50%,代码到代码生成的攻击成功率接近100%,这引起了对实际软件开发的担忧。

  7. RESEARCH · CL_239265 ·

    RISE 方法通过自外推增强语言模型训练

    研究人员推出了一种新颖的、通过自外推策略蒸馏来改进语言模型训练后性能的方法——RISE。该技术利用模型自身的强化学习轨迹构建一个合成教师,将稀疏的结果诱导更新转化为密集的 token 级目标,无需外部模型。RISE 在人类反馈强化学习 (RLHF) 和 On-Policy Distillation (OPD) 之间形成一个循环,其中结果奖励指导外推,而外推的教师则优化 token 决策。实验表明,RISE 在数学推理、STEM 和代码…

  8. TOOL · CL_228912 ·

    研究揭示合成LLM数据中存在隐蔽偏见注入风险

    一篇新发表在arXiv上的研究论文详细介绍了一种通过合成数据隐蔽地将社会偏见注入大型语言模型(LLM)的方法。研究表明,即使是看似良性的训练文本,也能在保持模型通用能力的同时,成为传播目标偏见的渠道。研究人员提出基于对数线性评分的方法来筛查合成数据中的此类隐藏威胁,突显了当前LLM训练流程中存在的重大安全风险。

  9. COMMENTARY · CL_204948 ·

    AI代码生成将焦点转移到编程语言设计上

    本文探讨了在AI驱动的代码生成时代,评估编程语言标准的演变。随着人工智能越来越多地参与软件开发,定义“好”语言的品质正在发生变化。焦点正从传统指标转向考虑AI系统在给定语言中理解、编写和维护代码的程度,并影响人类开发者的评审流程。

  10. COMMENTARY · CL_195086 ·

    Google 解释为什么 Go 是 AI 辅助软件工程的理想选择 · 跟踪 4 个来源

    Google Developers Blog 发表了一篇详细介绍为什么 Go 编程语言非常适合 AI 辅助软件工程的文章。该帖子强调了 Go 在代码生成和调试等方面的优势,使其成为 AI 在软件开发中工作的开发者的有效工具。文章强调了 Go 对日益整合 AI 的现代软件工程实践的适用性。

  11. COMMENTARY · CL_168345 ·

    RAG 与微调:为您的企业选择正确的 LLM 方法

    在构建 AI 应用程序时,开发人员和企业面临一个关键决策:是使用检索增强生成(RAG)还是微调。RAG 将大型语言模型与外部知识源相结合,使其能够访问最新信息而无需重新训练,从而为动态知识库和企业搜索提供了成本效益。相反,微调涉及在专业数据上进一步训练模型,以赋予其特定的风格、领域专业知识或任务熟练度,尽管更新知识需要重新训练。许多组织通过结合这两种方法来利用各自的优势并取得成功。

  12. RESEARCH · CL_79553 ·

    新方法改进了LLM代码生成的不确定性估计

    研究人员开发了一种新的方法来估计大型语言模型生成的代码的不确定性,解决了静默错误代码带来的风险。该方法在一篇新论文中有所阐述,它认识到代码具有独特的属性,如词法脆弱性、意图-代码差距和可执行性,这些属性与自然语言不同。通过引入三个特定的不确定性轴——词法、算法和功能——该方法与现有的源自自然语言的技术相比,显著提高了不确定性估计的准确性。

  13. RESEARCH · CL_79565 ·

    新方法改进LLM微调以提升性能

    研究人员开发了改进大型语言模型监督微调(SFT)的新方法。一种方法FisherAdapTune利用Fisher信息几何动态选择参数组进行适应,增强了分布内性能和零样本迁移能力。另一组方法,包括Target-SFT和PriFT,将SFT重新解释为目标分布设计。这些技术旨在通过更好地将微调过程与模型的预训练知识对齐,来创建更稳定有效的训练目标,从而在各种推理和代码生成任务上取得最先进的结果。

  14. RESEARCH · CL_50860 ·

    新研究探索用于LLM代码生成的先进强化学习技术

    三篇新研究论文探讨了用于改进大型语言模型(LLM)在代码生成方面能力的先进强化学习技术。其中一篇论文介绍了离线强化学习,以利用现有的代码数据集,显示出对较小LLM和复杂编码问题的特别益处。另一篇提出了一种名为VeRPO的框架,该框架将测试用例中的部分成功转化为密集、可验证的奖励,性能优于现有方法。第三篇论文CoRe-Code,利用了一个具有角色专业化和强化学习的协同多智能体系统来生成更准确、更高效的代码。

  15. RESEARCH · CL_48740 ·

    尽管提示技术先进,AI 生成代码的安全性仍令人担忧

    新研究表明,虽然先进的提示技术可以影响 AI 生成代码中存在的安全漏洞的类型,但它们并不能可靠地减少这些问题的总体数量或严重性。对多种编程语言的多个 LLM 进行的评估研究发现,生成的代码经常包含关键漏洞,例如弱加密和不当的输入验证。虽然一些方法改变了常见漏洞枚举 (CWE) 的分布,但它们并未消除固有风险,这表明仅靠提示工程不足以确保安全的代码生成。

  16. COMMENTARY · CL_35066 ·

    卢德分子计算机科学家质疑AI代码生成方法

    一位有机计算机科学家和自称的卢德分子Anthony认为,梯度上升是优于生成-测试的软件开发方法,尤其是在处理潜在有害结果时。他质疑在敏感软件领域依赖代码生成器和测试,认为这会丢弃可靠的梯度信息。这一观点凸显了对当前AI研究的健全性和其潜在社会影响的担忧。

  17. TOOL · CL_18768 ·

    研究发现,通过率奖励未能提升AI代码生成能力

    一篇新的研究论文探讨了在代码生成任务的强化学习中使用通过率奖励的有效性。研究发现,虽然通过率奖励可以缓解稀疏奖励的问题,但在对照实验中,它们与二元奖励相比并不能持续提高性能。研究人员分析了奖励密度和梯度方向,得出结论认为通过率奖励通常校准不当,难以实现完全正确的进展,并可能导致冲突的优化信号。

  18. RESEARCH · CL_70261 ·

    新研究解决大语言模型的事实准确性、架构推断和专业化评估问题

    研究人员正在开发新方法来提高大语言模型(LLM)的准确性和可靠性。Google Research 推出了 SLED(Self Logits Evolution Decoding)技术,该技术利用 LLM 的所有层来增强事实准确性,而无需额外的微调或外部数据。同时,研究也在探索如何通过限制性 API 访问来推断 LLM 的架构属性,并创建新的基准来评估 LLM 在金融服务和编译器问题解决等专业领域的表现。此外,研究还在调查 LLM 集成…