PulseAugur
实时 09:31:04

新的预训练方法提高了代码表示模型的鲁棒性

研究人员推出了一种名为不变预训练(Invariant Pretraining, InvPT)的新方法,以增强基于编码器的代码表示模型的鲁棒性。这些模型常用于代码克隆检测和代码分类等任务,但在面对语法形式不同但语义等价的代码时,其性能往往会下降。InvPT 通过采用一种仅代码的持续预训练策略来解决这一问题,该策略结合了掩码语言建模和多正例监督对比学习。这种方法将同一函数的所有语法变体视为正例,在特定任务上将鲁棒性提高了多达 19 个百分点,同时保持或提高了标准准确性。 AI

影响 增强了代码分析工具的可靠性,可能提高开发人员的生产力和代码安全性。

排序理由 该集群包含一篇研究论文,详细介绍了一种改进代码表示的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的预训练方法提高了代码表示模型的鲁棒性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo, Zili Wang, Hao Chen ·

    Invariant Pretraining for Robust Code Representations

    arXiv:2608.15412v1 Announce Type: cross Abstract: Encoder-based code representation models remain widely deployed for discriminative tasks such as clone detection and code classification, where their small size and low inference cost are decisive. Their robustness, however, is fr…