Yifan Zhang
PulseAugur coverage of Yifan Zhang — every cluster mentioning Yifan Zhang across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Deep Delta Learning 为 Transformer 引入了定向残差更新
研究人员引入了一种新颖的结构化残差更新方法——Deep Delta Learning (DDL),用于 Transformer 模型。DDL 通过在每一层内显式参数化读取、比较和替换操作,实现了对残差状态的定向编辑。这种方法在保留身份路径的同时,允许对残差流进行精确修改,与标准的加性残差方法相比,有望提高语言建模质量和下游性能。
-
SynthFix框架增强了自动化代码漏洞修复
研究人员开发了SynthFix,一个新颖的神经符号框架,旨在改进代码漏洞的自动化修复。该系统集成了监督微调和编译器反馈,使其能够为不同的代码问题选择最有效的修复策略。SynthFix在多个代码LLM和数据集上展示了功能正确性和安全性方面的显著改进。
-
新的EyeMulator方法通过模仿人类视觉注意力来增强代码语言模型
研究人员开发了EyeMulator,这是一种旨在提高代码语言模型(CodeLLMs)性能的新颖方法。该技术将人类视觉注意力的先验知识注入微调过程,而无需对模型进行架构更改。通过将眼动追踪数据提炼为语义显著性和注视转移信息,EyeMulator重新加权了token级别的训练损失,从而在各种CodeLLM骨干模型和任务中提高了性能,尤其是在结构保持的代码补全和翻译方面。
-
离散 Transformer 从模型权重中提取算法
研究人员开发了一种“离散 Transformer”架构,旨在从训练好的模型中提取可解释的算法。这种方法解决了标准 Transformer 中表示纠缠的挑战,在标准 Transformer 中,重叠的特征会阻碍符号表达式的恢复。通过温度退火采样引入离散性,离散 Transformer 促进了人类可读程序的合成,在离散任务上的性能与现有方法相当,并将提取能力扩展到具有连续中间计算的任务。该架构还提供了对合成程序的细粒度控制,为算法提取和 …
-
新基准测试大语言模型在有机化学推理能力
研究人员推出 oMeBench,一个旨在评估大型语言模型有机机理推理能力的新基准。该基准包含超过 10,000 个带注释的机理步骤和一个名为 oMeS 的动态评估框架,用于进行细粒度评分。初步分析显示,尽管当前的大语言模型表现出一定的化学直觉,但它们在一致的多步推理方面存在困难,尽管在该数据集上进行微调可显著提高性能。