PulseAugur
中
实时 21:27:50
实体 Camille Pissarro

Camille Pissarro

PulseAugur coverage of Camille Pissarro — every cluster mentioning Camille Pissarro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_286918 ·

    参数高效微调方法:一项比较研究

    一篇新的arXiv论文研究了参数高效微调(PEFT)方法,比较了包括LoRA系列方法和DoRA在内的六种技术。研究发现,虽然谱保持通常被认为是关键优势,但许多PEFT方法已经近似了这一点,显式的几何保持可能并非严格必需。研究突出了不同方法在适应性和保留性之间的明显权衡,其中LoRA显示出良好的平衡,DoRA取得了更高的分数,而PiSSA则带来了更大的保留成本。干预措施表明,对主导谱分量的修改对于降低通用文本困惑度和基础图像漂移最为有效。

  2. RESEARCH · CL_272315 ·

    梵高和塞尚的杰作领衔4.5亿美元艺术品拍卖

    苏富比将拍卖一批总估价近4.5亿美元的重要印象派和后印象派艺术品收藏。该收藏由已故阿根廷收藏家 Nelly Arrieta de Blaquier 和 Carlos Pedro Blaquier 积攒而成,其中包括文森特·梵高和保罗·塞尚备受期待的作品,这些作品已有五十年未公开露面。预计此次拍卖将吸引全球富裕收藏家和机构的关注,他们在经济不确定时期寻求在成熟的杰作中获得安全感。

  3. TOOL · CL_206259 ·

    新的LoRA-CRAFT方法大幅减少微调参数

    研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。

  4. TOOL · CL_128568 ·

    新CORA方法将LLM微调参数减少4倍

    研究人员推出了一种新颖的参数高效微调方法,用于大型语言模型,名为CORA(相干正交旋转适应)。CORA利用奇异值分解(SVD)来保留预训练权值内的几何关系,对每个切片的左奇异基和右奇异基应用共享的正交旋转。与LoRA等方法相比,该方法显著减少了可训练参数,在相同秩下使用的参数量约减少4倍。实验表明,CORA在常识推理和代码生成任务中优于现有方法,同时保持了参数数量的大幅减少。

  5. RESEARCH · CL_119543 ·

    新的正交初始化方法提高了RLVR训练稳定性

    研究人员开发了一种新的方法,用于在具有可验证奖励的强化学习(RLVR)中初始化低秩适应(LoRA)矩阵。这种称为几何保持正交初始化(geometry-preserving orthonormal initialization)的方法旨在与标准LoRA以及PiSSA和MiLoRA等其他变体相比,提高训练稳定性和性能,这些变体在RLVR设置中可能表现不佳或不稳定。所提出的方法导致了新的RLPO和RLMO变体,得到了理论分析的支持,并通过在…

  6. TOOL · CL_117531 ·

    CAMI框架通过成本感知型多索引优化RAG管道

    研究人员开发了CAMI(成本感知型代理引导的多索引),一个旨在优化检索增强生成(RAG)管道的语义丰富索引创建过程的新框架。该框架解决了由丰富类型和生成器模型的组合性质引起的计算瓶颈。CAMI将索引构建形式化为一个有预算的多目标投资组合选择问题,能够在严格的预算限制下有效识别高召回率的投资组合。评估表明,与仅基于内容的基线相比,CAMI的recall@10可以提高高达9.4%,并且比随机搜索方法使用的预算少5倍,使其在生产环境中具有实用性。

  7. RESEARCH · CL_112642 ·

    AI对齐研究通过新技术解决奖励函数被滥用问题

    研究人员正在探索防止AI模型利用奖励函数(即奖励函数被滥用)的各种方法。一种方法是使用转向向量来指导梯度路由,旨在隔离不良行为。虽然这种方法通过抑制了相当一部分奖励函数被滥用现象显示出希望,但它尚未像依赖显式标签的技术那样有效。另一项进展是创建了“rewardspy”,这是一个旨在在强化学习训练期间监控和检测奖励函数被滥用迹象的库,有助于区分真正的策略改进和对奖励函数的利用。