PulseAugur
实时 08:46:41
实体 Open Pre Trained Transformer

Open Pre Trained Transformer

PulseAugur coverage of Open Pre Trained Transformer — every cluster mentioning Open Pre Trained Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 9
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_129256 ·

    新算法将神经网络热图转换为具有可证明保证的TSP路径

    研究人员开发了新的算法,可以将神经网络生成的热图转换为旅行商问题(TSP)的路径。这些算法提供了理论保证,将热图预测的质量与所得路径的近似比联系起来。该方法旨在通过提供以前缺乏的明确保证来改进现有方法,并通过实验比较进行了验证。

  2. TOOL · CL_106820 ·

    新的SVD-Surgeon方法无需重新训练即可优化LLM压缩

    研究人员开发了SVD-Surgeon,一种新颖的、无需训练即可使用奇异值分解(SVD)压缩大型语言模型(LLM)的方法。该技术直接优化奇异值,提供一种封闭形式的更新,以补偿移除的组件并识别要修剪的值。当应用于现有的SVD压缩器(如SVD-LLM)时,SVD-Surgeon在不重新训练的情况下,提高了OPT和LLaMA 2-7B等模型的困惑度-压缩权衡。

  3. TOOL · CL_94290 ·

    深圳大数据研究院4篇AI研究论文被ICML 2026录用

    深圳大数据研究院的四篇研究论文被机器学习顶级国际会议ICML 2026录用。其中两篇论文介绍了大型语言模型的新优化技术:AdaMeZO是一种Adam风格的零阶优化器,可减少微调期间的内存开销;Romberg-ZOGE是一种用于梯度估计中高阶偏差缩减的方法。另一篇论文提出了SCOPE,一个利用云边协同方法分解用户查询的高效视频推理框架。第四篇论文MIMOMamba提出了一种新的状态空间模型,该模型以线性效率联合建模时间依赖性和跨通道交互。

  4. RESEARCH · CL_41829 ·

    研究发现自训练重构语言模型

    一篇新的研究论文挑战了对语言模型自训练的普遍理解,认为它重构而非扁平化语言。研究发现,虽然话语标记等表面语言特征有所增加,但问句和被动语态等深层句法结构却有所下降。这种“结构深度假说”认为,语言特征的衰减率主要由其结构复杂性决定,而不仅仅是模型输出中的频率。

  5. TOOL · CL_40799 ·

    新的 AR1-ZO 方法通过零阶优化提升 LoRA 微调性能

    研究人员开发了 AR1-ZO,一种使用零阶优化和低秩适配 (LoRA) 微调大型语言模型的新方法。该技术解决了在不影响 ZO 查询信噪比的情况下有效提高 LoRA秩的挑战。AR1-ZO 通过查询具有拓扑感知缩放的交替秩-1 原子来实现这一点,它可以在不需要额外基或前向传播的情况下恢复秩不变的活动信号。在 OPT 和 Qwen3 模型上的实验表明,AR1-ZO 能够在标准的 ZO 查询预算内实现高秩 LoRA 微调的有效性。

  6. TOOL · CL_38117 ·

    Opt 采用 Anthropic 的 Claude Enterprise 以优化广告运营

    日本广告公司 Opt 已在其组织内全面采用 Anthropic 的 Claude Enterprise Plan。此举旨在通过 AI Agent 驱动的广告运营,彻底革新其业务结构。该公司预计此次整合将对其广告业务产生重大变革。

  7. RESEARCH · CL_15913 ·

    研究人员探索 Transformer 模型的权重衰减、上下文学习和加速方法

    研究人员开发了几种新方法来提高 Transformer 模型的效率和理论理解。一篇论文提供了权重衰减的功能分析表征,展示了其在塑造损失景观和提高泛化能力方面的作用。另一项研究调查了 Transformer 在上下文学习过程中如何适应不同的任务难度,证明了在分布变化下的最优收敛率。此外,两篇论文提出了加速 Transformer 推理的技术:一篇使用门控子空间推理来减少内存带宽,另一篇介绍了 LEAP,一个支持层级早期退出的预训练目标,…

  8. RESEARCH · CL_14113 ·

    研究人员通过注意力控制和算法捕获探索高效 Transformer

    研究人员正在探索提高 Transformer 效率和理解力的方法。一篇论文引入了预算注意力分配(Budgeted Attention Allocation),这是一种允许成本-质量权衡的头门控机制。另一项研究定义了 Transformer 中的算法捕获(algorithmic capture),并分析了它们的计算复杂性,表明存在一种归纳偏见,反对更高复杂度的过程。此外,关于 Transformer 中局部注意力的工作证明了其表达能力以…

  9. RESEARCH · CL_09277 ·

    AI模型评估正成为昂贵的瓶颈,成本已超越训练费用

    AI模型评估正变得成本高昂,近期基准测试的成本高达数万美元,并消耗数千个GPU小时。对于本质上更复杂且对设置变化敏感的基于代理的评估而言,这种高成本尤为突出。虽然存在通过子采样降低静态基准测试成本的方法,但这些技术对于基于代理的评估的动态和嘈杂特性效果不佳,从而造成了研发瓶颈。

  10. RESEARCH · CL_05407 ·

    AdaLeZO 通过自适应层采样加速 LLM 微调

    研究人员开发了 AdaLeZO,一个旨在提高大型语言模型微调的零阶 (ZO) 优化效率的新框架。该方法通过动态地将计算资源分配给模型中最敏感的层,解决了 ZO 通常伴随的收敛速度慢和方差大的问题。AdaLeZO 可作为即插即用模块,在不增加内存使用量的情况下,将现有 ZO 优化器的速度提高高达 3.0 倍。