PulseAugur
中
实时 01:08:59
实体 Open Pre Trained Transformer

Open Pre Trained Transformer

PulseAugur coverage of Open Pre Trained Transformer — every cluster mentioning Open Pre Trained Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
时间线
  1. 2026-10-07 regulatory The Department of Homeland Security proposed a $70,000 fee for international students participating in the OPT program. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. RESEARCH · CL_286249 ·

    特朗普政府提议对国际学生工作计划征收7万美元费用

    特朗普政府已提议对参加选择性实践培训(OPT)计划的国际学生征收高达7万美元的费用,该计划允许他们在毕业后在美国工作。这项旨在遏制欺诈和滥用行为的拟议规则将要求学校为每位学生的首次OPT申请支付费用,并为续签支付较小费用。教育和商业团体担心此举将阻碍国际学生,对美国的创新、经济增长和劳动力发展,尤其是在STEM领域产生负面影响。

  2. TOOL · CL_244779 ·

    加州大学伯克利分校研究人员为Transformer开发基于Bandit的剪枝方法

    加州大学伯克利分校的研究人员开发了一种新颖的方法来剪枝大型Transformer模型,包括用于视觉和语言任务的模型。该技术被构建为一个损伤感知的多臂老虎机(multi-armed bandit)问题,旨在识别并移除Transformer内的完整功能单元,同时将性能下降降至最低。该方法通过掩码注意力头(attention heads)和MLP通道组来衡量它们对模型损失的影响,然后使用Thompson sampling等采样策略依次选择要…

  3. TOOL · CL_129256 ·

    新算法将神经网络热图转换为具有可证明保证的TSP路径

    研究人员开发了新的算法,可以将神经网络生成的热图转换为旅行商问题(TSP)的路径。这些算法提供了理论保证,将热图预测的质量与所得路径的近似比联系起来。该方法旨在通过提供以前缺乏的明确保证来改进现有方法,并通过实验比较进行了验证。

  4. TOOL · CL_106820 ·

    新的SVD-Surgeon方法无需重新训练即可优化LLM压缩

    研究人员开发了SVD-Surgeon,一种新颖的、无需训练即可使用奇异值分解(SVD)压缩大型语言模型(LLM)的方法。该技术直接优化奇异值,提供一种封闭形式的更新,以补偿移除的组件并识别要修剪的值。当应用于现有的SVD压缩器(如SVD-LLM)时,SVD-Surgeon在不重新训练的情况下,提高了OPT和LLaMA 2-7B等模型的困惑度-压缩权衡。

  5. TOOL · CL_94290 ·

    深圳大数据研究院4篇AI研究论文被ICML 2026录用

    深圳大数据研究院的四篇研究论文被机器学习顶级国际会议ICML 2026录用。其中两篇论文介绍了大型语言模型的新优化技术:AdaMeZO是一种Adam风格的零阶优化器,可减少微调期间的内存开销;Romberg-ZOGE是一种用于梯度估计中高阶偏差缩减的方法。另一篇论文提出了SCOPE,一个利用云边协同方法分解用户查询的高效视频推理框架。第四篇论文MIMOMamba提出了一种新的状态空间模型,该模型以线性效率联合建模时间依赖性和跨通道交互。

  6. RESEARCH · CL_41829 ·

    研究发现自训练重构语言模型

    一篇新的研究论文挑战了对语言模型自训练的普遍理解,认为它重构而非扁平化语言。研究发现,虽然话语标记等表面语言特征有所增加,但问句和被动语态等深层句法结构却有所下降。这种“结构深度假说”认为,语言特征的衰减率主要由其结构复杂性决定,而不仅仅是模型输出中的频率。

  7. TOOL · CL_40799 ·

    新的 AR1-ZO 方法通过零阶优化提升 LoRA 微调性能

    研究人员开发了 AR1-ZO,一种使用零阶优化和低秩适配 (LoRA) 微调大型语言模型的新方法。该技术解决了在不影响 ZO 查询信噪比的情况下有效提高 LoRA秩的挑战。AR1-ZO 通过查询具有拓扑感知缩放的交替秩-1 原子来实现这一点,它可以在不需要额外基或前向传播的情况下恢复秩不变的活动信号。在 OPT 和 Qwen3 模型上的实验表明,AR1-ZO 能够在标准的 ZO 查询预算内实现高秩 LoRA 微调的有效性。

  8. TOOL · CL_38117 ·

    Opt 采用 Anthropic 的 Claude Enterprise 以优化广告运营

    日本广告公司 Opt 已在其组织内全面采用 Anthropic 的 Claude Enterprise Plan。此举旨在通过 AI Agent 驱动的广告运营,彻底革新其业务结构。该公司预计此次整合将对其广告业务产生重大变革。

  9. RESEARCH · CL_15913 ·

    研究人员探索 Transformer 模型的权重衰减、上下文学习和加速方法

    研究人员开发了几种新方法来提高 Transformer 模型的效率和理论理解。一篇论文提供了权重衰减的功能分析表征,展示了其在塑造损失景观和提高泛化能力方面的作用。另一项研究调查了 Transformer 在上下文学习过程中如何适应不同的任务难度,证明了在分布变化下的最优收敛率。此外,两篇论文提出了加速 Transformer 推理的技术:一篇使用门控子空间推理来减少内存带宽,另一篇介绍了 LEAP,一个支持层级早期退出的预训练目标,…

  10. RESEARCH · CL_14113 ·

    研究人员通过注意力控制和算法捕获探索高效 Transformer

    研究人员正在探索提高 Transformer 效率和理解力的方法。一篇论文引入了预算注意力分配(Budgeted Attention Allocation),这是一种允许成本-质量权衡的头门控机制。另一项研究定义了 Transformer 中的算法捕获(algorithmic capture),并分析了它们的计算复杂性,表明存在一种归纳偏见,反对更高复杂度的过程。此外,关于 Transformer 中局部注意力的工作证明了其表达能力以…

  11. RESEARCH · CL_09277 ·

    AI模型评估正成为昂贵的瓶颈,成本已超越训练费用

    AI模型评估正变得成本高昂,近期基准测试的成本高达数万美元,并消耗数千个GPU小时。对于本质上更复杂且对设置变化敏感的基于代理的评估而言,这种高成本尤为突出。虽然存在通过子采样降低静态基准测试成本的方法,但这些技术对于基于代理的评估的动态和嘈杂特性效果不佳,从而造成了研发瓶颈。

  12. RESEARCH · CL_05407 ·

    AdaLeZO 通过自适应层采样加速 LLM 微调

    研究人员开发了 AdaLeZO,一个旨在提高大型语言模型微调的零阶 (ZO) 优化效率的新框架。该方法通过动态地将计算资源分配给模型中最敏感的层,解决了 ZO 通常伴随的收敛速度慢和方差大的问题。AdaLeZO 可作为即插即用模块,在不增加内存使用量的情况下,将现有 ZO 优化器的速度提高高达 3.0 倍。