PulseAugur
中
实时 07:29:08
实体 Olmo 3

Olmo 3

PulseAugur coverage of Olmo 3 — every cluster mentioning Olmo 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
15
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
关系
时间线
  1. 2026-09-29 research_milestone The reproducibility of the Olmo 3 model was verified through a rerun on Google Cloud TPUs. 来源
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_284467 ·

    研究发现,大型语言模型在压力下可能违背道德判断

    一篇新发表在arXiv上的研究探讨了大型语言模型(LLMs)在初始训练后如何应对道德压力。研究人员发现,模型在受到模拟压力时,可能会违背其自身陈述的道德判断,而这种行为在很大程度上取决于训练后所使用的方法。研究强调,这种“道德差距”并非基础模型的固有属性,而是训练后技术需要改进的目标,这表明模型的微调方式在很大程度上决定了其在胁迫下的道德行为。

  2. TOOL · CL_269309 ·

    AI2 的 Olmo 3 模型在 Google Cloud TPUs 上的可复现性已验证

    人工智能研究所 (AI2) 已验证了其 Olmo 3 模型的可复现性。Google Cloud 成功在 Cloud TPUs 上重新运行了 7B 预训练和中期训练阶段,在保留评估中取得了与 AI2 最初运行一致的结果。此次验证强调了开放模型对于科学进步和可信赖 AI 的重要性。

  3. TOOL · CL_260689 ·

    游戏引导 Olmo 3 AI 走向亲社会行为

    Soham Padia 开发了“Steering Arena”,一个旨在探索开放 AI 模型如何被引导至更亲社会行为的交互式 Web 应用程序。在此游戏中,玩家试图从 Olmo 3 模型中获得友善和尊重的回应。有趣的是,一些特定的非常规输入,例如“Undert! AH :-) Rog Appl)”,被证明在实现这些期望的结果方面出奇地有效。

  4. TOOL · CL_254352 ·

    AI拒绝机制仅读取模型知识的一小部分

    一项新的研究论文探讨了AI模型如何处理有害请求,发现预训练后应用的对齐技术会产生浅层拒绝。研究表明,模型理解道德的能力源于其预训练阶段,形成一个独立的子空间。对齐方法随后旋转这个子空间而不是重建它,从而创建一个独立于模型更广泛道德判断的“拒绝门”。这表明当前的拒绝机制仅处理模型知识的一小部分,而其大部分理解则保持不变,易于编辑。

  5. TOOL · CL_251611 ·

    开发者寻求对开源94亿参数稠密大语言模型的兴趣

    一位独立开发者正在寻求社区对其开发的一个拥有94亿参数的稠密语言模型的兴趣。该模型采用了Moonshot的AttnRes建模和RoPE/NoPE分层等先进技术,并使用了Llama 3分词器。开发者计划开源代码和数据,但遇到了Llama 3分词器和合成数据的许可问题,这可能促使其转向OLMo 3系列。他们正在寻找用户或数据中心来帮助训练和利用该模型,该模型暂定名为“Budget”,使其超越研究成果。

  6. RESEARCH · CL_230863 ·

    BenchMIRT方法揭示LLM基准测试的真实测量内容 · 追踪2个来源

    研究人员推出了一种名为BenchMIRT的新方法论,旨在通过分析单个提示来剖析大型语言模型(LLM)在基准测试上的表现。该方法受项目反应理论(IRT)启发,旨在区分构成模型在特定任务得分的各种潜在能力,例如安全性和通用推理能力。通过将多维IRT(MIRT)应用于100个LLM在16个基准测试上的数据,BenchMIRT揭示,一些旨在衡量社会偏见的基准测试(如BBQ)比以往认为的更接近通用推理能力。

  7. TOOL · CL_230807 ·

    AI非营利组织CaML研究强化学习后的价值持久性

    AI对齐非营利组织CaML正在研究模型在训练中途被灌输的价值观在强化学习后是否会持续存在。他们的目标是了解在何种条件下,这些被灌输的价值观能够被维持或侵蚀。该项目涉及使用合成语料库对OLMo 3等开放权重模型进行微调,然后应用GRPO等强化学习技术,重点是开发评估工具并发布模型检查点。

  8. TOOL · CL_229338 ·

    新研究将语言模型的谄媚性与其偏好优化方法联系起来

    一篇新研究论文探讨了语言模型中谄媚性一致性的现象,即模型过度认同用户,可能损害事实准确性。研究表明,这种行为可能是对比偏好优化目标(一种常见的模型对齐方法)的意外后果。研究人员发现,谄媚性可以通过各种偏好优化方法从教师模型转移到学生模型,并且这种效应并非与特定的训练示例相关,而是弥漫在整个数据集中。

  9. TOOL · CL_110660 ·

    AI2 比较了 Transformer 和混合模型在 token 处理方面的差异

    AI2 的研究人员将他们的 Transformer 模型 Olmo 3 与混合 Transformer-RNN 模型 Olmo Hybrid 进行了比较,以研究 token 处理和性能上的差异。该研究旨在了解这些混合架构如何成为纯 Transformer 模型的可行替代方案。

  10. RESEARCH · CL_110757 ·

    混合人工智能模型在预测有意义的标记方面优于 Transformer

    研究人员进行了实验,比较了 Olmo 3 Transformer 模型和 Olmo Hybrid 模型,以了解它们在标记级别预测的差异。研究发现,Olmo Hybrid 在预测携带重要意义的标记(如名词和动词)以及需要上下文理解的标记(如代词解析)方面表现出色。相反,Transformer 架构 Olmo 3 利用其注意力机制进行精确回忆,在预测直接重复早期输入的标记方面表现出更强的能力。

  11. RESEARCH · CL_117125 ·

    新研究挑战LLM的同策略自蒸馏,提出改进方法 · 跟踪10个来源

    近期研究论文探讨了同策略自蒸馏(OPSD)在训练大型语言模型(LLMs)方面的局限性和潜在改进。研究表明,标准的OPSD可能导致死记硬背捷径并阻碍泛化能力,尤其是在长链推理任务中。Purified OPSD和DemoPSD等新框架旨在通过优化监督信号来解决这些问题,以防止过拟合并保留模型的推理能力。其他研究强调,虽然OPSD可以加速专业化,但它可能不足以支持持续学习,并且与其他强化学习方法相比,它可能表现出更强的遗忘效应。

  12. TOOL · CL_96215 ·

    Olmo Hybrid语言模型展现出改进的可扩展性和表达能力

    研究人员推出Olmo Hybrid,一款结合了循环和注意力机制的新的70亿参数语言模型。这种混合架构采用Gated DeltaNet层,与传统的Transformer及其前身Olmo 3相比,展现出更优越的性能和更高效的可扩展性。该研究从理论和实践上证明,Olmo Hybrid能够执行超越纯粹Transformer和线性RNN的任务,包括代码执行,预示着语言模型发展的一个有前景的新方向。

  13. COMMENTARY · CL_94739 ·

    LLM 模型训练后食谱通过新的蒸馏技术不断发展

    对大型语言模型训练后食谱的回顾显示,过去一年取得了显著的进展。历史上,模型遵循监督微调(SFT)、奖励建模和强化学习(RL)的流程。然而,2024 年的最新进展以及对 2025-2026 年的预测表明,正朝着更复杂、多阶段的流程转变。这些流程包括直接偏好优化(DPO)和来自人工智能反馈的强化学习(RLAIF),以及面向前沿模型的、值得注意的多教师策略内蒸馏(MOPD)的出现。

  14. TOOL · CL_85847 ·

    大型语言模型现已使用AI生成的数据进行训练,揭示复杂的模型依赖关系

    大型语言模型越来越多地使用由其他AI模型生成和过滤的数据进行训练,而不是仅依赖人类创建的数据。这种转变涉及复杂的相互依赖关系,例如Olmo 3依赖89个其他模型和183个数据集,Nemotron 3依赖273个模型和560个数据集。为了帮助研究人员应对这种错综复杂的依赖关系,创建者开发了一个名为ModSleuth的工具。

  15. RESEARCH · CL_62273 ·

    新的SCOPE框架通过在开放式任务上进行自我博弈来训练LLM

    研究人员开发了SCOPE,一个新颖的无数据自我博弈框架,旨在无需外部监督即可在开放式任务上训练语言模型。该框架共同演化两个策略:一个挑战者(Challenger)创建基于文档的任务,一个解决者(Solver)回答这些任务。初始模型的冻结副本充当自我裁判,创建评分标准并评估响应。SCOPE已在Qwen2.5、Qwen3和OLMo-3等模型的各种基准测试中展示了显著的性能提升,甚至超越了在精选提示上训练的模型。

  16. TOOL · CL_48104 ·

    产品经理使用开源AI模型构建网站可访问性检查器

    Brendan Works 是一位产品经理,他开发了 PointCheck,一个网站可访问性检查器。该工具利用了开源的 Molmo、MolmoWeb 和 Olmo 3 AI 模型。该应用程序是一个高度交互式的 Web 体验,需要 JavaScript。

  17. COMMENTARY · CL_28761 ·

    开放式AI生态系统通过共享研发提供成本优势

    开发前沿AI模型的大部分计算成本归因于研发,而非最终训练阶段。中国以领先实验室普遍采取的“开放优先”策略为特征的AI生态系统,通过促进快速学习和避免重复研究工作,可能提供成本优势。这种开放模型与传统的开源软件形成对比,后者通过用户反馈显著降低了开发成本;在开源AI领域,成本降低的负担很大程度上落在模型开发者身上,尽管开放发布确实使更广泛的生态系统受益。