Olmo
PulseAugur coverage of Olmo — every cluster mentioning Olmo across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
LLM 后训练技术通过新的蒸馏和优化方法取得进展
LLM 后训练技术近期取得了进展,重点关注参数高效微调、偏好优化和蒸馏。DIAL-OPD 等新方法在蒸馏中展示了从更少 token 中学习能力的提高,而 LSC-DPO 则为直接偏好优化提供了一种学习信号控制的方法。此外,对 Group Policy Optimization (GRPO) 的研究已识别出故障模式并提出了解决方案,GRPO 也被应用于生产 OCR 任务。
-
AI2 在 COLM2026 讨论代理模型和 Olmo
人工智能研究所 (AI2) 在 COLM2026 会议上讨论代理模型的进展和即将推出的 Olmo 版本。AI2 传播主管 Kyle Wiggers 正在采访自然语言处理高级总监 Noah Smith,讨论这些话题。与会者可以前往 AI2 的 302 号展位。
-
Bluesky AI关于字节级语言模型的研究被Nature录用
一篇详细介绍语言模型字节级操作改造方法的论文(即Bolmo)已被Nature录用发表。同时,还将发布新的检查点,将这种字节级操作技术扩展到Qwen和Llama模型。
-
艾伦人工智能研究所(Allen Institute for AI)正在招聘代理框架、Olmo 和 Molmo 的工程师
艾伦人工智能研究所(AI2)正在积极招聘多个职位,特别强调与代理框架及其 Olmo 和 Molmo 项目相关的职位。该研究所正在为代理框架招聘一名高级软件工程师,并为 Olmo + Molmo 招聘一名高级研究工程师。这些职位是 AI2 在人工智能开发方面持续努力的一部分。
-
新研究衡量 Token 计算成本,揭示优化潜力
一篇新的研究论文提出了一种混合代理(Mixture-of-Agents, MoA)方法来衡量大型语言模型生成单个 Token 的实际计算成本。研究发现,很大一部分计算成本集中在一小部分 Token 上,这表明当前模型可以进行优化。通过使用这种 MoA 导出的映射,模型路由和草稿技术可以在保持或提高准确性的同时,减少延迟和 Token 使用量。
-
新的SURGE技术无需额外训练即可增强RL模型
研究人员开发了一种名为SURGE(Scaling Up RL Gradient-free via Eigenspace fusion)的新技术,可以在不增加额外训练时间或推理计算的情况下,提高现有强化学习(RL)模型的性能。SURGE结合了同一RL训练历史中的两个检查点,生成了一个优于两个原始检查点的新策略。该方法在数学推理和编码基准测试中均显示出改进,证明了存储的RL历史是扩展模型能力的宝贵资源。
-
AI2 发布 Olmo-core 3 开源 MoE 训练基础设施
艾伦人工智能研究所(AI2)发布了 Olmo-core 3,这是一个专为大型混合专家(MoE)模型设计的开源训练基础设施。该系统是未来 Olmo 模型开发的基础,能够扩展到万亿参数规模。此次发布包括该基础设施的 GitHub 存储库。
-
Hugging Face 发布 Olmo-core 3,用于可扩展的万亿参数 MoE 训练
Hugging Face 发布了 Olmo-core 3,这是一个开源框架,旨在将专家混合(MoE)大语言模型的训练扩展到万亿参数规模。该新系统通过优化专家路由和跨 GPU 分布,解决了训练大型 MoE 所面临的计算效率低下和高成本问题。基准测试表明,Olmo-core 3 显著提高了训练吞吐量,与之前的实现相比,性能最高可提高 2.7 倍,同时即使在拥有大量专家的情况下也能保持计算效率。
-
开发者发布新型20亿参数AI模型'Engram',采用新颖的token概率表
一位开发者创建了一个名为Engram的20亿参数新模型,该模型利用了一个10亿参数的Engram表来增强token概率。尽管仅在1500万token上进行训练,该模型却展现出惊人的连贯性,避免了早期模型常见的重复问题。这位开发者曾在Anthropic从事机器学习和红队工作,他计划以Apache 2.0许可证发布该模型供社区使用,并指出其可在24GB显存上进行训练。
-
新研究表明AI模型能力涌现可被预测
arXiv上发表的一篇新研究论文详细介绍了一种预测Transformer模型中能力涌现的方法。研究表明,前一token头的形成时间可以高精度、显著提前地预测归纳头的涌现,且该方法适用于各种模型配置。该预测方法通过对未见配置的盲预注册门控进行了验证,并成功区分了实际涌现的能力和被阻止运行中的误报。
-
小规模LLM中的提示回声与归纳头相关,而非仅仅数据泄露
研究人员调查了小规模指令遵循语言模型中提示回声的现象。他们分析了Gemma、Llama、Qwen、SmolLM和OLMo等多个系列的模型,以了解这种故障模式是表明训练数据泄露还是对齐不当的复制机制。研究发现,虽然回声提示可能与训练数据集部分重叠,但主要驱动因素似乎是模型的内部归纳头。
-
Mind2Dialogue框架训练AI理解用户心理状态
研究人员推出Mind2Dialogue,一个旨在通过模拟用户心理状态来训练语言模型使其更具人类意识的新颖框架。该方法通过使用受心理学启发的模拟器生成基于用户未言明的信念和目标的对话,解决了当前数据集中显式监督有限的挑战。该框架的特权蒸馏方法训练模型,即使在部署期间无法直接访问用户心理状态,也能有效地协助用户。实验表明,使用Mind2Dialogue进行训练可显著提高Qwen、Llama和OLMo等基线模型的个性化指标和推理能力。
-
新研究发现大型语言模型中的“脆弱标记”在上下文中会失效
研究人员在大型语言模型中发现了一种“脆弱标记”(Fragile Tokens),这些标记在单独呈现时可以被正确复现,但在更大的文本序列中则会失效。这些标记在周围文本中可能被删除、替换、截断或翻译,导致在需要字面身份保留的任务(如引用或工具使用)中出现错误。对Qwen和OLMo系列多个模型的实验表明,使用基于概率的筛选方法可以检测到相当比例的这些脆弱标记,但预测确切的触发上下文仍然是一个挑战。
-
用户在本地运行开源大语言模型 Olmo 和 Apertus 时遇到内存问题
用户正在探索两个开源大语言模型 Olmo 和 Apertus,它们以使用开放数据训练而闻名。他们尝试在本地运行这些模型时遇到了内存分配错误,这表明需要大量的硬件资源。
-
新研究分析了LLM的上下文与记忆选择
研究人员调查了像Qwen、Llama和OLMo这样的大型语言模型,在面对冲突信息时,是如何决定依赖提供的上下文还是其内部参数知识的。通过反事实实验,他们发现基于学习到的“权威方向”的干预可以重现相当一部分的来源选择变化,这表明这些方向在模型如何优先处理信息中起着作用。然而,该研究也指出,这些权威计算可能依赖于任务,而不是在不同任务之间普遍可重用。
-
新基准测试评估跨模型版本的LLM专家升级
研究人员开发了UpgradeBench,一个旨在评估微调语言模型升级过程的新基准测试。该基准测试跟踪了Qwen的四个连续版本,并包含OLMo检查点,以评估特定任务适配器在不同模型版本之间的迁移效果。它研究了新基础模型是否能提高专家性能,现有专业化资产是否可以移植,以及再训练策略的有效性。研究结果表明,升级带来的好处因任务和发布间隔而异,一些适配器会迅速失效,而另一些则能保持更长时间的稳定性。
-
佐治亚理工学院使用 Bluesky Jetstream 将 Olmo 模型性能与其训练数据关联起来
佐治亚理工学院的一个团队利用 Bluesky Jetstream 平台研究特定的训练数据如何影响人工智能模型的能力。通过分析“Olmo”的开放模型流,研究人员将其在社交推理和 STEM 知识测试上的表现追溯到其训练文本的类型。这个交互式 Web 应用程序需要 JavaScript,由艾伦人工智能研究所开发。
-
研究发现,大型语言模型常基于词语结构虚构药物知识
来自德克萨斯大学奥斯汀分校、东北大学和德克萨斯大学MD安德森癌症中心的研究人员发现,大型语言模型(LLMs)通常基于其语言结构而非实际的药理学理解来表现出对药物的了解。他们利用Olmo模型调查了这一现象,发现LLMs倾向于从词语形态推断药物属性,而不是拥有真正的领域特定知识。
-
在开放LLM训练数据Dolma中发现极端言论
一项新的研究论文在Dolma数据集中发现了大量极端言论。Dolma是一个用于OLMo系列模型的大型开放训练语料库。研究人员开发了一个结合自动化处理和专家验证的流程来估计此类内容的普遍性。他们的发现表明,Dolma可能包含数十万份含有极端主义材料的文件,包括直接煽动暴力的言论,这引发了对数据策展和大型语言模型预训练的担忧。
-
NVIDIA 押注开源 AI 模型以推动芯片需求
NVIDIA 大力投资开源 AI 模型,旨在建立一个生态系统,让企业能够构建自己的 AI,而不是依赖于 Anthropic 和 OpenAI 等实体的闭源模型。这种策略被比作 Linux 的发展,开源软件最终成为一种可持续的力量。NVIDIA 的方法包括发布 Nemotron 等模型的训练数据和代码,目标是增加对其芯片的需求。这个开源模型生态系统的成功,取决于它能否产生与基于 API 的模型相媲美的利润,或者能否在 AI 繁荣的巨大规…