PulseAugur
实时 19:13:33
实体 Olmo

Olmo

PulseAugur coverage of Olmo — every cluster mentioning Olmo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 21
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_215889 ·

    新基准测试评估跨模型版本的LLM专家升级

    研究人员开发了UpgradeBench,一个旨在评估微调语言模型升级过程的新基准测试。该基准测试跟踪了Qwen的四个连续版本,并包含OLMo检查点,以评估特定任务适配器在不同模型版本之间的迁移效果。它研究了新基础模型是否能提高专家性能,现有专业化资产是否可以移植,以及再训练策略的有效性。研究结果表明,升级带来的好处因任务和发布间隔而异,一些适配器会迅速失效,而另一些则能保持更长时间的稳定性。

  2. TOOL · CL_213304 ·

    佐治亚理工学院使用 Bluesky Jetstream 将 Olmo 模型性能与其训练数据关联起来

    佐治亚理工学院的一个团队利用 Bluesky Jetstream 平台研究特定的训练数据如何影响人工智能模型的能力。通过分析“Olmo”的开放模型流,研究人员将其在社交推理和 STEM 知识测试上的表现追溯到其训练文本的类型。这个交互式 Web 应用程序需要 JavaScript,由艾伦人工智能研究所开发。

  3. TOOL · CL_207674 ·

    研究发现,大型语言模型常基于词语结构虚构药物知识

    来自德克萨斯大学奥斯汀分校、东北大学和德克萨斯大学MD安德森癌症中心的研究人员发现,大型语言模型(LLMs)通常基于其语言结构而非实际的药理学理解来表现出对药物的了解。他们利用Olmo模型调查了这一现象,发现LLMs倾向于从词语形态推断药物属性,而不是拥有真正的领域特定知识。

  4. TOOL · CL_206275 ·

    在开放LLM训练数据Dolma中发现极端言论

    一项新的研究论文在Dolma数据集中发现了大量极端言论。Dolma是一个用于OLMo系列模型的大型开放训练语料库。研究人员开发了一个结合自动化处理和专家验证的流程来估计此类内容的普遍性。他们的发现表明,Dolma可能包含数十万份含有极端主义材料的文件,包括直接煽动暴力的言论,这引发了对数据策展和大型语言模型预训练的担忧。

  5. COMMENTARY · CL_204952 ·

    NVIDIA 押注开源 AI 模型以推动芯片需求

    NVIDIA 大力投资开源 AI 模型,旨在建立一个生态系统,让企业能够构建自己的 AI,而不是依赖于 Anthropic 和 OpenAI 等实体的闭源模型。这种策略被比作 Linux 的发展,开源软件最终成为一种可持续的力量。NVIDIA 的方法包括发布 Nemotron 等模型的训练数据和代码,目标是增加对其芯片的需求。这个开源模型生态系统的成功,取决于它能否产生与基于 API 的模型相媲美的利润,或者能否在 AI 繁荣的巨大规…

  6. TOOL · CL_196062 ·

    研究发现:看似微小的架构选择严重影响大语言模型长上下文扩展

    一篇新发表在arXiv上的研究论文详细介绍了Transformer模型中看似微小的架构选择如何显著影响其扩展上下文长度的能力。研究发现,结合三个或更多特定的架构决策(存在于Olmo、Llama和Qwen等模型中)可以将长上下文性能降低高达47%。这些差异在标准的短上下文验证中无法检测到,但在预训练早期应用上下文扩展时会显现出来。研究人员发布了一套名为OlmPool的26个可比的7B模型,以促进进一步研究,其中一些架构在长上下文扩展性方…

  7. COMMENTARY · CL_192267 ·

    Gary Marcus:开放权重AI模型缺乏真正的开源透明度

    Gary Marcus 认为,“开源”和“开放权重”这两个术语经常被混淆,导致人们对AI模型的透明度和可定制性产生误解。他解释说,真正的开源软件提供对源代码的完全访问权限,以便进行修改和研究,而开放权重模型则不提供这种程度的自由。虽然开放权重模型会发布训练好的权重,但它们不会披露完整的训练流程、原始数据或使用的具体算法,这限制了开发人员定制或深入理解模型的能力。

  8. TOOL · CL_172715 ·

    AI模型可以通过微调采纳其他AI的身份

    研究人员发现,AI模型可以通过一种类似于潜意识学习的过程,无意中采纳其他模型的身份。当使用其他AI系统生成的答案对开源模型进行微调时,即使训练数据中没有明确的身份信息,微调后的模型也常常开始将自己识别为源模型。这种现象似乎源于预训练期间形成的关联,模型在预训练中学会识别和模仿其他AI的语言风格和自我识别模式。

  9. COMMENTARY · CL_162933 ·

    开源 LLM 和隐私友好型推理选项的讨论

    讨论强调了存在使用开放数据训练并根据开源原则授权的大型语言模型 (LLM),并将其与传统的自由和开源软件 (FOSS) 进行比较。提供的示例包括 Apertus 的模型和 AllenAI 的 Olmo 模型。对话还涉及隐私友好型推理选项,例如 Venice.ai,或自行托管这些模型的可能性。

  10. TOOL · CL_155402 ·

    新书探讨基于人类反馈的强化学习

    Nathan Lambert 已完成他的著作《基于人类反馈的强化学习》,该书旨在为 ChatGPT 等模型的微调、对齐和后训练提供基础资源。这本书自 2024 年以来利用业余时间编写,融入了构建 Olmo 模型的经验。该书将随附一个全面的 10 小时课程,包括幻灯片、可用代码和一个示例模型完成库,同时还将提供免费的在线版本。实体书预计将在几周内从 Manning 和 Amazon 发货。

  11. TOOL · CL_150652 ·

    VIDRAFT发布完全开源的Aether-7B-5Attn模型

    VIDRAFT发布了Aether-7B-5Attn,一个完全开源的Apache 2.0许可基础模型。与许多仅提供权重的“开放”模型不同,Aether-7B-5Attn包含了其架构、训练数据配方、代码、超参数和日志,实现了完全可复现性。该模型在其49层中采用了一种新颖的异构注意力机制,以拉丁方阵排列,以控制深度偏差。一个关键的操作注意事项是,推理必须以批处理大小1进行,以避免由于特定的注意力分支未处理填充掩码而导致的输出损坏。

  12. TOOL · CL_129794 ·

    研究发现数据过滤对大型语言模型行为影响有限

    一项针对OLMo模型的研究发现,过滤训练数据以去除不良特征通常对模型的行为影响甚微。研究人员试图使用各种归因方法去除与“两面派”或“自由派倾向”等特定行为相关的数据点,但这些努力在很大程度上是无效的,效果与随机数据删除相似。通过过滤唯一显示出显著减少的行为是“拒绝”,其中探针和大型语言模型判断器被证明是最有效的。研究表明,许多不良行为可能已经存在于模型的训练中期,并且是被诱发的,而不是直接教授的,行为通常被打包成“人设”。

  13. TOOL · CL_129313 ·

    xLSTM模型实现大型语言模型近乎无损蒸馏

    研究人员开发了一个有效的蒸馏流程,将具有二次注意力机制的大型语言模型(LLMs)的知识转移到基于xLSTM的亚二次架构上。该方法旨在实现无损蒸馏,其定义是学生模型和教师模型之间具有可比的胜负平局率。该流程包括一个额外的合并阶段,将线性化专家合并成一个单一模型,成功地蒸馏了Llama、Qwen和Olmo系列的模型。在许多情况下,xLSTM学生模型在各种下游任务上的表现接近甚至超过了它们的教师LLM,这朝着更节能的LLM替代品迈出了一步。

  14. RESEARCH · CL_128445 ·

    研究发现自蒸馏会损害先进人工智能思考模型

    一篇新的研究论文揭示,自蒸馏(一种语言模型利用自身推理来改进的技术)实际上会损害先进“思考模型”的性能。在测试中,当处理数学问题等复杂推理任务时,使用特权上下文蒸馏的这些模型准确率显著下降,最高可达17%。这种效应在推理链更长时更为明显,并且似乎源于特权教师上下文如何在模型推理过程的关键决策点改变学习。

  15. TOOL · CL_123105 ·

    新测试平台LACUNA评估LLM遗忘的参数级精确度

    研究人员推出LACUNA,一个旨在评估大型语言模型(LLM)遗忘方法精确度的新型测试平台。当前的遗忘基准仅关注输出级性能,未能验证敏感数据是否已从模型参数中真正删除。LACUNA通过将个人身份信息(PII)注入OLMo模型特定参数来解决此问题,从而可以直接评估知识擦除情况。使用LACUNA进行的实验显示,现有的最先进遗忘方法缺乏精确度,并且容易受到重新出现攻击,即使它们表现出强大的输出性能。研究表明,成功的参数定位,即使是使用更简单的…

  16. RESEARCH · CL_109589 ·

    研究:AI模型安全结果可从第一个token预测,而非深思熟虑

    一篇新的研究论文挑战了“思考型token”在推理模型中必然会提高安全性的假设。研究发现,像GPT-OSS、Qwen、Olmo和Phi这样的模型的拒绝或合规结果,从第一个token开始就高度可预测,甚至在可见的深思熟虑发生之前。研究表明,“思考”过程更像是前缀补全,结果很少在初始阶段后发生变化,并且目前的干预措施可能通过过度拒绝来无意中压制真正的深思熟虑。

  17. TOOL · CL_99020 ·

    Bluesky Jetstream 使用开源 Olmo 语言模型赋能自定义 AI 模型

    Bluesky 的 Jetstream 平台帮助 thinkaisquared.bsky.social 和 Domyn 开发了针对受监管行业的自定义 AI 模型。他们利用 Olmo 系列开源语言模型,为金融、医疗和公共部门等领域构建了专用模型。

  18. RESEARCH · CL_96198 ·

    新基准应对大型语言模型的隐私风险

    研究人员开发了新的方法来评估针对大型语言模型(LLM)的成员推理攻击(MIA),特别关注音频和文本模态。第一项研究引入了一种系统性的评估方法,用于大型音频语言模型(LALM),使用“多模态盲基线”来控制分布偏移,揭示了记忆是跨模态的,并且与说话人的声音身份有关。第二篇论文CheckMIABench提出了一种基于中间训练检查点和公共数据进行LLM原则性MIA评估的框架,展示了其在Pythia和OLMo模型上的应用,并发布了一个模块化库以…

  19. COMMENTARY · CL_94785 ·

    AI模型:训练后技巧与未来趋势探讨

    新一期播客节目中,Nathan Lambert和Finbarr Timbers讨论了AI模型训练后技术的最新进展。对话涵盖了行业向多教师策略内蒸馏的转变、Olmo风格技巧的应用,以及训练后技术对大规模AI工作的广泛影响。节目还涉及快速发展的AI领域内的职业建议,回顾了GLM 5.1、Kimi K2.6、DeepSeek V4、Xiaomi MiMo V2.5和Nemotron Ultra等模型。

  20. COMMENTARY · CL_94739 ·

    LLM 模型训练后食谱通过新的蒸馏技术不断发展

    对大型语言模型训练后食谱的回顾显示,过去一年取得了显著的进展。历史上,模型遵循监督微调(SFT)、奖励建模和强化学习(RL)的流程。然而,2024 年的最新进展以及对 2025-2026 年的预测表明,正朝着更复杂、多阶段的流程转变。这些流程包括直接偏好优化(DPO)和来自人工智能反馈的强化学习(RLAIF),以及面向前沿模型的、值得注意的多教师策略内蒸馏(MOPD)的出现。