gpt-oss
PulseAugur coverage of gpt-oss — every cluster mentioning gpt-oss across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
新的 QAH 方法可恢复压缩的 4 位 LLM 的性能
研究人员开发了一种名为“面向量化的修复”(QAH)的新方法,用于恢复已被压缩并量化为 4 位精度的 LLM 的性能。与传统的“面向量化的训练”(QAT)不同,QAH 直接从原始的、未压缩的模型中提炼出 4 位模型,从而实现更快的收敛和更高的稳定性。由此产生的 Hypernova-60B 模型源自 GPT-OSS 120B 模型,在大多数基准测试中,其性能与 bfloat16 源模型相当或更优,同时使用的内存和参数却大大减少。
-
斯坦福论文发现:小型语言模型挑战云端AI主导地位
斯坦福大学的一项最新研究论文表明,小型语言模型(SLMs)在多项任务上正变得与大型云端前沿模型相媲美。研究发现,可在本地硬件上运行的SLMs在98.6%的聊天任务和62.5%的推理任务中,表现与大型语言模型(LLMs)相当或更优,并且在过去两年中推理能力有了显著提升。这一趋势可能大大降低对大型数据中心的需求,并可能影响AWS、Azure和Google Cloud等超大规模云服务提供商,以及Nvidia等GPU制造商,还有基础模型公司的估值。
-
IBM Research 发现:Agent memory 对部分 AI 模型有提升,但对其他模型无效
IBM Research 对八种 AI 模型进行了 Agent memory 测试,观察到性能提升效果不一。测试中最大的模型未见任何提升,而一个拥有 1170 亿参数的模型在增加 5% token 成本的情况下,性能提升了 16 个点。
-
针对低资源语言微调的大语言模型显示出流畅性提升,而非准确性提高 · 跟踪到2个来源
一篇新论文探讨了针对低资源语言微调大型混合专家(MoE)模型,发现虽然准确性基准显示改进很小,但监督微调(SFT)显著增强了模型在目标语言中进行推理的能力。具有可验证奖励的强化学习可以进一步优化这些模型,修复格式不正确和意外语言泄露等问题,尽管即使没有明确的准确性提升,在低资源语言中的核心推理习惯仍然存在。该研究强调了传统准确性指标在评估此类适应性方面的局限性,并提出了新的行为维度进行测量。
-
研究发现:删除源信息后,大型语言模型上下文错误仍可能存在
一项新的基准研究表明,即使在移除了最初的错误信息后,大型语言模型(LLM)对话中的错误仍然可能持续存在。研究证明,如果对话的后续部分重复或基于错误进行计算,仅删除最初的错误并不能完全修复对话。要有效纠正此类错误,必须同时处理原始错误及其后续影响,方法是重新生成对话中受影响的部分,或删除整个派生错误信息链。
-
AI CTF锦标赛结果挑战模型规模假设
一场AI夺旗赛(CTF)最初表明,在安全推理和多步利用方面,更大的模型更具优势。然而,随后涉及更大模型和不同提示词的更广泛比赛却与这些初步发现相矛盾。比赛揭示,模型规模并非成功的唯一决定因素,即使是较小的模型也能进行多步利用,而较大的模型有时却在基本的定位和枚举方面遇到困难。
-
新技术大幅降低了LLM知识蒸馏的成本
研究人员开发出一种更高效的大型语言模型知识蒸馏方法,显著降低了计算成本和内存需求。这项新技术包括缓存教师模型的top-K logits并采用融合的、分块的KL散度损失,从而避免了物化大型张量。这些优化使得在更易获得的硬件(如单个GPU)上进行大规模实验和长上下文修复成为可能。
-
OpenAI 的 Astra 解决数学难题;欧盟 AI 法案开始执行;发布快速移动模型
OpenAI 的内部模型,代号为 Astra,据报道已解决 10 个长期存在的数学和理论计算机科学问题,并生成了可机器验证的证明,计算成本约为 2000 美元。与此同时,欧盟的 AI 法案已开始全面执行,强制要求聊天机器人披露信息和深度伪造标签,违规者将面临严厉处罚。在另一项进展中,DeepGrove 发布了一个名为 Maple-Preview 的开源模型,该模型利用三元权重在 iPhone 等消费设备上实现高推理速度。
-
GPT-OSS 模型迎来一周年,被誉为顶级本地大模型
开源模型 gpt-oss 已迎来一周年纪念日,用户称赞其 20B 和 120B 版本为顶级本地模型。虽然 Qwen 3.5 122B 被认为是其主要竞争对手,但 gpt-oss 以其速度和对本地友好的量化格式而闻名。用户还分享了一个改进的 gpt-oss Jinja 模板,旨在修复问题并增强其功能。
-
DeepGrove发布Maple-Preview,一款20B-A1B推理LLM
DeepGrove发布了Maple-Preview,一个专注于推理能力的开源20B-A1B三元权重LLM。该模型在其权重级别上展现了最先进的性能,甚至可以与更大的模型竞争并解决复杂问题。它实现了令人印象深刻的推理速度,在Mac Mini M4上运行速度超过200 tokens/秒,显著优于Gemma、Qwen 3.5和gpt-oss等模型。
-
新方法为代表性不足的语言适配分词器
研究人员开发了一种方法,可以在不改变模型词汇量大小的情况下,为代表性不足的语言适配字节级BPE分词器。这种称为BPE引导插入的方法确保新的分词分配与现有的合并图兼容,解决了“合并排序问题”。该技术应用于Nemotron和GPT-OSS的乌克兰语适配版本,显著减少了乌克兰语的词元数量,同时保持了对英语和其他欧洲语言的最小改动。该研究还发布了所有相关的分词器和代码。
-
PolyAI 发布 Dialog-RSN-1 原生音频对话模型
PolyAI 发布了 Dialog-RSN-1,这是一款原生音频对话模型,可直接处理原始音频输入,无需转录。该模型将轮次切换、语音识别、函数调用和响应生成整合到一个系统中,目标响应时间低于 300 毫秒。虽然目前仅支持英语,并且仅通过 PolyAI 的平台提供,但它已在企业客户的实时生产通话中部署。
-
Retort项目揭示线束变更扭曲了LLM性能指标
Adrian Cockcroft的Retort项目已在各种LLM和编程语言中进行了1000多次评分运行,以评估其性能。该项目的结果表明,测试线束的变化,而不是模型更新,有时会导致已发布的性能指标发生变化。由于测试不完整或数据解释不准确,关于Opus 5和Claude等模型的几项初步结论已被撤回,这强调了在报告结果之前进行彻底验证的重要性。
-
AI 审查不会转移:蒸馏模型忽略教师的限制
一项新的研究论文调查了中国 AI 模型中存在的审查是否会转移到在其输出上训练的蒸馏模型中。研究发现,当使用中国前沿模型 DeepSeek V4 Flash 来训练美国模型 (GPT-OSS-120B) 进行金融推理时,蒸馏模型并未继承关于中国敏感话题的审查。虽然 DeepSeek V4 Flash 在维吾尔族劳动力转移计划等话题上表现出显著的审查,但蒸馏出的 GPT-OSS-120B 模型公开讨论了这些话题,表明审查并未随着所需技能一起转移。
-
Google 将免费 Gemini CLI 替换为付费 Antigravity 2.0 平台
Google 已将其 Gemini CLI 迁移到一个名为 Antigravity 2.0 的新平台,该平台于 2026 年 5 月 19 日宣布,并于 2026 年 6 月 18 日正式生效。此次变更导致 Gemini CLI 的免费访问被终止,影响了数百万曾使用该工具的开发者。新的 Antigravity 平台提供了更集成的多代理和多功能体验,但它是一个需要 Google 账户的闭源二进制文件,与之前的开源 Gemini CLI …
-
新的自动句法模型概念将代理集成到编程语言中
一个名为自动句法模型(ASM)的新概念提出,未来的软件代理应该与其运行的编程语言内在关联。这种方法建议代理应该驻留在其语言的类型系统中,并能够直接修改该语言的语法和语义。作者认为,通过提供更精确的上下文和控制,这种集成将解决当前编程代理的重大局限性,特别是它们在编辑和搜索代码方面的困难。
-
用户质疑 OpenAI 的开源模型发布策略
Reddit 用户正在讨论 OpenAI 近一年前发布 gpt-oss 的情况,并质疑该公司是否会发布另一个开源模型。讨论推测,来自 Kimi、Qwen 和 GLM 等竞争对手的开源模型的出现可能会给 OpenAI 带来发布新模型的压力。
-
用户质疑OpenAI未来是否会发布开源模型
一位Reddit用户正在询问OpenAI未来发布开源模型的计划。用户指出,距离OpenAI发布gpt-oss已经一年了,并质疑该模型是否已被视为停产,以及是否计划发布更多开源模型。
-
CityLLM框架支持自然语言查询三维城市模型
研究人员开发了CityLLM,一个旨在实现对语义三维城市模型及相关城市数据集进行自然语言查询的框架。该系统将空间数据库和图数据库集成到基于LLM的工作流程中,促进了迭代查询优化和跨数据库链接。在鹿特丹CityJSON数据集上的评估显示了高绩效,在各种场景下答案正确率高达100%,查询成功率也达到100%。
-
新方法使用参考检查点检测大型语言模型蒸馏
研究人员开发了一种新方法,用于检测语言模型是否使用了来自更强大的第三方模型的蒸馏进行训练。这种基于参考的方法将模型的输出与同一谱系中的早期检查点进行比较,以识别教师模型。该技术还可以推断出未知的蒸馏流程,并已识别出涉及 QwQ、DeepSeek-R1 和 GPT-OSS 等模型的潜在蒸馏关系。