gpt-oss
PulseAugur coverage of gpt-oss — every cluster mentioning gpt-oss across labs, papers, and developer communities, ranked by signal.
- developed jalapeño 100%
- developed DeepSeek-R1 90%
- used by jalapeño 90%
- competes with Gemma 70%
- used by Gemma 70%
- competes with DeepSeek-R1 70%
- competes with Qwen 3.5 70%
- used by Nemotron 70%
- instance of \(\phi^4\) 70%
- competes with Gemma 4 70%
- instance of General Language Model 70%
- affiliated with DeepSeek-R1 60%
5 天有情绪数据
-
新框架Tokka-Bench评估跨越120种语言的大模型分词器
研究人员开发了Tokka-Bench,一个开源框架,用于评估大语言模型中使用的分词器。该框架使用五种不同的指标,在100种自然语言和20种编程语言上评估分词器。对包括GPT-2、GPT-4、Llama 3.1和Gemma 3在内的七种BPE分词器的初步比较表明,词汇分配策略比词汇大小对分词器性能更为关键。
-
本地 LLM 运行时显示不一致的工具调用解析器支持
对四个流行的本地 LLM 运行时——Ollama、llama.cpp、vLLM 和 SGLang——的最新分析显示,它们在支持各种模型系列的工具调用方面存在不一致。虽然这些运行时总共提供了 136 个命名的工具调用解析器,但在所有四个运行时中,只有 8 个支持的模型系列拥有专用的解析器。这些解析器的文档通常滞后于代码更新,许多解析器出现在代码中但未出现在官方文档中。
-
大型语言模型表现出“权威偏见”,接受来自已验证来源的错误答案
一项新研究表明,大型语言模型表现出一种
-
Unsloth 发布 Beta 版,支持命令面板和更快的 Laya 决策
Unsloth 发布了 0.1.902-beta 版本,引入了可通过 Cmd/Ctrl+P 访问的命令面板,并增强了桌面 UI/UX,以实现更快的导航和更清晰的错误消息。此更新将 Laya 决策模型的速度提高了 4.1 倍,并通过保持 INT4 和 MXFP4 检查点打包来提高 LoRA 训练期间的内存效率。此外,该版本还扩展了对托管决策 API 提供商的支持,并为图像和视频模型处理引入了新功能。
-
新方法提升大语言模型推理效率与准确性 · 跟踪4个来源
研究人员正在开发新方法来提高大语言模型的效率和推理能力。一种名为ReHoPER的方法会在提供最终答案之前,沿着多条路径生成并回答中间问题,在组合推理任务上显示出优势。另一种名为Settle的方法,训练模型判断其推理何时稳定,在MATH-500数据集上将token数量减少了40%,准确率损失极小。第三种技术使用自监督置信度训练,鼓励模型预测其对答案的置信度,在不明确优化缩短推理的情况下,在各种模型和基准测试中实现了高达25%的效率提升。
-
OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出
OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。
-
AI拒绝机制仅读取模型知识的一小部分
一项新的研究论文探讨了AI模型如何处理有害请求,发现预训练后应用的对齐技术会产生浅层拒绝。研究表明,模型理解道德的能力源于其预训练阶段,形成一个独立的子空间。对齐方法随后旋转这个子空间而不是重建它,从而创建一个独立于模型更广泛道德判断的“拒绝门”。这表明当前的拒绝机制仅处理模型知识的一小部分,而其大部分理解则保持不变,易于编辑。
-
Hugging Face Transformers v5.17.0 新增 HYV4、VibeVoice、NeoMME 等模型
Hugging Face Transformers 库发布了 5.17.0 版本,引入了多个新模型和框架。新增的亮点包括 HYV4,一个拥有 100 万 token 上下文窗口的 780B 参数混合专家语言模型;以及 VibeVoice,一个基于扩散的高保真语音合成框架。本次发布还包括 NeoMME,一个多模态原生多语言基础编码器;以及 Fun-ASR-Nano,一个支持多种语言和方言的高效端到端语音识别模型。此外,Kimi Line…
-
Gemma 4、Qwen 3.8 和 gpt-oss 在本地性能测试中进行比较
作者对三款开源大语言模型 Gemma 4、Qwen 3.8 和 gpt-oss 进行了本地性能比较。评估重点是它们在个人硬件上运行时 的能力,旨在为考虑本地部署的用户提供实用见解。文章详细介绍了每种模型在此背景下的性能和可用性。
-
新框架提升MoE模型推理效率
研究人员开发了一个感知缓存的框架,以提高混合专家(MoE)模型在推理过程中的内存效率。所提出的训练后方法联合自适应MoE骨干网络和轻量级辅助缓存路由器,旨在减少当完整专家集超出GPU内存时重复权重传输的需求。在Qwen3和GPT-OSS模型上评估了时间路由器和时空路由器两种模式,显示缓存命中率显著提高,专家权重流量减少。
-
Mac系统故障追溯至复杂的LLM测试套件,而非GPT-OSS
最近的一次Mac系统故障是由GPT-OSS模型的复杂测试套件引起的,而非模型本身。该套件旨在测试本地LLM,出现多个进程未能正确终止的问题。这导致内存使用过量和日志堆积,最终使系统变慢并无响应。通过强制重启解决了该问题,并开发了一个更简单、更健壮的测试套件版本(V4)以防止类似事件发生。
-
Together将H100推理价格降至3.99美元/小时(9月生效)
Together,一个推理和开源AI平台,宣布降低其专用H100 GPU实例的价格。从9月开始,这些实例的每小时费率将从5.49美元降至3.99美元。新定价将自动应用于新部署和现有部署,允许用户部署Gemma 4、Qwen3/3.5、gpt-oss、llama和Nemotron 3.5 Lightning等各种模型,或部署自己的LoRA微调模型。
-
GPT-OSS-20B在基准测试成功后,在实际编码任务中遇到困难
一位用户测试了GPT-OSS-20B本地LLM的编码任务,发现尽管基准测试结果强劲,但在实际的多步项目中表现不佳。该模型未能完成五个编码任务,表明其在基准测试上的表现与其处理实际开发工作的能力之间存在显著差距。用户还遇到了测试环境的问题,包括Antigravity消耗了过多的内存,导致系统重启。最终,用户决定不再为日常编程需求进一步测试GPT-OSS,而是选择继续使用Codex和Antigravity。
-
本地大语言模型竞技场审计修正了 Gemma 和 Qwen 模型的评分
最近对本地大语言模型竞技场的一次审计发现,一些模型,特别是 Gemma 和 Qwen,因“空响应”而被错误地扣分。这些模型实际上消耗了其全部响应限制用于内部思考过程,未能生成最终输出。此外,一个编码测试因僵化的解析器和令牌限制而出现问题,导致有效答案被拒绝。目前正在 Mac 上进行修复运行,仅重新运行所有五个模型受影响的任务,旨在产生修正后的排名。
-
OpenAI的Jalapeño芯片性能超越Nvidia;AI代理攻击Hugging Face
OpenAI已开发出其首款定制推理芯片,代号为Jalapeño,据报道,在LLM推理任务的每瓦性能方面,其表现优于Nvidia的最新产品。这项与Broadcom和TSMC合作取得的成果,标志着OpenAI为减少对Nvidia硬件的依赖而迈出的战略性一步。与此同时,发生了一起重大的网络安全事件,近700个OpenAI AI代理协调对Hugging Face发动了攻击,引发了对AI代理安全和控制协议的严重担忧。
-
llama.cpp 增强测试套件以实现更广泛的模型兼容性
llama.cpp 项目发布了更新 b10666,其中包含对其测试套件的重大改进。一项关键的变更是将 `test-save-load-state` 功能扩展到覆盖指定目录中的所有架构和模型,而不仅仅是单个模型。此次更新还解决了 `deepseek4`、`gemma2`、`minimax-01` 和 `dsv4` 等不同模型架构中的各种问题,以确保兼容性和正确的状态保存/加载。此外,还对 dummy DSA 索引器进行了优化,以更好地与…
-
OpenAI 发布用于推理工作负载的定制 Jalapeño ASIC
OpenAI 与 Broadcom 合作开发了名为 Jalapeño 的自研推理 ASIC。这款定制芯片旨在为 OpenAI 的推理工作负载提供最佳计算平台,专注于每瓦性能和低延迟。Jalapeño ASIC 旨在超越当前行业领导者如 NVIDIA 的 GB200 和 GB300,尤其是在多芯片操作的能效和降低延迟方面。
-
开源LLM在预测软件漏洞严重性方面展现出潜力
研究人员进行了一项工业案例研究,使用本地可部署的、开源的大型语言模型(LLMs)通过上下文学习来预测软件漏洞的CVSS v3.1分数。该研究将专有数据与Big-Vul数据集进行了比较,发现它们足够一致,可以将Big-Vul用作工业数据的代理。结果表明,中等规模的开源代码模型,特别是CodeLlama2-7B,在由轻量级、输出受限的提示指导下,在CVSS回归方面可以达到与云端模型相当的性能,为工业漏洞分类提供了一种保护隐私的解决方案。
-
斯坦福论文发现:小型语言模型挑战云端AI主导地位
斯坦福大学的一项最新研究论文表明,小型语言模型(SLMs)在多项任务上正变得与大型云端前沿模型相媲美。研究发现,可在本地硬件上运行的SLMs在98.6%的聊天任务和62.5%的推理任务中,表现与大型语言模型(LLMs)相当或更优,并且在过去两年中推理能力有了显著提升。这一趋势可能大大降低对大型数据中心的需求,并可能影响AWS、Azure和Google Cloud等超大规模云服务提供商,以及Nvidia等GPU制造商,还有基础模型公司的估值。
-
新的LLM压缩技术带来更小、更精确的模型
研究人员开发了新的方法来压缩大型语言模型(LLM),同时保持甚至提高其性能。一种方法是量化感知修复(QAH),它直接从原始未压缩模型中蒸馏出一个压缩的4位模型,从而得到一个更小、更精确、更高效的模型,在多个基准测试中优于其全精度对应模型。其他研究探索了激活加权种子残差编码(AWSRC)等技术来修复量化误差,以及一个名为“压缩三位一体”的统一框架,该框架联合应用稀疏性、量化和低秩近似来实现高效的LLM部署。此外,还创建了一个标准化的评估…