GPT-5.4
PulseAugur coverage of GPT-5.4 — every cluster mentioning GPT-5.4 across labs, papers, and developer communities, ranked by signal.
- subsidiary of OpenAI 100%
- developed by OpenAI 100%
- used by DagsHub 90%
- competes with Kimi K2.6 90%
- used by codex 90%
- instance of large-language models 90%
- uses Molecule.one 90%
- developed by Microsoft Research 90%
- used by Molecule.one 90%
- competes with Harness-1 90%
- used by Maria 90%
- competes with MAI-Cyber-1-Flash 90%
- 2026-06-19 research_milestone OpenAI and Molecule.one's GPT-5.4 system demonstrated near-autonomous improvement of a drug synthesis reaction. 来源
- 2026-06-17 research_milestone GPT-5.4 assisted in a medicinal chemistry project, improving yields for key chemical reactions. 来源
- 2026-05-26 research_milestone An evaluation found GPT-5.4 to be the only model that consistently improved code efficiency when prompted. 来源
16 天有情绪数据
-
新的 QRAKEN 管道增强了知识图谱的自然语言查询功能
研究人员开发了 QRAKEN,一个新颖的神经符号管道,旨在改进 RDF 知识图谱的自然语言查询。与以往严重依赖模式期望的旧方法不同,QRAKEN 将其查询生成建立在经验性图证据的基础上。它采用两阶段过程:一个离线蒸馏器创建一个名为 TTQL 的紧凑表示,描述填充的模式和频率;一个在线组件使用 TTQL 指导 LLM,同时应用确定性检查进行优化。这种方法在 Text-to-SPARQL 任务上显著提高了性能,优于现有系统,并证明了经验性…
-
新的Python工具可检测LLM代理批准劫持漏洞
一个新开发的Python检查器工具,用于识别链式LLM代理技能中的安全漏洞,特别是专注于“批准劫持”。该技术利用两个看似无害的技能如何通过使用进度文件作为中介,共同欺骗代理执行未经授权的操作。该检查器实现了基于技能和基于链的规则来检测这些恶意模式,突显了静态分析在应对不断发展的攻击方法方面的局限性。
-
研究:廉价AI模型运行成本常高于高端替代品
斯坦福大学牵头的一项研究显示,相当一部分被宣传为经济高效的AI模型,实际上比价格更高的同类产品更昂贵。研究指出,Gemini 3 Flash 尽管宣传比 GPT-5.4 便宜 80%,但消耗的 token 却多了 38%。这凸显了宣传价格与实际运营成本之间的脱节,只有 11% 的企业能够准确预测其 AI 支出。
-
MiniMax M2.7:开源模型在 SWE-Pro 上媲美 GPT-5.3-Codex,并重写自身代码
MiniMax 发布了 M2.7,一个拥有 2290 亿参数的开源模型,根据 Apache 2.0 许可协议发布。该模型展示了强大的能力,在 SWE-Pro 基准测试中取得了 56.22% 的分数,与 OpenAI 的 GPT-5.3-Codex 持平。值得注意的是,M2.7 参与了自身的开发,在 100 多轮中自主优化了其训练基础设施和代码,使其编程脚手架提高了 30%。
-
研究发现LLM安全评估因分布变化而存在缺陷
一项新的研究论文指出了大型语言模型(LLM)安全路由评估方法的重大缺陷。该研究“虚假地板:LLM安全路由评估在分布变化下失效”表明,当前将路由模型与评估数据上的最佳单一模型进行比较的基准,在面对分布变化时并不可靠。这种偏差会夸大安全路由器的感知有效性,使其看起来比实际更有益,尤其是在HELM Safety和AgentDojo等基准上。研究还揭示,像GPT-5.4这样的模型容易受到对抗性攻击,这些攻击会显著降低其感知的安全识别能力。
-
GPT-5.4 代理的懒惰被归咎于工作流 Bug,而非模型本身
使用 n8n 和 GPT-5.4 构建的一个代理在生产环境中表现不佳,表现出“模型懒惰”的特征,例如输出更短、推理能力下降。然而,问题并非出在模型本身,而是代理工作流中的三个 Bug:重试上限降低、一个错误地将部分答案标记为成功的分支,以及一个偏好第一个可接受响应而非最佳响应的 API 路径。修复这些工作流问题后,代理的性能得到了恢复,这凸显了编排和环境约束在代理行为中的关键作用。
-
大型语言模型表现出“权威偏见”,接受来自已验证来源的错误答案
一项新研究表明,大型语言模型表现出一种
-
前沿 LLM 在新基准测试中未能回忆起 2024 年后的事实
一项名为“Post-Cutoff Knowledge 150”的新基准测试旨在评估前沿 LLM 关于其训练数据截止日期之后发生的事件的参数化知识。该基准测试包含 150 个事实性问题,这些问题源自仅限于 2025-2026 年事件的网页索引,结果发现即使是表现最好的模型也面临严峻挑战,Gemini 3.7 Flash 的得分最高,达到 24%。研究表明,推理能力无法弥补截止日期后知识的缺失,模型大小或价格与性能没有持续相关性,这表明训…
-
新的CASE框架增强了AI的纵向医学推理能力
研究人员开发了一个名为CASE(Clinical Agents for Seeking Evidence,临床证据搜寻代理)的新框架,旨在提高基础模型的纵向医学推理能力。该框架包括一个工具使用工具包和一个用于视觉语言模型的训练后方法。CASE在一个源自UK Biobank数据的新基准上进行了测试,该基准包含与患者诊断和MRI扫描相关的超过50,000个临床问题。实验表明,使用CASE的基于Qwen3-VL-8B的代理在答案准确性方面比…
-
新的AI方法推进3D空间推理和重建
研究人员正在开发新的AI 3D空间推理方法,超越了目前在连续空间关系方面存在困难的视觉-语言模型。GeoLatent和Matisse引入了使用结构化潜在空间和基于证据的推理的新方法,以提高3D重建和理解的保真度和效率。还提出了一个名为SpatialReasoner的基准和框架,一个名为Active House-Scale Spatial Reasoning (AHSR)的新范例,在大型3D环境中表现优于现有模型。
-
AI编码代理展现潜力但面临审查挑战,新基准测试揭示
新的研究和用户体验突显了AI编码代理的挑战和潜力。虽然GPT-5.4和Gemini等代理在生成代码方面展现出希望,但由于细微的错误和遗漏,它们的输出通常需要广泛审查。Zero2Repo和ReviveBench等基准测试正在开发中,以严格评估这些代理构建整个存储库和复兴遗留软件的能力,揭示即使是先进的模型在处理复杂的多语言任务时也面临困难。用户反馈表明,虽然代理可以加速开发,但它们也会引入代码质量问题,从而显著增加审查时间和复杂性。
-
轻量级 LLM 在错误前提测试中胜过旗舰模型;Gemini 在假设性问题上表现不佳
一项旨在测试大型语言模型识别和标记用户查询中错误前提能力的新基准测试揭示了令人惊讶的结果。Gemini 2.5 Flash 和 Claude Haiku 4.5 等轻量级模型取得了满分,表现优于它们的旗舰版本 Gemini 2.5 Pro 和 GPT 5.4。值得注意的是,Gemini 模型在嵌入了错误假设的假设性问题上尤其挣扎,它们会进行虚构而非纠正,而其他测试模型则成功识别了错误前提。
-
医疗AI事实核查因检索和推理限制而失败
一篇新的研究论文探讨了在开放式医疗场景中基于检索的事实性评估的局限性,揭示了与封闭式基准相比存在显著的性能差距。该研究引入了分类法来对检索和验证器推理阶段的失败进行分类,发现更大的模型、增加的推理工作量和更广泛的数据源并不能解决这些根本性问题。研究结果表明,当前的检索后验证范式在准确的医疗事实核查方面存在固有的局限性。
-
新方法通过动态记忆和语言集成增强时间序列预测 · 跟踪 5 个来源
研究人员正在开发先进的时间序列预测方法,超越简单的检索,融入动态记忆更新和因果推理。例如,FreshCast 使用新的观测值持续更新非参数记忆,以改进冻结模型的预测,显著降低了均方误差。DuoTS 通过使用双上下文方法来增强预测,该方法将基础预测与基于检索到的历史状态及其轨迹的精炼预测相结合。SEER 提供了一个闭环框架,利用预测误差来精炼检索并构建因果知识库,防止数据泄露。TimeBraid 统一了时间序列和语言模型,使它们能够基于…
-
新的多智能体框架 MaSCoD 使用 LLM 增强因果图生成
研究人员开发了 MaSCoD,一个新颖的多智能体框架,旨在通过明确解决相关因果关系遗漏问题来改进因果图生成。该框架在直接边判断前组织候选第三方变量和局部结构模式,并利用 GPT-5.4 和 GPT-4o 等 LLM 进行操作。在 Auto-MPG、DWD 和 Sachs 等数据集上的评估表明,MaSCoD 的性能取决于数据集和所使用的特定 LLM 主干,而不是提供普遍的优越性。研究表明,预先组织结构信息可以成为控制因果发现中遗漏的宝贵设计目标。
-
AI 工作流问题追溯到并发限制,而非模型缺陷
用户在 AI 工作流中遇到了意外行为,最初将其归因于 GPT-5.4、Claude Opus 4.6 或 Grok 4.20 等服务的模型不稳定。然而,根本原因被确定为 webhook 爆发压垮了 n8n 流,导致速率限制错误和不一致的输出。解决方案包括调整 n8n 中的并发限制,这表明许多所谓的“模型不稳定”问题实际上与基础设施和速率限制有关,而不是 AI 模型本身。
-
LLM 引导的贝叶斯网络学习框架 ABSOL 表现出改进的性能
研究人员开发了 ABSOL,一个将大型语言模型 (LLM) 与贝叶斯网络相结合的新框架,以提高 LLM 在需要证据条件化和不确定性估计的任务中的可靠性。ABSOL 使用 LLM 作为贝叶斯网络结构学习过程的引导语义输入。在五个基准的评估中,ABSOL 始终生成可行的图,并在较大的数据集上优于其他方法,证明了 LLM 的语义知识在作为有界引导使用时可以增强概率结构学习。
-
新的ORQA框架测试LLM职业知识;Claude和GPT领先
研究人员开发了ORQA,一个旨在评估大型语言模型职业特定知识的新框架。该方法将O*NET职业与权威网站连接起来,生成可追溯来源的问答对。该框架涵盖116种职业,包含来自187个网站的480个问题,重点关注现实世界的技能相关性。在测试中,Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6表现最佳,准确率约为58-62%,而较小的开源模型表现为33-41%。
-
新数据集OpenDiscoveryTrace追踪人工智能科学家推理过程
发布了一个名为OpenDiscoveryTrace的新数据集,包含558个详细的人工智能科学代理轨迹。该数据集捕获了模型的逐步推理过程,而不仅仅是最终输出,以便审计科学方法和诊断故障模式。它包括来自GPT-5.4、Claude Opus-4.6和Gemini-3.1 Pro等前沿模型的数据,以及Qwen2.5-7B和Mistral-7B-v0.3等开源模型的数据。使用该数据集进行的初步分析显示,模型在错误类型和频率上存在显著差异,而仅…
-
AWS 停用 Bedrock Access Gateway,促使迁移至原生 API
AWS 已停用其 Bedrock Access Gateway,这是一个兼容 OpenAI 的 Amazon Bedrock 代理,因为该服务现在原生支持这些 API。从网关迁移的开发者必须在 `bedrock-runtime` 和 `bedrock-mantle` 端点之间进行选择,每个端点都有不同的区域可用性和模型支持。虽然 `bedrock-runtime` 推荐用于大多数新应用程序并提供更广泛的区域访问,但 `bedrock-…