GPT-5.4
PulseAugur coverage of GPT-5.4 — every cluster mentioning GPT-5.4 across labs, papers, and developer communities, ranked by signal.
- subsidiary of OpenAI 100%
- developed by OpenAI 100%
- competes with Kimi K2.6 90%
- instance of large-language models 90%
- used by codex 90%
- uses Molecule.one 90%
- developed by Microsoft Research 90%
- used by Microsoft Mdash 90%
- used by Molecule.one 90%
- competes with MAI-Cyber-1-Flash 90%
- used by Maria 90%
- competes with Harness-1 90%
- 2026-06-19 research_milestone OpenAI and Molecule.one's GPT-5.4 system demonstrated near-autonomous improvement of a drug synthesis reaction. 来源
- 2026-06-17 research_milestone GPT-5.4 assisted in a medicinal chemistry project, improving yields for key chemical reactions. 来源
- 2026-05-26 research_milestone An evaluation found GPT-5.4 to be the only model that consistently improved code efficiency when prompted. 来源
23 天有情绪数据
-
LLM 路由基础设施比依赖单一模型更有价值
作者发现,在自动化堆栈中依赖单一、高成本的 LLM 来处理所有任务会导致生产问题,例如延迟增加和超时。真正的改进并非来自更高级的模型,而是来自实施具有回退功能的、针对特定任务的模型路由。这种方法使用针对不同工作(如规划或提取)进行了优化的不同模型,并采用 OpenRouter 或 Portkey 等路由基础设施来比“一刀切”策略更有效地管理可用性、成本和性能。
-
大型语言模型简洁提示可省钱,缩短输入提示成本更高
一项新研究发现,指示大型语言模型(LLM)在输出时保持简洁,可以在不影响准确性的情况下显著降低成本。该研究测试了包括 OpenAI、Anthropic 等公司模型在内的九种不同大型语言模型,结果显示平均节省成本 1.5 倍,在某些情况下甚至高达 3 倍。相反,缩短输入提示被证明是适得其反的,会导致成本增加和准确性下降,因为模型会试图弥补丢失的信息。研究还指出,虽然简洁的输出通常是正确的,但它们并不总是能反映模型不受限制的推理过程。
-
新任务聚焦儿童 YouTube 视频中的商业内容
一项名为 ChildSafeAds 的新共享任务已被推出,旨在识别面向儿童的 YouTube 视频中的商业内容。该任务使用了包含 3,360 个视频的数据集,并包括来自 SponsorBlock 的片段、转录文本和链接的销售页面。参与者将负责对推广类型进行分类,分配产品类别,并识别法律风险标志。值得注意的是,数据显示超过 45% 的视频未能使用 YouTube 平台内的广告披露方法。GPT-5.4 和 GPT-5.6-luna 被用于…
-
新框架通过可重用、不断发展的攻击技能扩展 AI 红队测试
研究人员开发了 JailbreakSkill,这是一个旨在增强 AI 模型自动化红队测试的框架。该系统将现有的攻击策略打包成模块化、可重用的技能,这些技能可以随着时间的推移而适应和发展。通过从攻击经验中学习,JailbreakSkill 可以改进、组合和发现新技能,显著提高在 AdvBench 和 HarmBench 等基准测试上的攻击成功率,包括对 GPT-5.4 取得了显著的提升。
-
新的文本到SQL系统提高了企业准确性
一篇新研究论文介绍了一个语义路径编译(SPC)系统,旨在提高企业应用程序文本到SQL生成的可靠性。与可能导致错误查询的直接生成方法不同,SPC将自然语言解释和SQL构建的任务分开。该系统对短语进行约束并选择受管制的选项,大多数决策由代码而不是语言模型处理。在保险基准上的评估显示,SPC的准确率为97.4%,而基线为55.3%,证明了其鲁棒性和可复现性。
-
研究发现:大型语言模型难以核实精确的法律引用
一篇来自arXiv的新论文调查了包括GPT-5.4在内的大型语言模型准确核实法律引用的能力。研究人员发现,虽然模型擅长检测完全错误的案例引用,但它们在识别指向正确案例但页面引用不支持特定主张的引用方面存在显著困难。这种被称为“错误精确腐败”的故障模式在法院判决和法律摘要中尤为普遍,即使是先进的模型也无法识别相当大比例的此类错误。该研究表明,当前模型将主题相关性与页面级支持混淆,表明法律AI应用需要改进推理能力。
-
临床RAG系统VITA在HealthBench上可与前沿LLM媲美
一篇新发表的研究论文详细介绍了VITA,这是一个专门为低收入和中等收入国家临床知识检索设计的检索增强生成(RAG)系统。VITA在HealthBench基准上进行了评估,其表现与包括GPT-5.5和Claude Opus 4.8在内的几款前沿大型语言模型(LLM)相比具有竞争力。虽然VITA在准确性和完整性方面得分最高,但其沟通得分低于一些通用LLM。
-
研究发现大型语言模型在精确法律引用验证方面存在困难
Hugging Face 的一篇新论文调查了大型语言模型验证法律引用的能力,发现虽然模型能够识别错误的案例引用,但在精确到页码的准确性方面存在困难。研究强调,模型常常将主题相关性与精确的法律支持混淆,导致在验证引用时出错。即使是像 GPT-5.4 这样经过高强度推理的高级模型,也无法识别相当比例的精确不匹配之处,这表明在法律引用验证方面存在明显的能力差距。
-
Ngrok AI Gateway 利用隧道专业知识简化 LLM 路由
Ngrok 推出了 AI Gateway 产品,旨在为开发人员简化 LLM 路由。该网关充当访问各种 AI 模型、管理 API 密钥和提供可观察性的统一端点。与许多竞争对手不同,Ngrok 的产品利用了其在网络隧道和暴露本地端口方面十年的专业知识,AI Gateway 是其先前内部工具的改进版本。
-
新的CIDER数据集助力大语言模型与用户隐私偏好对齐
研究人员推出CIDER,一个旨在帮助大语言模型更好地与个人隐私偏好对齐的新数据集。该数据集包含超过14,000条跨不同沟通场景的人工标注,详细说明了用户分享个人信息的意愿。实验表明,像GPT-5.4和Claude Sonnet 4.6这样的模型,在通过上下文信息进行个性化后,预测准确率可提高多达11.41个百分点,尽管这有时会导致不平衡的错误率。
-
孟加拉语数学推理研究:思维链监督的益处因模型强度而异
一项新研究“MathShikkha”调查了思维链(CoT)监督在提高小型语言模型(SLMs)孟加拉语数学推理方面的有效性。该研究使用GPT-5.4生成的推理构建了一个数据集,发现虽然CoT监督并未显著提高较强SLMs的领域内推理准确性,但它显著增强了一个较弱的4B模型。然而,在一个更大的基准测试中,CoT在所有模型上都显著优于仅答案微调,并保持或提高了领域外准确性。
-
统一的LLM API简化集成,但强大的成本控制和验证是关键
多篇文章讨论了管理LLM API集成的策略,重点关注统一的API网关和强大的成本控制机制。建议开发者使用单一API密钥访问OpenAI、Claude和Gemini等各种模型,从而简化凭证管理并方便模型切换。关键考虑因素包括实施租户感知的使用分类账、严格的JSON验证以及对每次尝试进行详细的成本跟踪,尤其是在采用回退策略或批量处理时。文章还强调了中国LLM以及提供对这些模型以及西方模型的访问的专门聚合器日益增长的重要性,强调了成本节省和…
-
新框架应对长文档和演进式文档理解挑战
研究人员开发了新的框架来应对理解长文档和演进式文档的挑战。InSight-doc 是一个代理式视觉感知框架,能自适应地分配视觉分辨率,以提高文档视觉问答的准确性并降低延迟。另外,TIDE 对大型语言模型在时间演进式文档上的表现进行基准测试,突显了其在版本解析和时间准确性方面的显著弱点。DocAtlas 提出了一种可变状态交互方法,将文档理解视为一个信息检索过程,并提供了搜索、阅读和笔记记录等工具,在基准测试中表现出改进的性能。
-
LLM中的孟加拉语数学推理:思维链监督效果喜忧参半
一项名为MathShikkha的新研究,调查了思维链(CoT)监督对于提高在孟加拉语上训练的小型语言模型数学推理能力的有效性。该研究使用GPT-5.4生成的推理过程构建了一个孟加拉语数学推理数据集,并对四种参数量从4B到7B不等的模型进行了微调。结果表明,CoT监督在较大的BanglaMATH基准测试中带来了显著的好处,所有模型的性能提高了20.1-28.1个百分点,而仅答案的微调有时会降低性能。然而,一项人类研究发现CoT在推理有效…
-
提示词市场对结果免责;模型敏感性引发争论
PromptBase 等提示词市场出售的提示词带有“按原样”出售的免责声明,不保证结果,并将举证责任推给买家,要求他们在24小时内证明提示词“未按描述工作”。虽然一些消息来源认为,由于GPT-5、Claude和Gemini等模型在响应风格和指令偏好方面存在差异,提示词在这些模型上的表现差异很大,但其他研究表明,这种感知到的敏感性很大程度上可能是评估方法的产物,而非模型本身的局限性。
-
OpenAI 的 GPT-5.4 出现罕见的跨脚本采样故障
OpenAI 的 GPT-5.4 模型出现了一个罕见的故障,它在句子中间用格鲁吉亚语脚本写了一个半德语单词,然后又恢复到拉丁语脚本。尽管温度设置为零,这表明模型推理层可能存在问题,而不是管道错误。通过追踪检测到该异常,追踪确认没有数据损坏或替换问题。OpenAI 实施了输出保护程序来检测和重新滚动脚本异常,因为此 bug 在四天内出现在不同账户的两个独立实例中。
-
LLM系统提示在不同模型上表现不一致
最近的一项实验显示,LLM提示中的消息(特别是系统提示)的作用并非在所有平台上都能一致地影响模型行为。虽然OpenAI的GPT-5.4和Anthropic的Claude Opus-5证明了系统提示可以覆盖用户指令,但GPT-5.4 Mini并未表现出这种一致的行为。研究得出结论,消息顺序通常比分配的角色更关键,并且虽然系统提示对于设定护栏和约定有用,但它们对LLM输出的影响可能因模型的训练而异。
-
第三方服务为 OpenAI 兼容 API 测试提供预付费额度
一家名为 GGSEL 的第三方服务为 OpenAI 兼容 API 客户端提供预付费额度,使开发人员无需使用其主要账单账户即可测试工具。用户只需支付 0.95 美元,即可获得一次性激活码,为独立的 API 服务充值 10 美元内部额度。该服务支持聊天补全、响应、流式传输和工具调用,列出了各种 GPT-5.6、GPT-5.5 和 GPT-5.4 变体,默认限制为每分钟 20 个请求。
-
新基准CREBench测试LLM在密码逆向工程中的能力
研究人员推出了CREBench,这是一个旨在评估大型语言模型(LLM)在密码二进制逆向工程领域能力的新基准。该基准包含432个挑战,源自标准密码算法和不安全密钥使用场景,难度各异。在评估中,GPT-5.4在八个前沿LLM中表现最强,得分64.03(满分100),在59%的挑战中成功恢复了flag,但人类专家仍以92.19的得分保持显著优势。
-
新分析显示 RAG 系统在引用精确度方面存在困难
一篇新的研究论文介绍了一种“三重鲁棒性”分析方法来评估检索增强生成(RAG)系统,特别是比较了 GraphRAG 和向量 RAG。研究发现,在各种设置下,GraphRAG 在引用精确度方面始终表现不佳,经常引用不相关的信息。研究发现 GraphRAG 的响应忠实度高度依赖于所使用的语料库,在技术要求方面表现不佳,但在一般知识文本方面表现更好。