PulseAugur
实时 09:41:32
实体 GPT-5.5

GPT-5.5

PulseAugur coverage of GPT-5.5 — every cluster mentioning GPT-5.5 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
126
90 天内 937
发布 · 30天
0
90 天内 0
论文 · 30天
43
90 天内 213
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-17 product_launch GPT-5.5 has been spotted on the OpenRouter platform, accessible through the Cerebras provider. 来源
  2. 2026-06-11 research_milestone GPT-5.5 achieved a higher score than Claude Fable 5 on the new Agents' Last Exam benchmark. 来源
  3. 2026-06-11 research_milestone GPT-5.5 achieved a superior performance on the Agents' Last Exam benchmark compared to Claude Fable 5. 来源
  4. 2026-06-11 product_launch OpenAI has released GPT-5.5, now available and managed within Databricks. 来源
  5. 2026-06-09 product_launch OpenAI has released GPT-5.5, which is now available and managed within Databricks. 来源
  6. 2026-06-03 product_launch UK banks are being offered access to OpenAI's GPT-5.5 model. 来源
  7. 2026-06-03 product_launch UK banks are being offered access to OpenAI's GPT-5.5 model. 来源
  8. 2026-06-03 product_launch UK banks are being offered access to OpenAI's GPT-5.5 model. 来源
  9. 2026-05-29 product_launch OpenAI released the GPT-5.5 model, available via ChatGPT. 来源
  10. 2026-05-26 product_launch OpenAI's GPT-5.5 is highlighted for its advanced coding capabilities. 来源
  11. 2026-05-17 product_launch OpenAI released GPT-5.5, a new iteration of its language model.
  12. 2026-05-17 product_launch OpenAI designates GPT-5.5 as the primary upgrade path for older models.
  13. 2026-05-14 product_launch OpenAI has released its new model, GPT-5.5, via API. 来源
  14. 2026-05-14 research_milestone GPT-5.5 and Claude Mythos showed comparable performance in vulnerability-finding tasks during a UK AI Security Institute evaluation.
  15. 2026-05-12 product_launch OpenAI's GPT-5.5 launch has led to a surge in user adoption and revenue.
情绪 · 30 天

26 天有情绪数据

GPT-5.5 目前的地位和主要功能是什么?GPT-5.5 已从旗舰模型转变为快速发展的人工智能领域中的一个关键基准。它最初作为强大的竞争者推出,现在主要用作评估更新、更先进模型的基线。尽管其能力在发布时意义重大,但现在越来越多地根据其继任者的快速进步和日益增长的竞争对手领域来衡量。OpenAI 的 GPT-5.6 系列如何取代了 GPT-5.5?OpenAI 战略性地用其分层的 GPT-5.6 系列取代了 GPT-5.5,提供了优化的性能和成本效益。GPT-5.6 Sol Pro 展示了卓越的问题解决能力,尤其是在破解一个 GPT-5.5 未能解决的 30 年统计学猜想方面。此外,GPT-5.6 Terra 以显著降低的成本提供了与 GPT-5.5 相当的性能,成为新的通用选项,甚至升级了免费的 ChatGPT 层级。哪些新兴模型正在挑战 GPT-5.5 的性能?GPT-5.5 面临来自开源模型和其他前沿人工智能系统的强大竞争,尤其是在编码和成本效益方面。智谱AI的GLM-5.2和月之暗面的Kimi K3等中国实验室在SWE-bench Pro等编码基准测试中经常超越GPT-5.5,并提供更具成本效益的解决方案。Meta的Muse Spark 1.2现在也以更低的成本达到GPT-5.5的性能,这凸显了激烈的市场压力。GPT-5.5 的显著局限性和研究意义是什么?尽管有其优点,GPT-5.5 表现出更高的幻觉率,并且在真正新颖、复杂的解决问题任务上表现不佳。它被纳入评估大型语言模型自我偏好的研究中,这突显了其作为研究对象的持续相关性,即使它不再是 OpenAI 的尖端产品。这些研究强调了理解人工智能评估中固有偏见的重要性,GPT-5.5 在此类分析中作为关键模型。

近期动态

为何这些故事上榜

  • 88

    This cluster highlights a major generational leap, with GPT-5.6 Sol Pro succeeding where GPT-5.5 failed on a complex problem, signaling rapid advancement within OpenAI's own lineup.

  • 82

    This cluster details the official launch of the GPT-5.6 family, clearly positioning its tiered models, especially Terra, as the direct replacement for GPT-5.5's role.

  • 65

    Despite being from a single source, this cluster is significant for showing a key competitor, GLM-5.2, outperforming GPT-5.5 on coding benchmarks, underscoring intense market competition.

  • 58

    This cluster is important as it marks the practical replacement of GPT-5.5 for general users, with the free ChatGPT tier upgrading to the comparable, yet more cost-effective, GPT-5.6 Terra.

  • 42

    This cluster is notable for its research implications, featuring GPT-5.5 as one of the models studied for self-preference in evaluations, indicating its continued relevance as a benchmark.

GPT-5.5报道走势

趋势

Coverage of GPT-5.5 is declining, largely due to its succession by the GPT-5.6 family. Initial spikes around its launch and immediate comparisons to GPT-5.6 Sol Pro have given way to discussions of its replacement by GPT-5.6 Terra. Recent mentions primarily position it as a benchmark for new competitor models or in research studies, as seen in clusters like 172547.

与同行对比

GPT-5.5's coverage is increasingly framed by its competition, particularly from Chinese open-weight models like Zhipu AI's GLM-5.2 (cluster 162724) and Moonshot AI's Kimi K3, which are highlighted for outperforming it on coding and offering lower costs. Meta's Muse Spark 1.2 (cluster 192070) also now matches its performance. The narrative for GPT-5.5 is shifting from being a leading model to a comparative baseline.

话题分布

The topic mix for GPT-5.5 has shifted from 'model_release' and initial 'product' capabilities to 'competitor_comparison' and its role as a 'benchmark' in 'research' and 'opinion' pieces. There's also a strong emphasis on 'cost' and 'performance' relative to its successors and rivals, alongside new 'paper/model_release' for competitors.

编辑观点

Our read on GPT-5.5 this cycle is that it has firmly transitioned from a cutting-edge model to a historical benchmark. We see its primary relevance now in how it frames the advancements of its successor, GPT-5.6, and the rapid progress of open-weight competitors. The narrative underscores the relentless pace of AI development, where even a powerful model like GPT-5.5 quickly becomes a reference point for what's next.

常见问题

GPT-5.5 在 OpenAI 的产品线中扮演什么角色?
GPT-5.5 不再是 OpenAI 的尖端模型。它已被 GPT-5.6 系列有效取代,特别是 GPT-5.6 Terra,后者以显著降低的成本提供可比的性能。免费的 ChatGPT 层级已升级到 Terra,通过其继任者使 GPT-5.5 的功能更易于访问,而 GPT-5.5 本身现在更多是一个历史基准。
GPT-5.5 与其继任者 GPT-5.6 系列相比如何?
GPT-5.6 系列代表着一次重大飞跃。虽然 GPT-5.5 功能强大,但 GPT-5.6 Sol Pro 展示了卓越的新颖问题解决能力,解决了一个 GPT-5.5 未能解决的复杂猜想。GPT-5.6 Terra 提供与 GPT-5.5 相似的性能,但价格减半,使其成为更具成本效益的通用选项。这种代际转变突显了能力和效率的快速进步。
哪些竞争模型在哪些特定领域超越了 GPT-5.5?
目前有几个竞争对手超越了 GPT-5.5,尤其是在编码和成本效益方面。智谱AI 的 GLM-5.2 和月之暗面的 Kimi K3 在 SWE-bench Pro 等编码基准测试中表现出卓越的成果。此外,Meta 的 Muse Spark 1.2 以更低的成本达到 GPT-5.5 的性能,而 DeepSeek V4 Pro 等其他模型则提供强大的开源能力和有竞争力的价格。
为什么 GPT-5.5 在人工智能研究和评估中仍然具有相关性?
尽管已被取代,GPT-5.5 作为人工智能研究中的一个关键基准仍然具有相关性。它经常被纳入研究中,例如评估大型语言模型自我偏好的研究,其中模型表现出对其自身输出的偏见。其既定的性能概况使其成为比较新模型和理解人工智能能力及评估方法更广泛趋势的宝贵基线。

相关

最近 · 第 1/10 页 · 共 200 条
  1. RESEARCH · CL_217315 ·

    路透社以较低成本推出专有AI模型

    路透社推出了其自研的专有大型语言模型,名为Thomson。该模型使用其海量的法律和合规数据在内部开发。公司在一个开源基础模型Snowdon(来自伦敦帝国理工学院)上训练了该模型,成本显著降低,据报道低于4000万美元,而前沿模型的成本通常超过1亿美元。路透社旨在将其模型定位为法律、会计和合规领域专业人士在Claude Opus 4.8和GPT 5.5等领先模型之外的一个有竞争力的替代方案,并可能启发其他拥有大型专有数据集的SaaS供应…

  2. TOOL · CL_215947 ·

    GPT-5.5 在手写物理考试评分方面表现出高度一致性

    arXiv 上发表的一项新研究详细介绍了使用 GPT-5.5 对手写物理评估进行评分,包括全国物理奥赛考试和大学量子力学课程。该人工智能模型与官方分数显示出高度相关性(0.91-0.97),并成功识别出奥赛队选拔中的相同前五名学生。虽然对于具有详细评分标准的基于理论的评估有效,但人工智能在精确的部分评分方面面临挑战,尤其是在实验工作中,这表明其最佳用途是在人类监督下作为第二评分者或审计工具。

  3. TOOL · CL_215652 ·

    新的AI工具、工程师角色和成本效益模型涌现

    涌现出几款新的AI工具和模型,包括srelens,一个面向工程师和AI代理的Kubernetes控制室,以及Hister,一个私有内容搜索索引。讨论还涉及产品工程师不断变化的角色,从编码转向解决问题,以及提供模型运行环境的AI代理“马具”概念。值得注意的是,GLM-5.3因其性能和与Anthropic及OpenAI模型相比的成本效益而受到关注,并举例说明了其在夺回平板电脑所有权和逆向工程软件等任务中的应用。

  4. TOOL · CL_215342 ·

    伦敦初创公司Inherent推出AI代理Faraday以复现科学论文

    Inherent是一家总部位于伦敦、由前Google DeepMind研究人员创立的初创公司,已推出Faraday,一款旨在复现科学论文的AI代理。据报道,Faraday在此任务上的表现优于Claude Opus 4.8和GPT-5.5等模型。该代理使用了一个拥有270亿参数的模型,并使用带有“科学密钥”的强化学习进行训练。

  5. RESEARCH · CL_215303 ·

    GLM-5.3 成本更低,性能超越 OpenAI 和 Anthropic 模型 · 跟踪 2 个来源

    据报道,开放权重模型 GLM-5.3 在性能上超越了 OpenAI 和 Anthropic 的模型,同时成本效益显著提高。虽然 GPT-5.5 也被提及为性能表现快速的模型,但其成本被认为是潜在的障碍。该消息突显了人工智能模型领域日益激烈的竞争和不断变化的成本-性能动态。

  6. COMMENTARY · CL_214766 ·

    Inherent 模型声称在 Claude 和 GPT-5.5 之上;Anthropic 面临强烈反对

    一个名为 Inherent 的拥有 270 亿参数的 AI 模型据称在研究复制任务中超越了 Claude 和 GPT-5.5。与此同时,Anthropic 因未经披露对其 Claude Code 产品进行 A/B 测试而受到批评。AI 开发社区也在积极比较各种编码工具,这得益于对透明度日益增长的需求。

  7. RESEARCH · CL_214405 ·

    Inherent AI代理在研究复制方面超越Anthropic和OpenAI

    由前Google DeepMind员工创立的AI实验室Inherent宣布,其AI代理Faraday已成功复制了科学研究成果。据报道,尽管Faraday的规模远小于Anthropic和OpenAI的大型模型,但在该任务上的表现却超越了它们。该公司旨在开发能够发现新科学知识的AI,Faraday通过识别有价值的实验展示了其“研究品味”。

  8. COMMENTARY · CL_212593 ·

    中国人工智能模型在用量上占据主导地位,为美国战略制造“死亡地带”

    在中国OpenRouter平台上,中国人工智能模型的用量已超过美国同行,占据了超过60%的流量。尽管美国实验室在最前沿能力方面仍保持领先,但中国模型提供了显著更低的成本和更高的效率,因此被用于高用量生产工作负载。这种分化为那些既非最前沿也无成本效益的人工智能战略制造了一个“死亡地带”,可能导致美国公司尽管拥有技术领先优势,却在市场份额和开发者兴趣方面遭受损失。

  9. TOOL · CL_211953 ·

    LLM 用于空中交通管制通信的测试

    研究人员探索了大型语言模型(LLM)在空中交通管制(ATC)通信中的应用,这是一个关键的对话系统。他们使用旧金山上空的模拟通用航空飞行进行了实验,设计了五种提示结构来评估 LLM 的性能。研究发现,提供示例对话记录可以提高相似度得分,而过于受限的提示会导致错误累积。将正确的历史记录注入对话流程有助于修复这些错误,概述了当前的局限性以及 LLM 辅助 ATC 的发展路径。

  10. TOOL · CL_206030 ·

    法律AI研究发现不确定性融合能提升信任度而非预测能力

    一篇新研究论文探讨了将各种不确定性量化工具与大型语言模型相结合用于法律案件预测的有效性。研究发现,尽管与直接使用大型语言模型相比,这些流水线并未提高预测准确性,但它们显著增强了系统确定哪些案件可以自动化处理、哪些需要人工审查的能力。研究表明,此类流水线在法律AI中的主要好处不是锐化预测,而是校准系统决策过程中的信任度。

  11. COMMENTARY · CL_204649 ·

    2026年AI模型格局:GPT-5.5、Gemini 3.1 Pro和Claude Opus 4.8将在应用场景上展开竞争

    2026年,主要AI模型的竞争预计将趋于稳定,GPT-5.5、Gemini 3.1 Pro和Claude Opus 4.8将提供可比的价格。文章认为,企业选择AI模型将取决于具体应用场景,而非单一的“最佳”选项。集成能力和特定任务的性能等因素将指导企业的决策。

  12. TOOL · CL_204186 ·

    哈佛和麻省理工学院推出 83 亿个个性化代理以进行发布前测试

    MatrAIx,一个涉及哈佛和麻省理工学院研究人员的合作项目,已发布了 83 亿个个性化代理。这些代理旨在模拟用户交互,使团队能够在公共发布前测试调查、聊天机器人和应用程序。该项目还指出了 GPT 5.5 和 Opus 4.8 等模型在模拟场景中的性能差异。

  13. TOOL · CL_203996 ·

    LLM-Advisor 使用 GPT-5.5 在 MultiTerraPath 基准测试中改进路径规划

    研究人员开发了 LLM-Advisor,一个利用大型语言模型提高复杂地形路径规划效率的框架。该系统利用语义地形上下文提出替代路线,其成本明显低于基线路径,并通过确定性验证确保可行性和成本降低。在 MultiTerraPath 基准测试中使用 GPT-5.5 进行测试时,LLM-Advisor 显著提高了路径规划成功率,在图分辨率较粗糙的地图上恢复了相当一部分成本差距。

  14. TOOL · CL_203495 ·

    SearchAuditor 在修复 AI 代理失败方面优于 GPT-5.5

    一项评估 1,243 次失败的 AI 代理运行的新基准测试表明,SearchAuditor 成功解决了其中 32.3% 的失败。相比之下,基于 GPT-5.5 的审计员仅修复了 26.6% 的问题。这表明当前 AI 代理的可靠性存在显著差距,并可能对开发团队发出警告。

  15. TOOL · CL_202883 ·

    Cisco 开源 AI 发现漏洞成本仅需 1 美元,远低于 GPT-5.5

    Cisco 已开源一个新 AI 模型,该模型能够以低于 1 美元的价格识别漏洞,显著低于 GPT-5.5 等大型模型的成本,据报道完成类似任务需花费 141 美元。这一发展凸显了小型 AI 模型在专业应用中日益增长的效率和成本效益,可能挑战大型、昂贵系统的统治地位。

  16. TOOL · CL_201719 ·

    AI安全研究需要在新的前沿模型上进行定期重新测试

    一个研究项目正在探索在新的前沿模型上系统性地重新运行现有AI安全研究的价值。该计划发现,许多关键的安全属性,例如可监控性和填充令牌的使用,对于GPT-5.5等高级模型仍然适用。研究人员建议,在获得足够资金的情况下,一个人就可以有效地在新兴模型上重新测试这些论文,从而及时了解不断变化的AI安全特性。

  17. RESEARCH · CL_205660 ·

    新框架VibeWorlding使AI能够从文本构建3D世界

    研究人员开发了VibeWorlding,这是一个用于训练和评估多模态智能体的框架,这些智能体能够根据文本提示构建3D开放世界。该系统包括一个基准数据集(VWE-BENCH)和一个强化学习框架(VibeWorlding-Gym)。实验表明,包括GPT-5.5和Qwen3.8-Max在内的当前大型语言模型在此任务上面临挑战,成功率低于60%。然而,强化学习训练显著改进了开源模型,其中VibeWorlder-30B-A3B的表现甚至优于前沿模型。

  18. TOOL · CL_199806 ·

    GPT-5.5、Claude 和 Gemini 中的漏洞允许推断敏感数据

    研究人员在 GPT-5.5、Claude 和 Gemini 等知名人工智能模型中发现了一个漏洞,攻击者可能利用该漏洞推断敏感信息。这种架构缺陷使得模型能够通过特定的查询模式无意中泄露其内部工作原理或训练数据的详细信息。这一发现引发了对部署这些先进人工智能系统的安全和隐私影响的担忧。

  19. RESEARCH · CL_200059 ·

    AI科学家“Faraday”被训练用于复制研究,表现优于Claude和GPT-5.5

    研究人员开发了“Faraday”,一个拥有270亿参数的AI科学家代理,旨在复制科学研究。该代理使用带有编码工具的强化学习进行训练,在复制任务上的表现优于Claude Opus 4.8和GPT-5.5等领先模型。训练过程涉及一个名为“Replica”的可扩展任务空间,该空间向代理提出在无法访问原始图表的情况下重现研究论文中图表的要求,从而鼓励类似开放式科学创新中的假设驱动探索。

  20. RESEARCH · CL_200211 ·

    新基准测试挑战 LLM 在物理适应和动画生成方面的能力

    引入了两个新基准测试 PACE-Bench 和 SimuScene,用于评估大型语言模型在动态和受物理学启发的环境中的能力。PACE-Bench 侧重于在不断变化的环境中通过代码演化进行物理适应性测试,其中 GPT-5.5 在一个子集上取得了 66.7% 的成功率。SimuScene 专门针对受物理学启发的动画的代码生成,即使是顶尖模型也难以应对,表现最好的模型准确率仅为 21.5%。研究人员正在探索模拟器为基础的反射和带有视觉奖励的…