PulseAugur
实时 05:21:16
实体 GPT-5.5 Pro

GPT-5.5 Pro

PulseAugur coverage of GPT-5.5 Pro — every cluster mentioning GPT-5.5 Pro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 12
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-11 research_milestone GPT-5.5 Pro independently solved open problems in number theory and generated research preprints. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_193420 ·

    LLM 代理在社交媒体反应预测中实现高准确率

    一项发表在 arXiv 上的新研究探讨了大型语言模型 (LLM) 代理在模拟社交媒体反应方面的能力。研究人员发现,当提供全面的个人资料时,LLM 代理,特别是 GPT-5.5 Pro,在预测用户反应方面可以达到很高的准确率。然而,当个人资料信息减少时,准确率会显著下降,这凸显了详细用户数据对于有效模拟的重要性。研究还指出,LLM 展现了传统分类器所缺乏的零样本泛化能力,但对于缺乏直接链接到用户个人资料的帖子,其有效性会降低。

  2. TOOL · CL_191066 ·

    OpenCode Zen 用户面临支付和地域封锁问题

    俄罗斯用户因支付问题和地域封锁而难以访问 OpenCode Zen。尽管该服务宣传按使用量付费且无加价模式,但用户报告称他们的卡被拒绝,并且一些请求在网络层面被阻止,无论支付方式如何。这种基础设施级别的阻止似乎是一个更广泛的问题,因为来自其他地区(包括意大利)的用户也遇到了银行卡被拒的情况。地域封锁的确切来源尚不清楚,可能包括 Cloudflare、OpenCode Zen 本身,或 Anthropic 等底层模型提供商。

  3. TOOL · CL_184155 ·

    BotHub提供卢布支付的AI模型访问服务,但价格飙升

    BotHub服务提供对GPT-5.x、Claude Opus和Sonnet以及Midjourney等各种AI模型的访问,用户无需VPN或外国支付方式即可使用卢布支付。该服务使用一种名为“caps”的内部货币,基本版和专业版模型之间的定价差异很大,零售客户和企业客户之间也可能存在差异。用户评论既指出了便利性,也指出了价格的快速上涨,特别是对于较新模型,这导致一些客户不满。

  4. TOOL · CL_167104 ·

    AI 辅助解决 SS--RS--GD 不等式

    一篇新发表在 arXiv 上的论文解决了 SS--RS--GD 不等式,这是 COLT 2021 关于单次洗牌 SGD、随机重排 SGD 和梯度下降算子的一项猜想。研究表明 SS-RS 不等式不成立,并为 n=3 提供了具体的反例。然而,RS-GD 不等式被证明对于定义范围内的对称矩阵是成立的。论文指出,GPT-5.5 Pro 被用于辅助证明。

  5. TOOL · CL_160665 ·

    GPT-5.5 Pro 自主证明 R 上的和积猜想

    一篇新论文详细介绍了一个基于 OpenAI 的 GPT-5.5 Pro 构建的 AI 代理,该代理自主生成了证明 R 上的 Erdős--Szemerédi 和积猜想不成立的证据。该代理在使用一个三阶段提示流程(证明计划提议、构建和审查)的 8 次独立试验中成功生成了 7 个正确证明。这些证明的方法各不相同,有些类似于现有的基于单位的方法,有些则采用了代数整数区域。该系统每次试验平均使用 132.4k 的推理 token,并且相关的代…

  6. TOOL · CL_148761 ·

    OpenAI 将于 7 月 23 日停用包括 Codex 变体在内的旧模型

    OpenAI 定于 2026 年 7 月 23 日关闭对包括多个 Codex 变体在内的 13 个旧模型快照的访问。使用这些模型的开发者,例如 GPT-5.2 Codex,必须将其生产配置和 CI 脚本迁移到 GPT-5.5 等新模型。此过渡不仅仅是简单的查找和替换,因为替换模型具有不同的性能、定价和潜在的架构特征,需要进行彻底的测试和成本分析。

  7. RESEARCH · CL_142148 ·

    GPT-5.6 Sol 在 MineBench 上表现出色但成本高昂

    最近在 MineBench 上进行的基准测试比较显示,GPT-5.6 Sol 能够生成高度详细且富有创意的构建,其质量和规模常常超越 GPT-5.5 Pro 等先前模型。然而,这种增强的输出付出了显著更高的成本,GPT-5.6 Sol 的成本是 GPT-5.5 Pro 的三倍多,但生成的构建数量相同。尽管该模型生成的细节令人印象深刻,但高昂的成本可能使其在许多用例中不切实际。

  8. COMMENTARY · CL_135903 ·

    100万token LLM上下文窗口成本差异达600倍,影响工作负载预算

    大型语言模型中利用一百万token上下文窗口的成本差异巨大,在不同提供商之间观察到的差异高达600倍。对于主要涉及读取大量上下文的工作负载,如RAG或文档摘要,输入token成本是主要因素。例如,一次80万token的输入调用在GPT-5.5 Pro上大约需要24美元,而在Qwen-Flash上则约为0.04美元。这种显著的成本差异凸显了在选择长上下文任务模型之前,根据实际使用量评估输入token定价的重要性,因为质量差异不一定能证明…

  9. COMMENTARY · CL_126385 ·

    LLM API 定价成本差异高达600倍,模型选择成为关键

    LLM API 的定价在不同模型之间出现了巨大的成本差异,价格从每百万输入 token 0.075 美元的经济型选项到每百万 token 30 美元的顶级模型不等。这种高达 600 倍的显著差异意味着,模型选择现在比基础设施决策更成为一个关键的成本节约因素。文章建议根据质量需求对工作负载进行分类,并将其路由到最具成本效益的模型层级,强调鉴于模型命名和定价的快速变化,这一策略至关重要。

  10. TOOL · CL_106333 ·

    GPT-5.5 Pro通过新数据和论点增强学术论文

    Ethan Mollick分享了使用GPT-5.5 Pro分析过往学术论文的经历。该AI模型能够识别新数据、进行分析、创建可复现文件,甚至以复杂的方式扩展论文的核心论点。这种互动凸显了人工智能与学术工作之间不断发展的关系。

  11. COMMENTARY · CL_92950 ·

    Satya Nadella 倡导 AI "前沿生态系统"而非模型

    微软 CEO Satya Nadella 阐述了新的 AI 战略,该战略侧重于构建“前沿生态系统”,而非仅仅关注前沿模型。这种方法强调创建“学习循环”,其中人力资本和代币资本会增值,从而使组织能够拥有其机构知识。该战略旨在确保价值在各行业和国家广泛流动,将重点从选择最佳模型转移到围绕它们构建强大的系统。这一愿景在他的第一篇 X 文章中得到了详细阐述,并与 Microsoft Build 此前的讨论相符。

  12. SIGNIFICANT · CL_82843 ·

    Claude Fable 5 在 AI 编码基准测试中领先,超越 GPT-5.5

    Anthropic 的 Claude Fable 5 已成为领先的 AI 模型,在编码基准测试中显著优于 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 等竞争对手。Fable 5 在 SWE-Bench Pro 上取得了 80.3% 的成功率,远超 GPT-5.5 的 58.6% 和 Gemini 的 54.2%。虽然 Fable 5 的定价高于标准的 GPT-5.5,但对于高性能编码任务而言,…

  13. RESEARCH · CL_82034 ·

    AI代理Moonshine使用GPT-5.5生成数学猜想

    一个名为Moonshine的新自主代理已被开发出来,用于生成数学猜想并取得进展。Moonshine通过提炼新概念和构建理论框架来探索复杂问题。在一个实例中,它提出了神经雅可比猜想,并在GPT-5.5-pro和DeepSeek-V4-pro等先进AI模型的帮助下,为该猜想的一个特定案例开发了证明。

  14. RESEARCH · CL_77501 ·

    DeepSeek 成本低于 GPT-5.5 Pro,微软调整 Copilot 定价

    DeepSeek 的新模型相比 GPT-5.5 Pro 提供了显著更低的每任务成本,DeepSeek 收费仅一美元,而 GPT-5.5 Pro 收费 22 美元。此次定价调整之际,微软正将其 Copilot 服务转向按 token 计费模式。此外,近期研究表明,AI 编码智能体将其大部分处理时间花在审查循环中。

  15. RESEARCH · CL_77001 ·

    DeepSeek V4 Pro 在精确度测试中表现优于 GPT-5.5 Pro

    据报道,DeepSeek 的 V4 Pro 模型在精确度基准测试中已超越 OpenAI 的 GPT-5.5 Pro。这一成就标志着 DeepSeek 在竞争激烈的大型语言模型领域迈出了重要一步。性能的提升使 DeepSeek 成为与成熟模型相抗衡的有力竞争者。

  16. TOOL · CL_76151 ·

    GLM 4.7 生成图像的成本仅为 GPT-5.5 Pro 的一小部分

    在 Mastodon 上分享的一项比较显示,GLM 4.7 仅用 0.0032 美元就生成了一张独角兽图像。据报道,这一成本比使用 GPT-5.5 Pro 的最昂贵尝试便宜 448 倍。GLM 4.7 的图像生成质量也因令人印象深刻而受到关注,这使其成为低成本图像生成模型和工作流程的值得注意的发展。

  17. TOOL · CL_57827 ·

    Claude Opus 4.8 起草学术论文,GPT-5.5 Pro 发现错误

    Ethan Mollick 利用 Anthropic 的 Claude 3 Opus 4.8 及其 Code 环境,从大量已去标识化的研究文件数据集中生成了一篇学术论文。随后,他使用 OpenAI 的 GPT-5.5 Pro 作为审稿人,GPT-5.5 Pro 发现了一个错误和几个小问题,Opus 随后进行了修正。

  18. COMMENTARY · CL_48081 ·

    Ethan Mollick 指出 GPT-5.5 Pro 在事实核查方面表现出色

    Ethan Mollick 发现 GPT-5.5 Pro 是一个有效的工具,可以对大量文本进行事实核查,准确地识别章节中的关键参考文献。他指出,该模型倾向于提供细致入微的响应,常常指出细枝末节,这可能是一个小缺点。尽管如此,该应用似乎是一个强大的信息验证助手。

  19. TOOL · CL_48093 ·

    GPT-5.5 Pro 在学术挑战中尝试生成幽默内容

    人工智能研究员 Ethan Mollick 给 GPT-5.5 Pro 布置了一项独特的学术挑战:分析词对中的幽默感并生成自己有趣的组合。该模型成功生成了诸如“scrotum snorkel”(阴囊潜水镜)和“waffle coffin”(华夫饼棺材)之类的短语。这一练习突显了该模型在超越简单文本生成之外,参与细微语言任务的能力。

  20. TOOL · CL_29136 ·

    小型模型在代理编码基准测试中超越前沿AI

    一项最近的代理编码基准测试显示,更小、更高效的模型在性能上超越了更大、更前沿的模型。SmolLM3 3B 模型能够在笔记本电脑上运行,得分达到 93.3,显著超过了 Grok 4.20 和 DeepSeek V4 Pro 等模型。这表明模型大小可能不是代理编码能力的决定性因素,挑战了之前关于高级任务必须拥有海量参数的假设。