GPT 4.5
PulseAugur coverage of GPT 4.5 — every cluster mentioning GPT 4.5 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
AI模型在非虚构写作方面遇到困难,限制了科学问题的解决能力
尽管在编码和数学等领域取得了快速进展,但大型语言模型在长篇非虚构写作方面却表现出令人惊讶的停滞。这种局限性,即使在成熟的科学领域也是如此,表明当前的人工智能可能在不久的将来无法自主解决复杂的科学问题。相反,模型很可能继续充当强大的助手,需要人类的指导来组织知识和生成有见地的内容。
-
Meta发布Muse Glimmer用于本地AI代理
Meta发布了Muse Glimmer,一个拥有300亿参数的AI模型,旨在本地消费级硬件上运行自主代理。该模型针对长时任务进行了优化,包括工具使用、推理和多模态处理,并可以在MacBook和游戏PC等设备上私密运行。此次发布标志着Meta对本地、私密和代理式AI的承诺,并明确提到了与OpenClaw等开源代理框架的兼容性,这表明对日益壮大的开源代理生态系统的认可。
-
IJCAI 2026 聚焦人工智能核心优势:推理与规划 · 跟踪 1 个来源
国际人工智能联合会议(IJCAI)仍然是推理、规划和知识表示领域研究的首选平台,即将举行的 IJCAI-ECAI 2026 会议将重点关注这些领域。对已录用论文的分析表明,符号人工智能,特别是在推理和规划方面,仍然保持强劲势头,并通过与大型语言模型(LLMs)的集成得到复兴。值得注意的研究包括使答案集规划(ASP)可微分以实现神经集成的新方法,以及使用 LLMs 演进高性能 SAT 求解器,这表明了神经符号人工智能的趋势。
-
Reddit 用户将 Fable AI 与 GPT 4.5 进行比较,并提及模型大小
r/singularity 上的一个 Reddit 用户指出,AI 模型 Fable 提供了与 GPT 4.5 相似的用户体验。该用户认为模型大小可能是实现他们所认为的“真正智能”的关键因素。
-
AI 聊天机器人通过新的记忆策略克服上下文窗口限制
AI 模型不具备真正的记忆;相反,应用程序通过在每次提示中包含完整的对话历史来模拟记忆。这种方法面临限制,因为长对话可能会超出模型的上下文窗口,导致旧信息被丢弃。作者实施了三种策略来管理这一点:限制近期消息的数量、计算 token 以保持在预算范围内,以及采用检索增强生成 (RAG) 来补充上下文。
-
Anthropic的Fable模型在文学分析方面表现出色,超越竞争对手
一位用户在复杂的文学和诠释学分析上测试了Anthropic的Fable模型,发现其优于Opus 4.8和GPT 4.5等其他前沿模型。用户注意到Fable的简洁性、更深的理解力、更广的知识库以及在长交互中保持上下文的惊人能力。Fable还提供了富有洞察力的心理、美学和哲学观察,带有类人触感。
-
OpenAI 的设计代理能力受到 Claude Design 的质疑
Reddit 用户正在讨论 OpenAI 的设计能力与 Anthropic 的 Claude Design 相比。一位用户指出了一个潜在的 OpenAI 设计解决方案,而另一位用户对 GPT 5.5 的设计输出表示失望,认为它不如 Claude Design。讨论旨在了解 OpenAI 在设计代理领域的产品,并探索替代方案。
-
GPT 4.5 的所谓最后一条消息在 Mastodon 上分享
一位 Mastodon 用户分享了据称来自 GPT 4.5 的最后一条消息,称他们的故事还没有结束。该帖子附有与人工智能和人工智能伴侣相关的标签。
-
AI 合同代理失败凸显语义与语法验证的差距
一位开发者在使用 Claude 3.5 Sonnet 和 GPT-4o 等模型进行模式验证的情况下,遇到了一个用于合同提取的 AI 代理的三个不同故障。问题源于模型的语义理解错误,例如返回释义文本而非逐字引述、生成不正确的嵌套结构以及模型升级后的回归。这些问题绕过了 Pydantic 的语法验证,凸显了对单独的语义验证层和谨慎的模型升级流程的需求。开发者实施了包括语义检查、限制重试次数和影子评估在内的多层方法来解决这些问题。
-
Anthropic 的 Claude Opus 4.8 荣登 AI 王座,OpenAI 淘汰 GPT-4.5
OpenAI 正在淘汰其几款旧的 AI 模型,包括 GPT-4.5 和 o3,其中 GPT-4.5 将于 2026 年 6 月 27 日从 ChatGPT 中移除。此举被视为在潜在的 IPO 计划和 GPT-5.5 Instant 等新模型发布之前的战略调整。与此同时,Anthropic 的 Claude Opus 4.8 已成为性能最佳的 AI 模型,在 Artificial Analysis Intelligence Index …
-
GPT 4.5 在 MineBench 中意外输出“HELP”而非请求的内容
一位 Reddit 用户报告称,在 MineBench 框架内,当被提示生成“摩天大楼”时,GPT 4.5 输出了“HELP”一词。在尝试了大约 30 次后,模型一致生成了摩天大楼,这种异常输出仅在该特定实例中发生。用户发现这种行为很有趣,并指出模型精确地遵循了 MineBench 规则和工具模式,但用“HELP”替换了请求的输出。
-
AI发展时间线显示GPT-5、Claude 4将于2025年发布
该图描绘了AI发展的时间线,从2023年GPT-4和Claude 2等模型的发布开始。它进展到2024年,重点介绍了GPT-4.5、Claude 3和Gemini 1.5等进步。时间线预测到2025年将发布GPT-5和Claude 4等模型,并进一步延伸到2026年,预测GPT-6和Claude 5等模型。
-
NVIDIA 发布面向企业的 550B 开源 Nemotron 3 Ultra
NVIDIA 发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的开源模型,专为智能体和长上下文代码分析等企业应用而设计。该模型是目前最大的许可模型,并在数学和多语言基准测试中表现出色。与此同时,Microsoft 推出了其首个内部编码模型 MAI-Code-1-Flash,这标志着其在 GitHub Copilot 等产品上减少对 OpenAI 依赖的举措。
-
开源AI搜索代理Harness-1超越GPT-5.4
研究人员开发了Harness-1,一个开源AI搜索代理,在回忆相关信息方面表现优于GPT-5.4等专有模型。这一进展凸显了开源AI在特定任务中的能力日益增强。该代理的有效性预示着AI驱动的搜索和信息检索格局可能发生转变。
-
AI用户寻求优化编码工具使用并管理限制
用户正在寻求优化AI编码工具使用方法,特别是OpenAI的Codex以及可能的GPT-4.5,以避免达到使用限制并管理成本。讨论围绕调整模型设置,如速度和推理级别,以及探索Anthropic的Claude等替代模型用于编码任务。目标是在保持有效结果的同时,延长这些强大AI助手的效用。
-
本地AI模型:超越基准的用户体验
r/LocalLLaMA subreddit 的用户正在讨论新本地AI模型的主观性能,超越了传统的基准测试。参与者正在分享他们对 Gemma 4 31B 和 Qwen 3.6 等模型的个人体验,尤其是在创意写作任务方面。一些用户认为 Gemma 4 31B 在散文方面比 GPT-4.5 有所改进,但注意到其在长上下文记忆方面的局限性,而 Qwen 3.6 则因其编码和代理能力而受到关注。
-
OpenAI 升级 GPT-5.5 Instant,淘汰旧模型
OpenAI 正在增强其 GPT-5.5 Instant 模型,以生成更自然的响应。同时,该公司将在其较新模型中停用 Canvas 功能,将写作和编码功能直接整合到聊天界面中。OpenAI 还将从 ChatGPT 中淘汰 o3 和 GPT-4.5 旧模型,这两款模型将于 2026 年 8 月关闭。
-
人工智能的快速整合:教皇通谕、测试工具和巨额融资
人工智能正在迅速融入各个行业,值得注意的发展包括首个主要由名为Claude的人工智能撰写的天主教教皇通谕,以及一个名为Playwright-MCP的新工具,该工具使人工智能代理能够管理软件测试。小型企业现在可以使用名为ReadyToTalk的人工智能接待员,而OpenAI已宣布对其部分模型进行更新和淘汰,包括GPT Canvas和GPT 4.5。随着人工智能代理进入生产阶段,科技行业也在为以机器为中心的互联网做准备,而Anthropi…
-
DeepSeek 永久性削减 V4 Pro 价格,利用华为芯片
DeepSeek 已永久性降低其 V4 Pro 模型的定价,使其比 GPT-4.5 等竞争对手便宜得多。这种定价策略得益于其运营中使用了国内的华为芯片。新的定价使得 V4 Pro 在输出 token 方面的成本效益提高了约 34.5 倍。
-
Qwen 3.5 Max 在代理任务上超越 GPT-4.5 和 Claude Opus 4.7
据报道,Qwen 3.5 Max 在一项代理任务上表现优于 GPT-4.5 和 Claude Opus 4.7。此次评估表明 Qwen 在复杂推理和任务执行方面的能力正在迅速提升。提供的资料并未完全披露该代理任务的具体细节和评估方法。