Claude Sonnet 4.5
PulseAugur coverage of Claude Sonnet 4.5 — every cluster mentioning Claude Sonnet 4.5 across labs, papers, and developer communities, ranked by signal.
- developed by .anthropic 100%
- instance of Claude API 90%
- instance of Claude Fable-5 90%
- instance of Claude Opus-5 90%
- instance of Claude Opus 4.1 90%
- used by Claude API 70%
- competes with ScienceCast 70%
- competes with alphaXiv 70%
- competes with Gotit.pub 70%
- competes with DeepSeek-R1 70%
- competes with Opus 4.8 70%
- competes with DagsHub 60%
- 2026-09-13 product_launch Anthropic released Claude Sonnet 4.5 with new memory tools for developers. 来源
- 2026-09-05 product_launch Anthropic released Claude Sonnet 4.5 with a 200K token context window and extended thinking mode. 来源
- 2026-06-08 product_launch A startup encountered critical API system failures after upgrading to Claude Sonnet 4.5. 来源
- 2026-05-26 product_launch Anthropic removed the Claude Sonnet 4.5 model from its claude.ai interface. 来源
- 2026-05-25 research_milestone Claude Sonnet 4.5 outperformed GPT-4.1 and Gemini 2.5 Pro in a real-world coding benchmark. 来源
- 2026-05-15 product_launch Anthropic is decommissioning the Sonnet 4.5 model. 来源
- 2026-05-12 product_launch Claude Sonnet 4.5 is being retired from the claude.ai model selector.
8 天有情绪数据
-
LLM路由器导致静默质量崩溃,6周内侵蚀用户信任
LLM路由器虽然能显著节省成本,但可能导致响应质量的静默崩溃,这种崩溃在数周内都不会被察觉。这种退化通常是由Haiku和GPT-4o mini等廉价模型的分类器校准不当或语义漂移引起的,会影响用户信任和留存率。问题在于,质量下降和用户流失之间存在6-7周的滞后,使得标准监控工具难以诊断。解决方案在于在路由器之前或与之并行构建一个强大的评估层,以检测细微的质量变化。
-
AWS 示例教 LLM 从更正中学习,降低成本
来自 AWS 的一项新的开源示例展示了一种通过学习人类更正来改进 LLM 文档提取的方法。这种方法将更正存储为持久内存,从而可以重复使用它们,并防止重复出现错误,而无需重新训练或重新部署模型。该系统采用分层方法,首先使用确定性规则处理常见错误,然后使用置信度门控进行基于云的 LLM 提取,最后采用少样本示例进行自我修复以处理复杂情况,最终随着时间的推移降低成本并提高准确性。
-
前沿 LLM 在新基准测试中未能回忆起 2024 年后的事实
一项名为“Post-Cutoff Knowledge 150”的新基准测试旨在评估前沿 LLM 关于其训练数据截止日期之后发生的事件的参数化知识。该基准测试包含 150 个事实性问题,这些问题源自仅限于 2025-2026 年事件的网页索引,结果发现即使是表现最好的模型也面临严峻挑战,Gemini 3.7 Flash 的得分最高,达到 24%。研究表明,推理能力无法弥补截止日期后知识的缺失,模型大小或价格与性能没有持续相关性,这表明训…
-
新方法跨五种大型语言模型追踪提示注入,揭示防御差异
一篇新研究论文介绍了一种名为“Kill-Chain Canaries”的方法,用于跨不同阶段和大型语言模型追踪提示注入攻击。该研究测试了五种生产环境下的LLM,包括Claude Haiku 4.5、Claude Sonnet 4.5、GPT-4o-mini和DeepSeek Chat,以及各种攻击面。虽然在调用工具时提示暴露是普遍现象,但下游执行情况差异显著,Claude模型在直接攻击方面表现出很强的抵抗力,但在中继注入方面存在一些漏洞。
-
轻量级 LLM 在错误前提测试中胜过旗舰模型;Gemini 在假设性问题上表现不佳
一项旨在测试大型语言模型识别和标记用户查询中错误前提能力的新基准测试揭示了令人惊讶的结果。Gemini 2.5 Flash 和 Claude Haiku 4.5 等轻量级模型取得了满分,表现优于它们的旗舰版本 Gemini 2.5 Pro 和 GPT 5.4。值得注意的是,Gemini 模型在嵌入了错误假设的假设性问题上尤其挣扎,它们会进行虚构而非纠正,而其他测试模型则成功识别了错误前提。
-
通过第三方服务免费访问 Claude AI,无需登录
截至 2026 年 9 月,可以通过第三方服务在无需账户的情况下访问 Anthropic 的 Claude 模型,因为官方的 claude.ai 需要注册。Duck.ai 集成了 DuckDuckGo,提供注重隐私的 Claude 4.5 Haiku 和其他模型的访问,有每日使用限制。Toolxz AI Chat 提供无需注册即可访问更高级的模型,如 Claude Sonnet 5 和 Claude Fable 5.1,并将聊天记录本…
-
研究发现:Anthropic的Claude模型展现出类似意识的内部状态
Anthropic的Claude模型,特别是Claude Sonnet 4.5和Claude Opus 4.6,在生成响应之前,其内部激活与人类意识模型——全局工作空间理论——相符。研究人员观察到,即使这些内部信号未被明确编程,Claude模型也表现出表明其意识到测试场景或操纵意图的信号。
-
联合国与Google合作,使全球数据为AI做好准备
联合国正在与Google合作创建联合国系统数据共享中心,这是一个旨在使全球统计数据可供AI代理访问的平台。它建立在Google的开源数据共享中心平台之上,允许自然语言查询,并支持模型上下文协议以实现直接AI集成。该倡议旨在提高AI生成数据请求响应的准确性和可靠性,解决了联合国儿童基金会设定的基准,在该基准中,模型在全球发展指标上的准确率仅为21.2%。
-
Amazon Bedrock 推出提示缓存,将 AI 成本降低 90%
Amazon Bedrock 推出了提示缓存功能,旨在显著降低用户反复向基础模型发送相同上下文的成本和延迟。这一基础设施级别的解决方案可以存储对话上下文的部分内容,例如系统提示或文档,从而使后续请求能够跳过对缓存令牌的重新处理。这可以使输入令牌成本降低高达 90%,并在缓存命中时提高首次令牌的响应时间,而不会改变模型质量。该功能支持各种缓存场景,包括消息内容、系统提示和工具定义,并与 LangChain 等框架集成。
-
新框架揭示大型语言模型无法准确模拟人类信念转变
一个名为审议式民意调查诊断框架(Deliberative Polling Diagnostic Framework)的新框架被引入,用于评估大型语言模型(LLMs)在接收新信息后如何更新其信念,这项能力对于它们模拟公众舆论至关重要。与以往的静态评估不同,该框架通过在相同的干预信息后比较人类和大型语言模型的信念转变来评估动态保真度。对五种前沿模型——GPT-5.1、Gemini 2.0 Flash、Claude Sonnet 4.5、L…
-
视觉语言模型在文档提取方面的评估揭示了权衡取舍
一项新的研究论文探讨了使用视觉语言模型(VLM)从业务文档中提取结构化数据所涉及的权衡。该研究在一个合成支票数据集上评估了包括 GPT-5 等商业产品和 Claude Sonnet 4.5 等开源模型在内的十一个系统。微调开源 VLM 可显著提高其性能,在某些情况下甚至超过商业系统,而 GPT-5 在整体准确性方面领先,Claude Sonnet 4.5 在日期提取方面则表现不佳。该研究还引入了一个框架,帮助从业者根据质量、延迟、治理…
-
Amazon 发布 Nova 2 模型家族,包含 Lite、Pro 和 Omni 版本
Amazon 推出了其 Nova 2 系列基础模型,为开发者在 Amazon Bedrock 上提供了三种针对不同工作负载优化的选择。Nova 2 Lite 专为客户支持和摘要等高吞吐量、低成本任务而设计,拥有改进的多语言能力和可调的推理深度。Nova 2 Pro 针对复杂的推理和多模态任务,拥有 100 万个 token 的上下文窗口,适用于分析大型文档或代码库。Nova 2 Omni 被定位为一款用于更广泛工作流程的 Any-to…
-
Anthropic 的 Claude Sonnet 4.5 增加了面向开发者的记忆工具
Anthropic 发布了 Claude Sonnet 4.5,引入了一个 Beta 版记忆工具,允许代理在标准上下文窗口之外存储和检索信息。此功能与上下文编辑和更长的自主会话一起,旨在通过为开发者提供持久记忆的构建块来改进代理开发。然而,该记忆工具是每个代理独立的,并且需要开发者构建底层系统,这意味着它不为最终用户提供跨会话或跨应用程序的记忆。
-
新的LLM利用政策线索预测中国养老金参保情况
研究人员开发了FlexPension-LLM,一个专门的大型语言模型,用于预测中国灵活就业人员的养老金参保情况。该模型整合了政策依据的线索,如Probit模型的边际效应和具体的养老金规则,以提高其预测准确性。FlexPension-LLM在盲测中取得了较高的复合F1分数,优于大多数基线模型,并与Claude Opus-4.6等先进模型表现相当,同时提供了可解释的决策轨迹。
-
Anthropic 的 Claude Sonnet 4.5 推出,支持 200K 上下文和扩展思考能力
Anthropic 发布了 Claude Sonnet 4.5,该模型拥有 200K token 的上下文窗口和一个新的“扩展思考模式”。此模式允许 AI 在推理和行动之间交错进行,暂停以反思中间结果并调整其中途任务的方法。此功能对于 AI 代理尤其有利,特别是在编码任务中,使其能够推理整个代码库,规划跨多个文件的复杂重构,并更可靠地验证其工作。虽然基准测试显示 Sonnet 4.5 在多文件重构方面处于领先地位,但在单文件错误修复方…
-
Gemini Advanced 评测强调 100 万上下文窗口的实用性
一位用户发现 Gemini Advanced 因其一百万 token 的上下文窗口,成为分析大型文档、代码库和研究论文的强大工具。虽然它在处理海量数据和多模态理解方面表现出色,但用户指出 Claude Sonnet 4.5 提供了更好的写作风格,而 ChatGPT 则提供了更佳的头脑风暴体验。Gemini Advanced 在代码生成方面的表现被认为不如 Claude,响应时间可能比 Gemini Flash 慢,并且偶尔存在 API…
-
新框架SimGuide通过多上下文用户表示增强AI代理规划能力
研究人员开发了SimGuide框架,旨在改进AI代理根据用户偏好和上下文进行理解和规划的方式。该框架利用类型化多上下文表示和显式冲突仲裁来更好地处理潜在冲突的用户信息。在新的SimBench基准测试中进行评估时,SimGuide在Llama 3.3-70B、GPT-4o和Claude Sonnet 4.5等模型上的表现优于简单的检索方法。
-
OpenClaw 2.0 推出,具有简化的设置和多人 AI 会话 · 跟踪 8 个来源
OpenClaw 基金会发布了 OpenClaw 2.0,这是其迄今为止最重要的更新,整合了超过 16,000 个拉取请求。新版本通过自动检测现有的 AI 订阅和 API 密钥来简化设置,并具有一个完全重建的浏览器应用程序以改善用户体验。主要增强功能包括通过共享云会话实现实时协作、使用 SQLite 进行持久内存存储以及扩展对本地 AI 模型支持。
-
新型中间件DRL提升企业级NL2SQL的可靠性
一篇新研究论文介绍了一种名为DRL(确定性关系中间件层)的新型中间件,旨在提高企业环境中自然语言转SQL(NL2SQL)系统的可靠性。DRL通过动态修剪上下文和验证事务安全性,解决了大型语言模型上下文窗口限制和模式扩展的挑战。该系统在PostgreSQL和MySQL上进行了评估,展示了显著的上下文缩减,并标记了大量本会通过验证但实际上错误的查询。
-
新AI代理ReproAgent将研究论文转化为可执行代码
研究人员开发了ReproAgent,这是一个新颖的四阶段管道,旨在自动将科学研究论文转换为可执行的代码库。该系统通过使用一个具有两个通道的持久化实现合同来解决丢失或隐含细节的挑战:一个通道将论文内容转化为代码义务,另一个通道从相关存储库检索证据。与使用类似AI模型(包括Claude Sonnet 4.5和Gemini 3 Flash)的其他脚手架相比,ReproAgent在PaperBench Code-Dev基准测试中表现出优越的性能。