Claude Sonnet 4.5
PulseAugur coverage of Claude Sonnet 4.5 — every cluster mentioning Claude Sonnet 4.5 across labs, papers, and developer communities, ranked by signal.
- developed by Anthropic 100%
- instance of Claude Fable-5 90%
- instance of Claude Opus 4.1 90%
- competes with DagsHub 70%
- used by Claude API 70%
- competes with Gotit.pub 70%
- competes with alphaXiv 70%
- competes with ScienceCast 70%
- competes with DeepSeek-R1 70%
- competes with Opus 4.8 70%
- used by ScienceCast 60%
- used by Gotit.pub 60%
- 2026-06-08 product_launch A startup encountered critical API system failures after upgrading to Claude Sonnet 4.5. 来源
- 2026-05-26 product_launch Anthropic removed the Claude Sonnet 4.5 model from its claude.ai interface. 来源
- 2026-05-25 research_milestone Claude Sonnet 4.5 outperformed GPT-4.1 and Gemini 2.5 Pro in a real-world coding benchmark. 来源
- 2026-05-15 product_launch Anthropic is decommissioning the Sonnet 4.5 model. 来源
- 2026-05-12 product_launch Claude Sonnet 4.5 is being retired from the claude.ai model selector.
18 天有情绪数据
-
Intent Engine 将自然语言翻译为 SLO,减少错误
一种名为 Intent Engine 的新架构已被开发出来,用于将自然语言意图翻译为计算连续体服务放置的已验证服务级别目标 (SLO)。该系统旨在克服传统指标级别约束相关的采用障碍和错误配置风险。通过结合模式约束提取、检索增强值构建和验证,Intent Engine 可显著减少错误和下游放置失败。
-
Anthropic 修复了美国境内 Claude 推理成本的 10% 低估问题
Anthropic 已将其 Claude Code CLI 更新至 2.1.239 版本,解决了导致美国境内工作空间推理成本被低估 10% 的错误。此修复确保 CLI 准确反映 Anthropic 对 Claude Opus 5 及更高版本模型在美国境内推理收取的 1.1 倍溢价。此更改会影响成本估算、状态行和预算上限,可能导致那些工作空间在未明确配置的情况下自动迁移到美国境内推理的用户收到高于预期的账单。
-
Claude AI用户报告幻影使用量消耗和模型差异
Anthropic的Claude AI用户报告称,即使在未主动提示模型的情况下,他们的5小时使用限额也出现了意外的消耗。这种“幻影消耗”似乎仅仅通过浏览界面、查看过往聊天记录或与Project Knowledge功能互动就会发生。一些用户还注意到,尽管他们打算使用Claude Opus 5,但Claude Sonnet 4.5的使用量却被记录下来,这引发了关于模型降级或遥测数据不准确的疑问。
-
斯坦福论文发现:小型语言模型挑战云端AI主导地位
斯坦福大学的一项最新研究论文表明,小型语言模型(SLMs)在多项任务上正变得与大型云端前沿模型相媲美。研究发现,可在本地硬件上运行的SLMs在98.6%的聊天任务和62.5%的推理任务中,表现与大型语言模型(LLMs)相当或更优,并且在过去两年中推理能力有了显著提升。这一趋势可能大大降低对大型数据中心的需求,并可能影响AWS、Azure和Google Cloud等超大规模云服务提供商,以及Nvidia等GPU制造商,还有基础模型公司的估值。
-
本地 AI 模型现仅落后前沿技术 9 个月
本地大型语言模型正迅速缩小与前沿模型的差距,目前仅落后约九个月。这一进展表明,许多 AI 驱动任务的成本将在不久的将来显著下降。专家预测,在短时间内,高级 AI 功能可能像现在的文字处理软件一样,预装在笔记本电脑等消费设备上。
-
Pairwise ranking beats RL for LLM explanation selection in recommendation systems
研究人员开发了一种从大型语言模型(LLM)中选择推荐系统解释的新方法,显著降低了服务成本和延迟。通过预先生成解释池并使用驻留在CPU上的选择器,该系统无需GPU即可在100毫秒内响应。研究发现,成对学习排序方法(特别是LambdaRank)在选择最佳解释方面优于单动作强化学习方法,在基准数据集上取得了更高的F1分数。
-
GenAI模型在OOP评估中表现优于学生,但在高级概念方面仍有困难
一项发表在arXiv上的新研究评估了五种领先的生成式AI系统在入门面向对象编程评估中的表现,包括ChatGPT 5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot。研究发现,所有评估的AI模型都显著优于平均学生群体,在复杂的编码任务中经常获得满分。然而,这些模型仍然存在局限性,偶尔会生成无法编译的代码,并且在抽象类和某些继承场景等高级面向对象概念以及图形相关问…
-
Anthropic 更新 Claude 系统提示词,不包括 API 用户
Anthropic 正在更新其 Claude 模型的系统提示词,这些提示词用于其网页界面和移动应用程序。这些更新旨在提供更当前的信息,例如日期,并鼓励特定的行为,如使用 Markdown 格式的代码片段。重要的是,这些系统提示词的更改不适用于 Claude API,这意味着 API 用户将不会看到相同的行为更新。
-
开源LLM在急诊科决策支持方面展现潜力
一项新的基准研究评估了八个开源小型语言模型(SLM)在急诊科(ED)决策支持方面的表现,并将其与Claude Haiku 4.5和Claude Sonnet 4.5等商业模型进行了比较。研究发现,使用低秩适配(LoRA)微调的SLM在预测分诊级别和推荐专科转诊方面优于商业基线模型。虽然诊断预测对开源SLM来说仍然是一个挑战,但微调后的模型能够识别出商业替代品所忽略的高危患者,表明它们在本地急诊科环境中具有临床竞争力的潜力。
-
新框架 TTP-R1 增强网络威胁情报分析
研究人员开发了 TTP-R1,一个新颖的两阶段框架,旨在改进从网络威胁情报 (CTI) 文本中提取攻击技术。该框架结合了检索增强监督微调和强化学习,使用可验证的奖励直接监督预测技术集的精度、召回率和格式。TTP-R1 的性能显著优于现有方法,在使用检索增强的情况下,其在子技术级别的 F1 分数比 Claude Sonnet 4.5 提高了 7.4 个百分点,同时运行速度也快得多。
-
提示缓存将 Claude API 成本削减 85%
一位开发者详细介绍了一种提示缓存策略,该策略显著降低了他们使用 Anthropic 的 Claude 3.5 Sonnet 模型的 API 成本。通过实施提示缓存(存储和重用常见的提示前缀),该开发者的日常开销减少了 85%,从 47 美元降至 6.80 美元。此方法对于发送给几乎所有 API 调用的大型系统提示、工具定义和少量示例特别有效,通过缓存令牌的折扣费率实现可观的节省。
-
临床医生输入引导 AI 做出准确和有害的医疗推荐
arXiv 上发表的一项新研究调查了临床医生输入如何影响大型语言模型 (LLM) 在临床环境中的推荐。研究人员发现,临床医生的推理显著提高了 AI 生成的鉴别诊断和推荐的准确性,但在输入具有误导性时,也会放大有害建议。该研究使用精选的医疗病例记录测试了八种不同的 AI 模型,包括 GPT-5、Claude Sonnet 4.5 和 Gemini 3 Flash。研究结果表明,虽然专家临床医生的输入可以提高 AI 的性能,但对抗性输入构…
-
渥太华大学使用Gemini和Claude LLM赢得拉丁语NER任务
渥太华大学的研究人员在古典拉丁语的EvaLatin 2026命名实体识别(NER)共享任务中取得了顶级成果。通过采用大型语言模型Gemini 2.5 Pro和Claude Sonnet 4.5的提示工程,他们证明了跨语言迁移学习对于代表性不足的古代语言的有效性。他们的系统在粗粒度和细粒度NER子任务中均获得第一名,在各种评估指标上均优于所有其他提交。
-
Anthropic淘汰旧版Claude模型,引入API参数变更
Anthropic正在淘汰多个旧版Claude API模型和端点,截止日期从2026年8月到2026年11月不等。值得注意的是,Claude Opus 4.1已于早些时候退役。伴随这些弃用,Anthropic正在实施请求参数的更改,例如在Claude Opus 4.7及更新版本等较新模型上不允许使用非默认的temperature、top_p和top_k设置,如果使用这些设置将导致400错误。这些更改要求开发者更新其API调用,以避免生…
-
新的PIMiner系统可自动进行LLM提示注入红队测试
研究人员开发了PIMiner,一个用于大型语言模型自动提示注入红队测试的代理系统。与现有方法常常难以泛化不同,PIMiner在训练过程中从头开始构建了一个可转移的策略库。该库可以以最少的查询应用于新的、未见的模型。实验表明,PIMiner在IPIArena和AgentDojo等基准测试中,对Gemini 2.5 Pro、GPT-5.1和Claude Sonnet 4.5等模型取得了显著的攻击成功率。
-
AI 伴侣应用 LUMA SOUL 锁定创作者编辑权,提供透明记忆
一位开发者创建了 LUMA SOUL,这是一款旨在赋予 AI “视频化身”的应用程序,拥有独特的肖像、声音和持久的“灵魂文档”。一个关键的设计选择是,一旦 AI 被提交,创作者将永久失去编辑权,从而确保 AI 的个性保持一致。该应用还具有透明的记忆管理功能,向用户展示 AI 上下文中确切的内容,并允许会话可恢复、可导出,并附有连续性摘要。
-
新框架AdaMARP提升LLM角色扮演沉浸感
研究人员开发了AdaMARP,一个新颖的自适应多智能体交互框架,旨在增强大型语言模型(LLM)角色扮演场景的沉浸感和适应性。该框架引入了一种沉浸式消息格式和一个场景管理器来管理角色扮演动作、场景转换和角色介绍。实验表明,AdaMARP,特别是使用8B actor模型时,提高了角色一致性和叙事连贯性,并且一个使用AdaSMSet的14B LLM在协调角色扮演交互方面优于Claude Sonnet 4.5。
-
大型语言模型在专业翻译方面展现潜力,但无法取代语料库
一篇新发表在arXiv上的研究评估了大型语言模型(LLMs)在协助专业译者进行英译法术语翻译方面的有效性。该研究测试了GPT-4o、GPT-5.2、Claude Sonnet 4.5和DeepSeek四种模型,涵盖地球、环境与行星科学(EEPS)以及自然语言处理(NLP)领域。结果显示,模型性能和提示策略存在显著差异,Claude Sonnet 4.5在最佳条件下表现最佳,而DeepSeek则显示出更一致的结果。尽管大型语言模型可以成…
-
小型AI模型通过Agentic工作流实现前沿LLM性能
研究人员开发了DeepLens Diagnosis Agent,这是一个新颖的五阶段管道,旨在增强小型、专业化AI模型的诊断推理能力。该Agentic工作流结合了检索增强生成(RAG)和结构化临床提取,显著提升了JSL Medical Small 7B v2模型的性能。在DiagnosisArena基准测试中,该Agent实现了60.14%的Top-1诊断准确率,远高于基础模型的23.99%。此外,与Claude Sonnet 4.5…
-
Anthropic 的 Claude API 免费套餐是暂时的,而非永久的
本文认为,Anthropic 的 Claude API 的免费套餐访问并非永久性提供,而是有限的试用或促销积分。文章指出了混淆不同类型“免费”访问的常见错误,例如试用积分、免费的基于网络的 Claude.ai 套餐(缺少 API 访问权限)以及提供临时免费积分的特定项目,如“Claude for Startups”。作者提出了一个“访问注册”系统来跟踪这些依赖关系,确保在这些临时免费访问条件到期时,产品发布不会悄无声息地中断。