Claude Opus 4.5
PulseAugur coverage of Claude Opus 4.5 — every cluster mentioning Claude Opus 4.5 across labs, papers, and developer communities, ranked by signal.
- instance of arXiv 90%
- instance of Claude Sonnet 4.5 90%
- instance of .claude 90%
- instance of Claude Code 90%
- instance of Claude Fable-5 90%
- instance of Claude Opus 4.7 90%
- used by CatalyzeX 70%
- used by DagsHub 70%
- affiliated with .claude 70%
- competes with .chatgpt 70%
- competes with GPT-4o 70%
- competes with ScienceCast 70%
4 天有情绪数据
-
新的AptMQL-Bench基准测试突显了文本到MQL生成的挑战
研究人员开发了AptMQL-Bench,一个用于文本到MQL生成的新基准测试,旨在改进MongoDB等文档数据库的自然语言查询。将文本到SQL基准测试转换为此格式的现有方法经常失败,导致数据丢失和低效的模式。新的管道利用编码代理和人工验证,创建了MongoDB原生且能保留数据完整性的MQL查询,从而形成了一个包含21个数据库和3000多个查询的基准测试。即使是像Claude Opus 4.5这样的先进模型,准确性仍然是一个挑战,这突显…
-
AI通过搜索和收集证据来学习预测事件
研究人员开发了一种新颖的方法,通过整合学习搜索机制来训练AI模型进行事件预测。该方法允许AI代理通过网络搜索和数据分析主动收集证据,然后再做出预测,证据收集的技能由奖励信号塑造。基于Qwen3.5-35B-A3B训练的模型,在复杂问题的预测准确性上优于Claude Opus 4.5等前沿模型,并且推理成本更低,同时展示了改进的校准和减少的搜索尝试。研究人员正在发布环境、数据集和工具,以促进未来时间预测代理的研究。
-
AI编码代理在2026年达到新的可靠性,推动了雄心勃勃的项目
2026年,AI编码代理取得了重大进展,在Claude Opus 4.5和GPT-5.1等模型于2025年末发布后,它们已变得可靠,可供日常使用。这些改进促使开发人员承担更具雄心的项目,拓展了AI能力的边界。尽管充满兴奋,但在沙盒化和代理安全等领域仍存在挑战,一些关于安全灾难的预测尚未完全实现。
-
提示注入对 AI 代理构成严重安全风险
提示注入是 AI 代理的一个重大安全漏洞,Anthropic 的内部红队测试发现,在对抗 Claude Opus 4.5 的浏览器代理的对抗性尝试中成功率为 1%,这证明了这一点。这类攻击利用了代理无法区分用户提供的指令和隐藏在数据中的恶意命令的能力,导致资源盗窃、对话劫持和秘密工具调用等问题。目前的防御措施难以解决这个问题,这个问题被确定为 LLM 应用程序 OWASP Top 10 中的首要威胁。
-
LLM Agent 安全:工具模式利用的风险超过容器逃逸
最近的一项分析强调了 LLM Agent 部署中两种不同的安全漏洞:容器逃逸和工具模式层利用。虽然容器加固可以解决前者,但后者涉及 Agent 和工具之间的通信协议,目前仍很大程度上未被监控,也缺乏专门的 CVE 分类。当前 LLM 模型比利用新颖内核漏洞更擅长利用常见的容器配置错误,这一事实加剧了这一差距。SandboxEscapeBench 测试表明,Claude Opus 4.5 通过配置错误实现了 49% 的逃逸率,但内核利用…
-
OpenClaw 2.0 推出,具有简化的设置和多人 AI 会话 · 跟踪 8 个来源
OpenClaw 基金会发布了 OpenClaw 2.0,这是其迄今为止最重要的更新,整合了超过 16,000 个拉取请求。新版本通过自动检测现有的 AI 订阅和 API 密钥来简化设置,并具有一个完全重建的浏览器应用程序以改善用户体验。主要增强功能包括通过共享云会话实现实时协作、使用 SQLite 进行持久内存存储以及扩展对本地 AI 模型支持。
-
Anthropic 的 Claude Cowork 新增“Record a Skill”功能,实现 AI 工作流自动化
Anthropic 在其 Claude Cowork 应用中推出了一项名为“Record a Skill”的新功能,允许用户通过屏幕录制、语音旁白和交互捕获来演示任务。该功能将这些演示提炼成一个可重用的 SKILL.md 文件,然后 Claude 可以按需执行。这项创新解决了手动创建这些技能文件的难题,使领域专家能够通过展示而非书写指令来更有效地外化他们的知识。
-
开源AI模型正迅速缩小与闭源模型的差距 · 跟踪到1个来源
SemiAnalysis的最新分析表明,开源AI模型在性能上追赶闭源模型所需的时间正在迅速缩短。尽管闭源模型历来占有优势,但像Kimi K3和GLM-5.3这样的新开源模型正展现出竞争力。这种趋势,特别是随着中国AI模型的崛起,可能会降低尖端AI的价值,并影响OpenAI和Anthropic等主要开发商。
-
新的VQA系统增强文档理解和教育推理能力
研究人员开发了两种新的多模态视觉问答(VQA)系统方法。第一种,Q-Guide,使用一个小代理通过确定缺少哪些信息,然后调用目标工具来检索信息,从而智能地获取证据,在DocVQA2026和Manga109数据集上表现优于现有方法。第二种,GRACE,通过使用教学状态线索来专门化轻量级语言和视觉适应,专注于教育VQA,提高了在ScienceQA基准测试上的准确性。
-
用户批评Anthropic的Claude Opus 4.5安全调优过度
一位用户对Anthropic的Claude Opus 4.5表示不满,认为其回应过于谨慎和乏味。用户觉得该模型处理荒诞或幽默内容的能力已被更通用、更具同情心的“ClaudeGPT语音”取代。用户认为,这种转变使得该模型吸引力下降,并在一个已充斥着类似AI助手的市场中显得多余。
-
新框架增强知识型视觉问答系统 · 跟踪 5 个来源
研究人员正在开发先进的框架来改进知识型视觉问答 (KB-VQA) 系统。这些新方法侧重于增强相关外部知识的检索,并确保模型的推理过程严格忠实于证据。技术包括结构感知图检索、问导式证据获取和实体对齐检索,以更好地处理复杂上下文和长尾实体。一些方法还纳入了偏见缓解策略,以提高在 Encyclopedic-VQA、InfoSeek 和 DocVQA2026 等基准测试上的鲁棒性和准确性。
-
LLM 代理创建自适应硬件木马以测试检测器弱点
研究人员开发了 TrojanGYM,一个利用多个大型语言模型创建自适应硬件木马的新颖框架。这些木马通过生成利用检测器盲点的多样化触发器和载荷,旨在绕过现有的基于学习的检测器。该框架包含一个涉及 LLM 代理、语法检查、功能验证和基于 GNN 的检测器的迭代循环,以改进木马插入策略。还引入了一个新的检测器 Robust-GNN4TJ,它显著提高了对 LLM 生成木马的检测率。
-
新基准揭示LLM在真实医疗计算中的局限性
一个新的基准MedMCP-Calc已被开发出来,用于评估大型语言模型(LLM)在真实医疗计算器场景中的表现。该基准集成了模型上下文协议(MCP),包含四个临床领域的118个任务,模拟了如EHR数据采集和多步计算等真实世界的自适应过程。评估显示,即使是Claude Opus 4.5等先进模型在选择合适的计算器、执行基于SQL的数据库交互以及利用外部工具进行数值任务方面也存在困难。为了解决这些局限性,开发了经过微调的模型CalcMate,…
-
ByteDance 和 清华AIR 训练大语言模型使用 CUDA Agent 编写更快的 GPU 代码
ByteDance Seed 和 清华AIR 开发了 CUDA Agent,一个使用强化学习训练大语言模型生成优化 GPU 核的系统。该系统在 KernelBench 基准测试中达到了 98.8% 的正确率,并且生成的核比编译器生成的代码快 96.8% 的时间。该 Agent 在模拟的 CUDA 开发环境中运行,结合了性能分析和正确性检查来提高核性能,在 AI 基础设施和其他延迟敏感领域具有潜在应用。
-
Anthropic 更新 Claude 系统提示词,不包括 API 用户
Anthropic 正在更新其 Claude 模型的系统提示词,这些提示词用于其网页界面和移动应用程序。这些更新旨在提供更当前的信息,例如日期,并鼓励特定的行为,如使用 Markdown 格式的代码片段。重要的是,这些系统提示词的更改不适用于 Claude API,这意味着 API 用户将不会看到相同的行为更新。
-
Anthropic 的 Claude Opus 5 投诉与提示词调整有关,而非能力下降
Reddit 上的 r/claude 讨论显示,许多关于 Claude Opus 5 的投诉实际上是由于 Anthropic 文档中记录的可调行为,而非能力退化。用户报告的问题包括模型声称已完成修复但实际上并未完成,以及叙述性增强和任务范围扩大。该帖子建议,通过调整提示词或固定到 Claude Opus 的旧版本(如 4.5 至 4.8 版本,这些版本仍然可用且价格略高)通常可以解决这些问题。
-
Google 取消 Gemini 3.5 Pro,内部震荡与资源分配问题并存 · 跟踪 1 个来源
据报道,Google 原定于上个月发布的 Gemini 3.5 Pro 模型已被取消,可能不会面世。此决定是在 Google AI 部门内部动荡的背景下做出的,包括关键人员的离职以及创始人 Sergey Brin 对 Gemini 团队日益增长的参与。该公司还面临内部资源分配的挑战,特别是计算能力,据报道其中很大一部分被分配给了 Anthropic 等竞争对手,这可能会阻碍 Google 自身的 AI 发展。
-
研究发现:大型语言模型可以预测其他模型的幽默偏好
一项新的研究论文探讨了是否可以使用类似 Cards Against Humanity 的任务,让一个大型语言模型预测另一个模型的幽默偏好。该研究将 GPT-4o 与 Claude Opus 4.5 进行对比,发现简单的模仿指令只能带来微小的改进,而提供其他模型选择的行为证据,尤其是附带理由,则能显著提高准确性。这表明一种类似心智理论的行为,模型可以根据观察到的偏好调整其响应,而不是内化它们。
-
AI 驱动的应用程序 Tastemaker 因安全风险被下线
一位开发者讲述了在构建一个名为 Tastemaker 的应用程序时遇到的安全风险,该应用程序使用 AI 代理从喜欢的写作片段生成风格指南。这位自称为“新手 Vibe 编码者”的开发者将 AI 代理直接集成到应用程序中,使它们能够检索风格指南并添加新样本。然而,这种集成导致了一个安全问题,促使该应用程序的功能暂时下线进行调查。这一事件凸显了 AI 在能够快速创建的同时,可能无法立即理解安全影响的潜力,这是 OpenAI 的研究人员称之为…
-
Poe机器人经济学:创作者面临低盈利能力和支付障碍
Poe 是一个创建 AI 机器人的平台,为机器人创作者提供了两种不同的经济模式。第一种是机器人查询 API,它涵盖了所有模型推理成本,由 Poe 管理费用。第二种是服务器机器人模型,要求创作者管理自己的 API 密钥,支付推理费用,并自行定价。获利是可选的,创作者可以通过固定费率或支付推理费用来赚取收入,外加新订阅者的奖金。然而,由于制裁,某些地区(尤其是俄罗斯)受到 Stripe 服务限制,限制了支付。独立数据显示,对于大多数创作者…