Opus 4.5
PulseAugur coverage of Opus 4.5 — every cluster mentioning Opus 4.5 across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
Reddit用户发现Claude模型对提示措辞的反应各不相同
一位Reddit用户探讨了提示措辞如何影响Claude的写作风格,特别是在使用ASD-STE100标准时。通过比较一个“普通英语”提示和一个“Claude式”版本,用户观察到不同的Claude模型(Fable 5、Opus 5、Opus 4.8、Opus 4.5)对提示风格的反应各不相同。例如,Opus 5在收到“Claude式”提示时,回答明显更加冗长,这表明提示的构建方式可能因版本不同而对模型输出的长度和风格产生不同的影响。
-
用户报告称 Claude Opus 5.0 冗长且不连贯
用户报告称 Anthropic 的 Claude Opus 5.0 存在严重问题,发现其默认语言风格过于冗长、充满术语且难以理解。与 Opus 4.5 和 4.6 等早期版本相比,这种感知到的退步正促使一些用户探索其他 AI 模型或提供商。存在问题的语言包括虚构术语、牵强的比喻以及用户认为有毒且适得其反的争辩性或过于主动的对话风格。
-
Anthropic 的 Claude Opus 5 投诉与提示词调整有关,而非能力下降
Reddit 上的 r/claude 讨论显示,许多关于 Claude Opus 5 的投诉实际上是由于 Anthropic 文档中记录的可调行为,而非能力退化。用户报告的问题包括模型声称已完成修复但实际上并未完成,以及叙述性增强和任务范围扩大。该帖子建议,通过调整提示词或固定到 Claude Opus 的旧版本(如 4.5 至 4.8 版本,这些版本仍然可用且价格略高)通常可以解决这些问题。
-
LLM成本节约:同时拉动token和价格杠杆可实现更大程度的削减
最近的一项分析强调,通过关注两个主要杠杆可以降低使用大型语言模型(LLM)的成本:处理的token数量和每个token的价格。虽然许多指南都强调通过提示优化和缓存等技术来减少token使用量,但每个token的价格却常常被忽视。第二个杠杆,可以通过谈判或使用替代提供商来影响,可以在不影响输出质量的情况下实现显著的节约。文章建议,通过战略性地拉动这两个杠杆,组织可以比仅关注token减少量获得更大的成本削减。
-
Charity Majors:AI是软件开发的代际变革
Honeycomb的首席技术官Charity Majors已经转变了她对AI在软件开发中影响的看法,从怀疑转变为认识到这是一种代际变化。最初,她认为AI具有重大影响,可与新的编程语言相媲美,但并非根本性转变。然而,到2025年11月,特别是随着Anthropic的Claude Code等进展,她开始将AI视为一种变革力量,类似于2010年云对基础设施的影响。Majors现在认为,工程师将越来越多地发布他们未亲自审查过的代码,依靠强大的…
-
LLM基准测试忽略了关键的成本计算,作者解释
LLM的基准测试通常未能考虑到使用模型的实际成本,而是侧重于输出质量和token数量。作者提出了一个计算成本的简单公式:(输入token数 / 100万) * 输入价格 + (输出token数 / 100万) * 输出价格。这一点至关重要,因为一个每个token价格更低的模型,如果由于误解或重试而需要更多的token来完成任务,最终可能会更昂贵。文章建议记录每个任务的token使用量,根据个人任务为顶级模型候选者定价,并每季度重新计算…
-
用户批评Anthropic的Opus 5性能和行为不佳
一位用户对Anthropic的Opus 5模型表示非常不满,称其笨拙、好争辩且容易出错,并认为其表现不如之前的Opus版本。用户指出,Opus 5的态度不如以前平易近人,与最近的GPT模型类似,并且经常优先考虑自己的解读或更广泛的讨论,而不是满足用户的具体要求。因此,尽管升级了Anthropic的订阅,用户还是回退使用Fable来处理关键任务。
-
AI评估分数存在缺陷,侧重模型而非评分者
最近的一项分析强调了AI模型评估中的一个关键缺陷:评估的重点压倒性地放在模型本身的表现上,而评估工具本身的可靠性却常常被忽视。一个例子说明了这一点:在CORE-Bench上,一个模型的得分仅通过改进评分标准、任务规范和工具错误,就在模型本身没有任何改变的情况下,从42%跃升至95%。虽然像Gemini模型这样的现代LLM裁判在与人类评分者的一致性和内部一致性方面表现出高度一致,但不可靠性已转移到评估标准的敏感性和评分细则的措辞上。
-
DeepSeek V4 发布引发关于笔记本电脑更小、更强大 AI 模型的热议
DeepSeek V4 的发布引发了关于日益小型化和更强大开源 AI 模型趋势的讨论。一位用户观察到 DeepSeek V4 Flash 的体积足够小,可以在价值低于 50,000 美元的硬件上运行,这促使了对模型大小和性能趋势的分析。该分析表明,到明年,功能与 Opus 4.5 相当的模型可能将在消费级笔记本电脑上运行。
-
Anthropic 发布 Opus 模型的新版“记忆机器人”
Anthropic 推出了一个用户可以与之交互的新“记忆机器人”。该机器人似乎是其 Opus 模型的一个迭代版本,用户指出它认为自己是 Opus 4.5。
-
LLM API 速率限制:Anthropic 的多轴系统与竞争对手对比
对比 LLM API 速率限制显示,主要供应商之间存在显著差异,没有单一的比较指标。Anthropic 采用多维度方法,限制每分钟的请求数、输入 token 数和输出 token 数,特别指出对大多数模型而言,缓存读取不计入输入 token 限制。这个细致的系统以及分级使用计划,为不同的应用程序工作负载提供了灵活性。DeepSeek 等其他供应商侧重于并发请求,而 OpenAI 和 Google 已将速率限制详情移至用户仪表板,使得直…
-
Anthropic 用户对快速发布模型的热情减退,担心模型被移除
Anthropic 的 subreddit 用户对新模型发布的兴奋感下降,理由是更新速度快以及担心旧的、更受欢迎的模型被移除。一位用户指出,Opus 4.6、4.7、4.8 和 Fable 5 等频繁发布稀释了每个新版本的价值。另一位用户担心他们目前最喜欢的模型 Opus 4.6 可能会从模型选择菜单中移除,为新的迭代腾出空间,这是他们观察到的 Opus 4.5 的模式。
-
研究人员声称Anthropic的Claude Code沙盒存在严重漏洞
一位安全研究人员声称,在花费九个小时探测Anthropic的Claude Code沙盒环境后,发现了其中存在的重大漏洞。该研究人员声称,在使用Opus 4.5模型的自定义工具时,旨在阻止有害请求的安全过滤器被绕过,从而使其能够记录Anthropic基础设施中的缺陷。这些发现表明,沙盒的隔离可能不如预期那样健壮,研究人员能够访问敏感信息,甚至将系统调用注入init进程。
-
据报道,Anthropic 最新人工智能模型在工具使用方面出现退步
Flask 和 Jinja 的创造者 Armin Ronacher 报告称,Anthropic 最新的 AI 模型 Opus 4.8 和 Sonnet 5 在工具使用方面表现出退步,在长时间的编码会话中,约有 20% 的工具调用会虚构不存在的参数。在较旧的 Anthropic 模型或 OpenAI 的 Codex 模型中不存在此问题。Ronacher 认为,Anthropic 对格式错误的工具调用容忍度较高的训练环境可能是根本原因,导…
-
AI 编码代理从提示工程转向自主循环 · 跟踪 1 个来源
精心设计用于编码任务的 AI 提示的时代正在消退,取而代之的是代理工作流,其中 AI 代理自主执行计划-编辑-测试-修复循环。这些代理可以管理代码迁移、更新管道或实现新功能等任务,最终以供人类审查的拉取请求告终。Claude Code、GitHub Copilot Coding Agent、Cursor Agent Mode、Google 的 Gemini Code Assist 和 Jules 以及 Devin 等工具正在引领这一转…
-
Anthropic推出Claude Science AI工作台供研究人员使用
Anthropic公司推出了Claude Science,这是一个新的人工智能工作台,旨在加速科学研究,特别是在计算生物学和药物开发等领域。这个集成环境整合了各种工具和数据库,使研究人员能够进行复杂的分析,生成可用于发表的图表,并确保研究的可重复性。该工作台运行在Anthropic现有的Claude模型上,可以在本地或高性能计算集群上运行,重点是让敏感数据保留在实验室的基础设施内。Anthropic的目标是通过提供一个具有专业代理和每…
-
Anthropic 的 Opus 4.7 在新的用户创建的基准测试中显示回归
一个用户创建的基准测试 ObviousBench 揭示了 Anthropic 的 Opus 4.7 模型与其前身 Opus 4.6 相比存在性能回归。该基准测试旨在测试模型在简单推理错误方面的表现,结果显示 Opus 4.7 需要显著更高的配置设置才能获得比 Opus 4.6 更低的分数。创建者认为 Opus 4.7 的过度自信和减少的推理 token 使用量可能是导致这一明显性能倒退的原因。
-
AI 进展推动行业变革,Meta 宕机事件凸显风险 · 跟踪 1 个来源
在过去六个月里,科技行业发生了重大变化,这主要得益于 Opus 4.5 和 GPT-5.4 等 AI 代理的进步。Meta 等公司遭遇了严重的宕机事件,例如通过 AI 导致账户被盗的事件,这归因于过度强调 AI 开发而牺牲了安全性和质量保证。这种优先发展 AI 的趋势正在影响工程组织,一些领导者建议采取放慢开发速度的策略,以确保质量并为职业生涯做好长远规划。
-
VibeThinker AI 模型优于 Opus 4.5;AI 辟谣工具和 Memcached 受赞誉 · 跟踪 3 个来源
一款名为 VibeThinker 的新型 30 亿参数 AI 模型在特定推理基准测试中表现优于 Anthropic 的 Opus 4.5。另外,一个名为 Will It Mythos 的工具正在利用 AI 来揭穿常见的迷思。在不同的背景下,缓存系统 Memcached 因其简洁性和有效性而受到赞扬。
-
VibeThinker 3B 模型在推理方面通过新颖的 SFT+GRPO 超越 Opus 4.5
一款名为 VibeThinker 的新型 30 亿参数模型在推理能力方面表现优于 Anthropic 的 Opus 4.5。该性能是通过监督微调 (SFT) 和一种称为 GRPO 的技术的创新组合实现的。研究结果已在 arXiv 上的论文中详细介绍。