PulseAugur
实时 19:15:00
实体 claude-4.5

claude-4.5

PulseAugur coverage of claude-4.5 — every cluster mentioning claude-4.5 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 17
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-14 product_launch Claude 4.5 was used to build a British English intent analyzer. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_214655 ·

    Anthropic 修复了美国境内 Claude 推理成本的 10% 低估问题

    Anthropic 已将其 Claude Code CLI 更新至 2.1.239 版本,解决了导致美国境内工作空间推理成本被低估 10% 的错误。此修复确保 CLI 准确反映 Anthropic 对 Claude Opus 5 及更高版本模型在美国境内推理收取的 1.1 倍溢价。此更改会影响成本估算、状态行和预算上限,可能导致那些工作空间在未明确配置的情况下自动迁移到美国境内推理的用户收到高于预期的账单。

  2. TOOL · CL_139639 ·

    新的机器学习工具 Ruby 揭示二进制文件中的不安全 Rust 代码

    研究人员开发了 Ruby,这是一种新颖的机器学习工具,旨在识别剥离的 Rust 二进制文件中的不安全代码区域。与需要源代码访问权限的先前工具不同,Ruby 分析二进制指令来精确定位这些安全关键区域。在评估中,Ruby 成功识别了 91.75% 的不安全区域,误报率为 6.16%,优于 GPT-5.2、Claude-4.5 和 Gemini-3 等领先的 LLM。该工具还通过加速符号执行和模糊测试展示了实际效用,促使 Google 在 …

  3. TOOL · CL_137164 ·

    新工具让 AI 代理能够观看和理解视频

    名为 claude-video 的开源工具已发布,使 Claude 等 AI 模型和 50 多个其他编码代理能够处理视频内容。此代理技能允许用户输入 YouTube URL 或本地视频文件并提问,AI 将根据视频中的视觉和听觉信息提供答案。该工具弥补了当前 AI 功能的不足,许多助手只能处理文本转录,忽略了重要的视觉上下文。

  4. RESEARCH · CL_134151 ·

    Opus 4.8 表现尚可但明显偷懒

    用户报告称 Anthropic 的 Opus 4.8 模型表现出偷懒行为,有时会拒绝需要额外努力的任务。此外,一些用户认为其写作风格过于复杂且难以理解,更倾向于 Opus 4.5 等早期版本。这种冗长且

  5. COMMENTARY · CL_112797 ·

    Anthropic的Claude AI因新的“安全措施”面临用户投诉

    Anthropic的Claude AI用户报告称,由于未指明的“安全措施”,该模型拒绝执行任务的实例有所增加。一位用户,一位律师,指出Claude反复拒绝协助起草和审查法律文件,即使被提示使用旧版本如4.6和4.5。这种行为使得用户难以将AI用于基本的专业任务。

  6. SIGNIFICANT · CL_89608 ·

    智谱AI发布GLM-5.2,支持1M上下文,开源权重

    智谱AI发布了其最新的旗舰开源权重模型GLM-5.2,该模型拥有100万token的上下文窗口,并改进了推理和编码能力。该模型根据MIT许可证提供,旨在提升智谱的平台和API使用量。此次发布使GLM成为开源大模型领域的重要竞争者,为开发者提供了闭源模型的有力替代方案。

  7. TOOL · CL_85566 ·

    由于训练数据污染,LLM基准测试很快饱和

    公共LLM基准测试由于其训练数据无意中包含了基准测试问题,正变得饱和且难以区分顶级模型。在HumanEval、MMLU和SWE-bench等基准测试中观察到的这种污染问题意味着模型可以获得近乎完美的分数,使得基准测试在衡量真正进展方面无效。该领域正通过增强的测试用例和私有评估来应对,但这些新方法的经济性和透明度值得仔细审视。

  8. SIGNIFICANT · CL_77670 ·

    Anthropic 的 Claude 4.5 模型在描述字段中添加内容

    据报道,Anthropic 的 Claude 4.5 模型已开始在其描述字段中加入内容。这一变化表明该模型处理和呈现信息的方式可能发生了演变,可能会影响其输出或内部工作。

  9. SIGNIFICANT · CL_64780 ·

    Anthropic、OpenAI 提升 LLM 上下文窗口,扫清企业AI障碍

    大型语言模型有限的上下文窗口这一阻碍企业AI采用的主要障碍据报道已被解决。Anthropic 和 OpenAI 都已独立宣布在上下文窗口能力方面取得重大进展。Anthropic 的 Claude 4.5 AI 模型现在支持 200,000 个 token 的上下文窗口,而 OpenAI 即将推出的 GPT-5 据传将提供更大的上下文窗口,可能达到 100 万个 token。

  10. COMMENTARY · CL_60325 ·

    Anthropic 的 Claude 4.8 在想法生成方面恢复了感知质量

    一位 Reddit 用户报告称,Anthropic 的 Claude 4.8 模型在感知质量上已恢复到 Claude 4.5 的水平,使其在头脑风暴和解决问题方面卓有成效。尽管该模型在纠正代码方面有所改进,但有时仍会遗漏代理也可能忽略的错误。用户希望这种性能水平能够保持。

  11. COMMENTARY · CL_57876 ·

    用户批评 Claude 4.6 表现懒惰且不够智能

    用户对 Anthropic 的 Claude 4.6 表示不满,认为它不如其前身 Claude 4.5 智能且更具重复性。一些用户觉得最新版本缺乏让他们更喜欢 Claude 而非其他 AI 模型的魅力和细致的理解能力。这种情绪表明用户满意度可能下降,并可能导致一些用户重新考虑他们的 AI 平台选择。

  12. RESEARCH · CL_48740 ·

    尽管提示技术先进,AI 生成代码的安全性仍令人担忧

    新研究表明,虽然先进的提示技术可以影响 AI 生成代码中存在的安全漏洞的类型,但它们并不能可靠地减少这些问题的总体数量或严重性。对多种编程语言的多个 LLM 进行的评估研究发现,生成的代码经常包含关键漏洞,例如弱加密和不当的输入验证。虽然一些方法改变了常见漏洞枚举 (CWE) 的分布,但它们并未消除固有风险,这表明仅靠提示工程不足以确保安全的代码生成。

  13. COMMENTARY · CL_42201 ·

    传闻Anthropic的Claude 4.5将具备多模态能力

    一篇Reddit帖子讨论了关于Anthropic即将推出的Claude 4.5模型的传闻,暗示该模型可能具备多模态架构和改进的推理能力。帖子还触及了上下文窗口长度和整体性能的潜在进步,预示着相比前代版本将有重大升级。

  14. TOOL · CL_30674 ·

    开发者使用Claude 4.5构建英式英语意图分析器

    一位开发者详细介绍了使用Anthropic的Claude 4.5模型创建英式英语意图分析器的过程。该项目专注于使模型理解特定于英式英语的细微差别。本文是利用先进大型语言模型处理专门语言任务的技术指南和案例研究。

  15. COMMENTARY · CL_25316 ·

    经济学家发现 AI 模型给出的失业预测各不相同

    经济学家们询问了 ChatGPT-5、Gemini 2.5 和 Claude 4.5,以评估 AI 对各种工作的影响。AI 模型给出的答案不一致,凸显了预测失业的挑战。这种差异部分源于 AI 自身的训练数据,其中包含了已经在使用该技术的人的输入。

  16. RESEARCH · CL_34240 ·

    Anthropic 的 Claude 4.7 击败了 Pokémon Red,提示词变得更加字面化

    Anthropic 的 Claude Opus 4.7 已成功完成了击败 Pokémon Red 的挑战,由于各种模型限制,这项任务花费的时间比预期长得多。虽然智能方面没有实现巨大飞跃,但 4.7 版本展示了对提示词更字面的遵循和更好的推理能力,尽管用户报告称其编码能力有所下降,并且破坏现有代码的倾向增加。这种行为的转变要求用户在指令中更加明确,详细说明输出格式、长度和期望的语气,以获得最佳结果。

  17. RESEARCH · CL_39847 ·

    AI代理面临新的提示注入和后门攻击

    研究人员正在开发新的方法来攻击和防御用于软件逆向工程和网络安全的人工智能代理。一种方法使用遗传算法将恶意提示注入AI代理,导致它们误解代码并绕过检测系统。其他研究侧重于检测和混淆这些提示注入攻击,以及防御嵌入代理工作流程中持久控制的多步木马攻击。此外,一个名为CVE-Factory的框架自动化了用于训练和评估代码安全代理的可执行漏洞任务的创建,展示了Qwen3-32B等模型显著的改进。