PulseAugur
中
实时 19:24:05
实体 Haiku 4.5

Haiku 4.5

PulseAugur coverage of Haiku 4.5 — every cluster mentioning Haiku 4.5 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
68
90 天内 68
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/4 页 · 共 72 条
  1. SIGNIFICANT · CL_286140 ·

    Anthropic将Claude Haiku 5.5价格下调90%,并提供免费API积分

    Anthropic发布了Claude Haiku 5.5,其价格为每百万输入令牌0.10美元,比前代Haiku 4.5便宜十倍。此外,Max和Team订阅计划的用户每月可获得高达500美元的免费API积分。该公司声称,在其内部测试中,Claude Haiku 5.5的性能优于GPT-6 Luna。

  2. TOOL · CL_285068 ·

    开发者创建 Claude Code 钩子以使用绝对文件路径

    一位开发者为 Claude Code 创建了一个自定义停止钩子,以强制使用绝对文件路径。此钩子会自动检测并阻止使用相对路径的响应,提示 Claude 提供完整、明确的文件位置。该解决方案用 Python 实现,旨在跨 Windows 和 Linux 环境运行,并致力于提高 Claude 在项目目录中准确引用文件的能力。

  3. FRONTIER RELEASE · CL_279632 ·

    Anthropic推出Claude Haiku 5.5,拥有100万上下文窗口,价格更低

    Anthropic推出了Claude Haiku 5.5,这是一款新推出的、专为高吞吐量任务(如摘要和分类)设计的小型语言模型。该模型拥有100万token的上下文窗口,并且定价远低于其前代Haiku 4.5,输入token价格为每百万100美元,最高可达10万token。Haiku 5.5可在包括Amazon Bedrock、Google Cloud和Microsoft Foundry在内的主要云平台上使用,并且与之前的版本以及GP…

  4. TOOL · CL_279057 ·

    AI 代理技能测试:9 种中有 4 种无效

    最近的一项 A/B 测试评估了九种流行的 AI 代理技能,发现其中四种没有带来可衡量的益处。该研究侧重于技能(本质上是 `.md` 文件,用于教授 Claude Code 或 Gemini CLI 等编码代理新功能)在当前 LLM 模型上的表现。结果表明,引入新工作流程的技能是有效的,而仅仅重申良好编码实践的技能则没有带来任何改进。与大型模型相比,小型模型似乎从这些技能中获益更多,并且技能的描述本身有时会影响模型行为。

  5. COMMENTARY · CL_277492 ·

    AI代理成本详解:公式揭示代币定价之外的隐藏费用 · 追踪3个来源

    计算AI代理的真实月度运行成本需要一个详细的公式,该公式考虑了除简单按代币计费之外的因素。对话历史是一个主要驱动因素,因为每一轮都会重发所有先前的消息,导致成本随着轮数的增加呈指数级增长。例如,一个使用工具的代理可能每次客户消息会进行多次模型调用,而提示缓存可以显著降低这些费用。文章提供了一个公式和一个小型企业示例来说明这些成本,并比较了Anthropic、OpenAI和Google的模型。

  6. SIGNIFICANT · CL_260669 ·

    联合国与Google合作,使全球数据为AI做好准备

    联合国正在与Google合作创建联合国系统数据共享中心,这是一个旨在使全球统计数据可供AI代理访问的平台。它建立在Google的开源数据共享中心平台之上,允许自然语言查询,并支持模型上下文协议以实现直接AI集成。该倡议旨在提高AI生成数据请求响应的准确性和可靠性,解决了联合国儿童基金会设定的基准,在该基准中,模型在全球发展指标上的准确率仅为21.2%。

  7. TOOL · CL_258299 ·

    开发者发现 OpenAI 的 tiktoken 库对 Claude 令牌计数错误高达 38%

    一位开发者发现 OpenAI 的 `tiktoken` 库严重低估了 Anthropic 的 Claude 模型(Claude 4.7)的令牌计数,导致意外的 API 错误和预算超支。在 4,200 次请求中,`tiktoken` 的估算值比实际计费令牌数平均低 17.4%,其中代码量大的提示词估算值低了高达 38%。该开发者还发现,像工具定义和系统提示这样的关键组件经常被手动令牌估算所忽略。建议的解决方案是使用 `/v1/messa…

  8. TOOL · CL_258095 ·

    提示缓存将重复输入的LLM成本降低10倍 · 跟踪2个来源

    提示缓存通过存储和重用常见的提示前缀,可以显著降低大型语言模型的成本。该技术对于高流量、突发性流量尤其有效,因为系统提示和工具定义等静态内容可以被缓存。节省的成本相当可观,缓存的令牌成本约为正常输入令牌的十分之一,并且这种方法提供了一种在不牺牲输出质量的情况下削减开支的方法。然而,提示缓存依赖于精确的前缀匹配,这意味着内容的顺序至关重要,并且缓存的生存时间很短,因此不适用于不频繁的一次性请求。

  9. COMMENTARY · CL_253137 ·

    作者通过严格的评估练习批评自己的LLM裁判

    作者详细介绍了他们评估自己开发的两个定制大型语言模型(LLM)裁判有效性的过程。他们采用了一种受Dan Luu启发的​​方法,该方法涉及在看到解释之前识别基准测试中的缺陷。作者根据其LLM裁判的性能数据提出了五个练习,突出了准确性和精确性方面的不一致和需要改进的领域。这些练习揭示了裁判的可靠性问题以及提示更改的影响,即使在使用Haiku 4.5或Sonnet 5等相同底层模型时也是如此。

  10. TOOL · CL_250971 ·

    Anthropic的Claude模型需要仔细的上下文窗口预算

    使用Anthropic的Claude模型的开发者必须仔细管理上下文窗口,因为它是系统提示、工具、对话历史和内部推理共享的固定预算。虽然像Opus 4.8这样的模型提供大的上下文窗口(默认200K,扩展1M),但输出限制要小得多,如果不加以考虑,会导致响应被静默截断。为避免问题,开发者应在发送请求前使用SDK计算token数,为输出和自适应思考预留空间,并保持静态前缀稳定以利用缓存。

  11. TOOL · CL_244515 ·

    Anthropic 的 Claude Code 集成到 Expo 项目中,采用基于 token 的定价。

    Anthropic 的 Claude Code 代理现已集成到新的 Expo 项目中,标志着 AI 代理正转向成为必需的开发基础设施。虽然订阅套餐提供了可预测的基础成本,但实际费用由 token 消耗驱动,这种模式被称为“配额幻觉”。Claude Code 可以通过与代码库、日志和文档交互来构建、升级、调试和部署 Expo 和 React Native 项目,其作用更像一个系统级代理,而非 IDE 插件。定价从个人套餐(起价 20 美…

  12. COMMENTARY · CL_244234 ·

    AI模型委托设置因更新、更强大的模型而得到改进

    用户描述了一个将任务委托给更便宜的AI模型的设置,并指出使用Haiku 4.5等旧模型时,这项工作更具挑战性。他们解释说,一个能力较弱的模型可能会导致更智能的模型无法纠正的问题。然而,像Luna和DeepSeek这样的当前模型被认为足够强大,可以进行此类委托。

  13. COMMENTARY · CL_241127 ·

    Anthropic 的 Claude 5 系列:Fable、Opus、Sonnet、Haiku 指南

    Anthropic 的 Claude 模型为 AI 任务提供分层方法,其中 Fable 5、Opus、Sonnet 和 Haiku 代表了不同的性能、速度和成本平衡。Fable 5 被定位为最先进的复杂推理模型,而 Opus 是要求苛刻任务的强大默认选项。Sonnet 推荐用于日常使用和编码,而 Haiku 则针对大批量、更简单的操作进行了优化。用户可以通过 `/model` 等命令选择模型,并调整“快速模式”和“努力级别”等设置来微…

  14. COMMENTARY · CL_236847 ·

    Anthropic 的 Claude 模型:选择合适模型的指南

    本文提供了在 Anthropic 的 Claude 模型之间进行选择的指南,特别是 Sonnet 5、Opus 5、Fable 5.1 和 Haiku 4.5。它概述了五种不同的努力程度,并提出了两个关键问题,以帮助用户为特定任务选择最合适的模型。

  15. TOOL · CL_235009 ·

    Claude Code开发者通过60秒缓存优化成本监控

    一位开发者为Claude Code创建了一个成本管理系统,以防止超出输出令牌限制。该系统名为cost_guard.sh,对`ccusage`命令的API调用使用60秒缓存,从而减少延迟并防止监控工具本身成为瓶颈。这种方法可以在不显著影响用户体验的情况下实现实时成本监控,并补充了一个在会话结束时计算确切成本的独立脚本。

  16. TOOL · CL_233336 ·

    Door-in-the-Face 技术在大型语言模型上效果不一

    arXiv 上发表的一项新研究探讨了“Door-in-the-Face”(得寸进尺)说服技巧对大型语言模型的有效性。研究人员发现,虽然该技巧成功提高了 Anthropic 模型的回应率,其中 Opus 5 在拒绝较大请求后回答较小请求的比例显著增加,但在 OpenAI 和 Google 的模型以及 Haiku 4.5 上却适得其反。研究表明,让步本身是所有模型的一个因素,但对拒绝的具体反应因模型系列而异,请求的性质也起着至关重要的作用。

  17. TOOL · CL_232365 ·

    Anthropic 的 Claude AI 已更新,禁止使用受版权保护的歌词和图片

    Anthropic 已更新其 Claude 消费者应用程序的系统提示,特别增加了一个重要部分,以防止 AI 复现受版权保护的歌词、诗歌或书籍片段。此更改似乎是为回应近期音乐出版商对 Anthropic 提起的诉讼,指控其在模型训练过程中存在版权侵权行为。此外,更新后的提示现在明确禁止生成包含受版权保护的角色或徽标的图像,这一限制可能源于 Claude 在图像生成方面的能力不断提高,尤其是在 SVG 方面。

  18. TOOL · CL_226863 ·

    OpenClaw 2.0 推出,具有简化的设置和多人 AI 会话 · 跟踪 8 个来源

    OpenClaw 基金会发布了 OpenClaw 2.0,这是其迄今为止最重要的更新,整合了超过 16,000 个拉取请求。新版本通过自动检测现有的 AI 订阅和 API 密钥来简化设置,并具有一个完全重建的浏览器应用程序以改善用户体验。主要增强功能包括通过共享云会话实现实时协作、使用 SQLite 进行持久内存存储以及扩展对本地 AI 模型支持。

  19. COMMENTARY · CL_215820 ·

    AI代理成本由输入令牌驱动,而非预算:dev.to 分析

    根据一篇dev.to文章,使用大型语言模型的成本,特别是对于AI代理而言,主要由输入令牌的数量驱动,而不是输出。作者建议,开发者不应专注于预算限制,而应通过采用提示缓存、将模型路由到更便宜的替代方案(如Anthropic的Haiku 4.5)、对异步任务进行批量处理以及减少发送给模型的上下文量等策略来解决上下文问题。这些方法可以显著降低运营成本,并在某些情况下提高准确性。

  20. COMMENTARY · CL_215620 ·

    Haiku 4.5 模型在订单阅读考试中优于更昂贵的 Sonnet 5

    一位博主在 29 个问题的订单阅读考试中比较了两种 AI 模型 Haiku 4.5 和 Sonnet 5,以确定更昂贵的模型是否物有所值。Haiku 4.5 模型正确回答了 29 个问题中的 28 个,而 Sonnet 5 回答了 28 个中的 28 个(一个问题因速率限制未能运行)。关键区别在于 Sonnet 5 能够从上下文线索中推断出正确的盖子尺寸(PET 300),而 Haiku 4.5 则要求澄清。尽管 Sonnet 5 的…