Sonnet 3.5
PulseAugur coverage of Sonnet 3.5 — every cluster mentioning Sonnet 3.5 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI信任税:LLM安全措施的隐藏成本
开发者常常不知道一个显著的
-
Claude 代码的“父亲”敦促开发者删除并重建 AI 提示
被称为“Claude 代码之父”的 Boris Cherny 建议 AI 产品开发者采取“消融研究”方法,建议他们删除然后逐步重新添加系统提示、工具和 Harness 代码,以了解其影响。他将大型语言模型比作具有独特个性的生物体,这些个性会随着每一代的发展而演变,因此需要一种经验性、实验性的产品开发方法,而不是依赖先入为主的观念或理论计算机科学。Cherny 还提出了“产品积压”(模型能力超出产品集成能力)和“解除束缚”(移除限制以允…
-
Anthropic 将 Claude Code 的提示词削减了 80%,性能未受影响
Anthropic 的工程师们显著减少了 Claude Code 的系统提示词,删除了其原始文本的 80% 以上,而未影响其在编码任务上的性能。这一改变源于认识到过于明确的指令有时会适得其反,它将方法从僵化的规则转向更灵活的判断和定义明确的工具接口。更新后的提示词允许 Claude 从上下文中推断编码风格,并更具创造性地探索解决方案,这反映了针对高级 AI 模型的提示词工程的更广泛趋势。
-
ORFS-agent 使用 LLM 优化芯片设计参数,提高效率
研究人员开发了 ORFS-agent,一个使用大型语言模型 (LLM) 优化集成电路设计参数的新系统。该代理迭代调整数千个参数,与标准优化方法相比,在布线长度和时钟周期等设计指标上有所改进。该系统在联合优化目标上展示了高达 2.7% 的改进,并使用了少 40% 的迭代次数,其中 Sonnet 4.6 和 Kimi K2.5 等较新的 LLM 后端表现优于早期版本。
-
大型语言模型在纠正错误方面有多好?一项使用 Keras 和 TPU 的聊天机器人竞技场实验
当前评估大型语言模型的方法,如 MMLU 和 HumanEval,可能不足以捕捉交互式、目标导向对话的细微差别。更有效的方法是根据聊天机器人在多轮对话中与用户互动以实现特定目标的能力来评估它们,这模仿了人类的互动模式。这种“有目的的对话”可以增强用户体验并解锁新功能,即使在代码生成和个性化助手等领域也是如此。