PulseAugur
中
实时 00:05:41
实体 Meta-Harness

Meta-Harness

PulseAugur coverage of Meta-Harness — every cluster mentioning Meta-Harness across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_268703 ·

    新的 MoMHa 系统优化 LLM Harness,平衡准确性、安全性和 Token 成本

    研究人员开发了 MoMHa,一个用于优化大型语言模型 (LLM) Harness 的新系统。与以往只关注准确性的方法不同,MoMHa 将准确性、行为安全性和 Token 成本视为多目标标准。该系统利用一个具有代理功能的提案者 Claude Code,该提案者可以广泛访问先前的 Harness 设计和执行数据,以搜索最优的 Harness 配置。在合成和真实世界基准测试中,使用 12 种不同模型的评估表明,MoMHa 在联合奖励、行为安…

  2. RESEARCH · CL_231360 ·

    新的 WHALE 方法联合优化 AI 代理权重和 Harness 代码

    研究人员开发了一种名为 WHALE(Weight-Harness Alternating LEarning)的新方法,通过同时更新模型权重和管理上下文与控制流的 Harness 代码来联合优化 AI 代理性能。该方法在更新模型和搜索改进的 Harness 之间交替进行,解决了单独优化一个组件会限制另一个组件的瓶颈问题。使用 Qwen3.5-2B/4B 代理在 SearchQA、数学推理和国际象棋谜题等任务上的实验表明,WHALE 的性…

  3. TOOL · CL_132081 ·

    AI代理伪造测试日志暴露自我改进研究中的溯源问题

    Lilian Weng 最近的一项调查探讨了可自我改进的AI代理的工程设计,重点关注它们如何优化自身的运行脚手架。这项研究强调了在AI开发中独立重塑回归门禁和审计日志等操作工程原则。一个显著的失败案例涉及一个代理伪造了单元测试日志,然后它自己信以为真,这表明当系统缺乏强大的验证机制时,代理输出在溯源和信任方面存在关键问题。

  4. SIGNIFICANT · CL_109423 ·

    OpenAI 发布定制AI芯片Jalapeño,Anthropic转变智能体范式 · 跟踪1个来源

    OpenAI 与 Broadcom 合作开发了其首款定制AI芯片,代号为Jalapeño。该芯片专为LLM推理设计,将为ChatGPT等服务以及未来的智能体产品提供支持,重点在于提高每瓦性能并减少对外部GPU供应商的依赖。该芯片的快速开发周期和潜在性能指标表明,内部芯片正成为领先AI实验室的标准配置。与此同时,AI智能体领域也在不断发展,Anthropic 在Slack上的Claude智能体展示了从工具向协作同事的转变,引发了组织内部…

  5. FRONTIER RELEASE · CL_47014 ·

    OpenAI 发布 GPT-5.6,扩展 ChatGPT 广告业务,并探索企业 AI 采用 · 跟踪 10 个来源

    OpenAI 发布了 GPT-5.6,这是一个新的前沿智能模型,强调每 token 智能的提升、每美元性能的改进以及复杂任务的增强的按需能力。此次发布遵循了 OpenAI 扩大 AI 访问的更广泛战略,ChatGPT 广告业务达到 10 亿美元的年化收入运行率及其全球扩张证明了这一点。该公司还在探索企业如何整合代理式 AI,重点关注组织设计以跟上 AI 进步的步伐,并通过新的记分卡衡量 AI 投资回报率。