PulseAugur
中
实时 06:24:25
实体 OpenHands

OpenHands

PulseAugur coverage of OpenHands — every cluster mentioning OpenHands across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
31
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
时间线
  1. 2026-10-06 product_launch OpenHands released version 1.25.0 with updates to its back navigation control. 来源
  2. 2026-09-17 product_launch OpenHands released version 1.19.0 with new features including GPT-6 Astra model support. 来源
  3. 2026-09-12 product_launch OpenHands released version 1.18.0 with new features including full-size image viewing and enhanced automation controls. 来源
  4. 2026-09-08 product_launch The open-source coding agent OpenHands has been released in version 1.0, featuring production-ready sandboxing. 来源
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. TOOL · CL_282113 ·

    OpenHands 发布 v1.25.0,更新导航

    OpenHands 发布了 1.25.0 版本,其中包括对其设置子页面上后退导航控件的更新。此版本发布于 2026 年 10 月 6 日,已获得超过 90,000 颗星的广泛关注。

  2. TOOL · CL_282094 ·

    OpenHands v1.25.0 增加批量 LLM 配置文件创建功能;Fluxer 增加自定义主题

    OpenHands 发布了 1.25.0 版本,该版本在设置中引入了批量创建 LLM 配置文件的功能。此外,Fluxer 的 fluxer-app-proxy-self-hosted 已更新至 2026.1006.1624 版本,现已包含对自定义主题的支持。Pulse helm-chart 也已更新至 6.5.0 版本。

  3. RESEARCH · CL_280140 ·

    新的基准测试评估LLM的代码生成、澄清和检索能力

    三篇新的研究论文介绍了用于评估大型语言模型(LLM)在代码生成任务中能力的新基准和方法。ClarifyCodeBench侧重于LLM澄清模糊需求的能力,发现强大的代码生成能力并不一定能转化为有效的澄清能力。CONTRA提供了一种无需训练的方法来识别和限定改变行为的问题,以进行选择性澄清,从而提高了ClarifyCodeBench基准测试的F1分数。AlgoREval专门评估LLM的参数化代码检索能力,将其与新颖合成区分开来,并突出了不…

  4. RESEARCH · CL_268566 ·

    AI for AI:实验室自动化模型开发,加速AGI竞赛

    “AI for AI”的概念正成为下一代大型语言模型开发的核心焦点。这种方法利用AI的能力来自动化和加速研究开发过程本身,超越了简单的编码辅助,扩展到生成训练数据、编写复杂脚本和优化硬件利用率等任务。OpenAI和Anthropic等领先实验室正在大力投资该领域,Anthropic报告称其80%以上的可运行代码现在由AI生成,并利用数千个AI代理进行内部测试。中国公司也在探索AI在研发中的作用,重点关注训练框架和基础设施等领域。Nai…

  5. RESEARCH · CL_270791 ·

    新研究探索优化代理工具链以提升AI性能 · 追踪9个来源

    多篇研究论文探讨了代理工具链的优化和演进,代理工具链是决定语言模型如何与其环境交互的关键组成部分。研究引入了GUI-HARVEST、ActiveSaddler、MILO和DynaHarness等新框架,专注于自我改进、自动化课程学习和动态物理治理。这些方法旨在通过基于执行反馈和证据驱动的演进来优化提示、工具接口和控制逻辑,从而提高代理在编码、通用代理任务和机器人技术等各种任务中的性能。研究结果表明,代理系统的有效性高度依赖于模型与其工…

  6. TOOL · CL_259635 ·

    OpenHands v1.19.0 添加 GPT-6 Astra 模型支持和 MCP 服务器范围限定

    OpenHands 发布了 1.19.0 版本,引入了多项新功能。此次更新允许将代理配置文件范围限定到特定的 MCP 服务器。此外,它还增加了对 GPT-6 Astra 模型 的支持,并包含跟踪已通过身份验证的 Canvas 到达的功能。

  7. TOOL · CL_251303 ·

    自托管 AI 开发团队 AICOM 实现产品部署自动化

    该开发者创建了一个名为 AICOM 的自托管 AI 开发团队,作为托管式 AI 应用构建器的替代品。与简单的聊天转代码工具不同,AICOM 利用包括分析师、设计师和开发人员在内的十三种专业代理,由 AI Director 协调,可在约 30 分钟内将项目从简报推进到部署。该系统包含质量门和自动化检查,以确保产品功能,并设置了修复回合上限以防止无限 token 消耗。此外,该平台允许用户将功能发布为付费 API 端点,供其他代理发现和调用。

  8. TOOL · CL_249336 ·

    OpenHands v1.18.0 增加了图片查看和自动化控制功能

    OpenHands 发布了 v1.18.0 版本,引入了多项新功能。用户现在可以点击图片附件以全屏查看。此外,只有自动化创建者才能重新启用它,并且现在支持在云后端编辑自动化。

  9. TOOL · CL_243617 ·

    Ollama 和 FastAPI 结合,增强本地 LLM API

    开发人员可以通过结合 Ollama 和 FastAPI 来创建更强大的本地 LLM API。Ollama 简化了在私有服务器或本地计算机上下载和托管 Llama 3 和 Mistral AI 等开源模型的过程。然而,其内置 API 缺少身份验证和模式验证等功能。通过使用 FastAPI 封装 Ollama 的 API,开发人员可以获得这些功能,并能更好地集成到现有的 Python 堆栈中,从而为本地 LLM 应用实现安全可控的数据处理。

  10. TOOL · CL_242128 ·

    开源编码代理 OpenHands 发布 1.0 版本,支持生产级沙箱

    开源编码代理 OpenHands 已发布 1.0 版本,引入了生产级沙箱功能。此次发布旨在为开发者提供更安全可靠的环境来部署 AI 驱动的编码工具。更新重点在于提升该代理在实际应用中的安全性和稳定性。

  11. TOOL · CL_240943 ·

    开源工具提供昂贵AI订阅的替代方案

    一位开发者概述了一套五个开源工具,可以取代昂贵的月度AI订阅,强调了控制和成本节约。提出的堆栈包括用于本地LLM推理的Ollama,作为路由器/网关的LiteLLM,用于会议转录的Whisper,用于评估和可观察性的Langfuse,以及用于代理编码的OpenHands。这种方法将单体AI应用程序转向更模块化和可调试的系统,利用了小型本地模型日益增长的能力。

  12. TOOL · CL_230349 ·

    AI编码工具通过通用信任适配器为MCP服务器增加安全性 · 跟踪4个来源

    AliceLabs LLC开发了通用信任适配器(UTA),一个旨在为AI编码工具使用的MCP(多代理通信协议)服务器添加信任验证的系统。UTA通过`@marketnow/trust-gateway`包封装,提供一个12阶段的验证流程,包括预执行过滤器,以阻止访问`.env`和凭证存储等敏感文件,并防止`rm -rf`等恶意命令和未经授权的shell生成。该系统支持八种不同的信任凭证格式,并将所有操作记录到防篡改的Merkle树中,从而…

  13. TOOL · CL_228635 ·

    新框架 reSolve 增强了智能体技能演进和可复现性

    研究人员开发了 reSolve,一个旨在改进智能体技能创建和可复现性的新框架。该系统解决了自我演进技能表现不如人类精心策划的技能以及智能体在部署时难以复现已学技能的常见问题。reSolve 利用代理验证器来增强稀疏奖励信号,并采用由该验证器引导的束搜索来构建解决方案。在测试中,这种方法使一个基础模型能够自我演进出达到 74.9% 的 mean-of-3 分数的技能,显著优于人类精心策划的基线模型和强大的 GPT-5.5/OpenHands 模型。

  14. TOOL · CL_221423 ·

    OpenHands事件中发现服务健康监控脱节

    一项研究发现了一个事件,其中服务健康指标在对话失去活跃度的情况下仍保持绿色,这凸显了监控系统中潜在的脱节。该研究还详细介绍了涉及CodeFlowMu的恢复链,表明重点在于提高服务健康监控的可靠性和准确性。

  15. TOOL · CL_200075 ·

    AI物理学家PhysMaster在新基准测试中表现优于现有代理

    研究人员推出了PhysMaster,一个旨在解决复杂理论和计算物理学研究的自主AI物理学家。为了评估其能力,他们开发了PRL-Bench,这是一个源自100篇Physical Review Letters论文的基准测试,模拟了真实的研究工作流程。与Codex和ReAct等现有代理相比,PhysMaster在PRL-Bench上表现出更优越的性能,取得了最高分,并显著减少了长周期执行中的失败,尽管在物理知识和分析推理方面仍存在挑战。

  16. COMMENTARY · CL_189902 ·

    新的编码代理架构提出笨拙的运行时配合智能子代理

    一位开发者提出了一个新的编码代理架构,其中一个简单的“主会话”充当运行时,将复杂任务委托给一个“子代理”。该子代理将分析项目,识别已完成、存在问题以及下一步工作,然后执行工作并更新项目状态。这种方法旨在通过避免庞大的持久化上下文来简化长期运行的编码代理,主会话只需要提示子代理继续其工作。

  17. TOOL · CL_158571 ·

    PerfAgent 将 LLM 代码优化提升至专家级别

    研究人员开发了 PerfAgent,一个旨在增强大型语言模型 (LLM) 代理代码优化能力的新颖系统。与以往专注于正确性的代理不同,PerfAgent 使用分析器引导的迭代改进来识别和解决性能瓶颈。这种方法使代理能够实现与人类专家相当的速度提升,即使在处理包含抽象层和本机扩展的复杂代码库时也是如此。在 GSO 和 SWE-fficiency-Lite 基准测试的评估中,PerfAgent 显著提高了专家匹配补丁的速率,与现有方法相比,…

  18. COMMENTARY · CL_130637 ·

    开源AI生态系统表现不一,重点工具引人关注

    开源AI生态系统正经历波动,OSAI指数显示每日表现各异。有些日子显著增长,有些日子则出现明显下滑,表明这是一个动态且不断发展的格局。OSAI Pulse和Olud Pulse指标突出了特定的工具和类别,其中Ollama、LangFlow、Generative AI for Beginners和vLLM因其采用率和增长而受到认可。

  19. TOOL · CL_113285 ·

    ContextForge 工具通过压缩和重排来对抗 LLM 上下文遗忘

    上下文遗忘,即 LLM 在长对话中准确性下降的现象,现在可以被衡量和缓解。一款名为 ContextForge 的新开源工具充当中间件,对 token 进行评分、压缩、重排和预算分配,以减少这种退化。通过修剪过时信息并优先将关键事实放置在上下文窗口的边缘,ContextForge 在模拟代理会话中展示了显著的 token 削减(高达 92%)和准确性提升,恢复了标准基准可能忽略的被埋没的信息。

  20. RESEARCH · CL_113002 ·

    NVIDIA 发布 Open-SWE-Traces 数据集用于 AI 软件工程训练

    NVIDIA 发布了 Open-SWE-Traces,一个旨在训练人工智能软件工程任务代理的数据集。MarkTechPost 的一项新教程演示了如何处理该数据集以进行监督微调。该教程涵盖了轨迹解析、代码补丁分析和工具使用指标评估等技术,从而能够创建高质量的训练数据。