helmet
PulseAugur coverage of helmet — every cluster mentioning helmet across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
PolicyLong 通过策略内数据演进推进 LLM 上下文扩展
研究人员推出了一种名为 PolicyLong 的新方法,通过动态构建训练数据来扩展大型语言模型的上下文窗口。与使用固定模型生成数据的先前离线方法不同,PolicyLong 使用当前模型迭代地重新筛选数据,确保训练分布与模型不断发展的能力保持一致。这种策略内方法创建了一个新兴的自课程学习机制,其中正面和挑战性上下文都源自模型自身的熵景观。在 RULER、HELMET 和 LongBench-v2 等基准测试上的实验表明,PolicyLo…
-
Anyscale Connect 集成 Kubernetes Ray 部署
Anyscale 推出了 Anyscale KubeRay Connect,这是一款旨在将 Anyscale 平台与现有 Kubernetes Ray 部署集成的新产品。该新产品允许用户在利用 Anyscale 的可观测性和编排功能的同时,继续维护其现有的 KubeRay operator 及相关工具(如 Kueue 和 Argo CD)。Connect 产品通过在准入时将轻量级 sidecar 注入现有的 KubeRay 规范,从而…
-
人工智能自动化基础设施任务,将工程师的注意力转移到更高级别的设计上
人工智能在基础设施工程中的集成正在促使工程师的工作方式发生转变,这与之前的Kubernetes等技术进步类似。AI工具(如Claude)并非取代工程师,而是自动化了编写Terraform模块和Helm图表代码等重复性任务。这使得工程师能够专注于更高级别的决策、架构设计和问题解决,而不是基础设施配置的手动执行。
-
开发者分享超越基准测试的自定义大型语言模型评估方法
一位开发者分享了一种实用的方法,用于在标准基准测试之外评估新的大型语言模型(LLM)。作者提倡创建一套自定义的对抗性任务,这些任务以带有机器可校验契约的提示文件形式存储,以测试模型如何处理现实世界中通常很平凡的编码挑战。这种方法通过验证模型遵循项目特定约定和处理复杂提示而不引入错误的能力,确保模型能够集成到现有工作流程中。
-
Kubernetes 对象对于 MLOps 生产部署至关重要
本文解释了 Kubernetes 对象如何用于在生产环境中部署和管理机器学习模型。它详细介绍了 Pods、Deployments、Services 和 ConfigMaps 等关键对象,并说明了它们在容器编排、扩展和配置中的作用。文章还涉及了 Helm、CRDs 和 Operators 等高级概念,用于自动化复杂的生命周期任务,特别是针对 LLM 工作负载。
-
AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM
AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…
-
新论文:AI评估分数是易逝的知识主张
一篇新论文认为,语言模型的评估分数应被视为易逝的知识主张,而非绝对真理。作者提出分数具有形式性、范围和有效性窗口的特性,并建议平均多个信号可能导致“信任膨胀”。他们通过展示HELM排行榜上的顶尖模型在按平均分数排名与按“最弱环节”聚合方法排名时存在显著差异来说明这一点,突显了对评估结果明确元数据が必要。
-
Mintlify 收购 Helicone,将可观测性工具置于维护模式
Mintlify 于 2026 年 3 月 3 日收购了开源可观测性平台和 AI 网关 Helicone。收购后,Helicone 的产品已进入维护模式,这意味着将继续进行错误修复和支持新模型,但积极的功能开发已停止。Mintlify 已表示将协助现有客户迁移到替代解决方案。
-
观察到LLM上下文压缩质量退化曲线,缺乏基准测试
一位用户观察到,像DeepSeek V4和Claude Code这样的LLM,在重复进行上下文压缩后,输出质量并非线性下降。相反,在第二次压缩后似乎会出现短暂的改善,随后才出现下降。该用户搜索了测量这种多轮压缩退化的现有基准测试,但没有找到专门针对这种现象的测试,现有的测试侧重于静态输入长度或单轮漂移。如果这种“压缩曲线”是真实存在的,它可能会告知用户何时重置会话,并为比较LLM提供商提供一个新的维度,但目前主要的基准测试套件缺乏这一指标。
-
新研究论文批评LLM代理评估,提出预测有效性
一篇新的研究论文提出,在评估大型语言模型(LLM)代理时,应超越静态排行榜。作者认为,目前侧重于汇总分数的基准测试未能预测实际表现,并且在不同设置下表现出排名不稳定性。他们主张采用一种新的以预测有效性为中心的评估框架,该框架衡量样本内和样本外排名之间的相关性,并引入了一个十二级测量装置,以更好地捕捉与部署相关的维度。
-
自托管 LLM 代理获得值得信赖的自动更新功能
作者详细介绍了管理异构自托管 LLM 代理集群所面临的挑战,特别是更新和状态报告方面。为了解决这个问题,他们开发了一个新的系统,使用名为 AgentRelease 的集群范围 CRD,该系统支持声明式、分阶段和健康门控的代理更新回滚。该系统确保代理可以安全地更新自身并准确报告其状态,从而从手动更新转向更自动化和值得信赖的流程。
-
AI智能体自动化混凝土屏障设计,提高准确性和效率
研究人员开发了两种不同的多智能体框架,用于自动化混凝土桥梁屏障的设计。其中一个名为HELM的框架,通过将过程分解为可验证的检查点,使用人类-智能体协议将有限元建模的成功率从20%提高到75%。另一个框架利用AutoGen创建了一个“生成-评估-优化”循环,实现了超过98%的设计准确率,并证明了在结构工程任务中,较小的轻量级模型可以优于较大的模型。
-
新研究揭示机器学习基准易受操纵
研究人员分析了机器学习基准被操纵的易感性,将数据集视为选民,模型视为候选人。他们发现,为了在排行榜上获得最高排名而策略性地将基准数据包含在模型的训练集中是一个NP难问题,类似于选举贿赂。该研究引入了“实例级鲁棒性”来量化操纵所需的最小数据集,并评估了其在MMLU和BIG-Bench Hard排行榜上的表现。
-
新研究强调机器学习评估工具存在重大问题
一项对57个机器学习评估工具进行的新的实证研究揭示了重大的操作挑战,特别是在模型、数据集和评估者集成的“规范”阶段。研究发现,未实现的功能、文档缺失和输入验证缺失是导致问题的三大根本原因,占所有问题的60%以上。这些发现主张将“评估工程”作为一项独立的软件工程学科来认可,类似于DevOps。
-
新研究探究大型语言模型的元认知和策略性任务管理
两篇新研究论文引入了评估大型语言模型元认知能力的框架。第一篇,TRIAGE,评估大型语言模型在资源受限的情况下策略性地选择和排序任务的能力,揭示了当前模型在前瞻性控制方面存在显著差距。第二篇,《元认知探针》,提供了一种诊断工具,将大型语言模型的置信度行为分解为五个不同的维度,强调标准基准未能捕捉模型对其自身错误的自我认知。
-
AI 有望缓解配置复杂软件工具时的开发者阻力
作者讨论了开发者在配置开源软件时面临的阻力,并将其与 Microsoft 和 Apple 等公司的用户友好方法进行了对比。他们提出 AI 有可能通过帮助开发者理解配置和设置选项来协助这一领域,但同时警告不正确的提示可能导致错误。文章提出了一个使用 RJSF 和 JSON Schema 的实验性解决方案,作为创建动态 UI 进行配置的一种方式,并以 Fluent Bit 插件模式为例。
-
Kstack 提供 AI 驱动的 Kubernetes 监控和故障排除技能
Kstack 是一个专为 Claude Code 等 AI 代理设计的新技能包,旨在增强 Kubernetes 集群的监控和故障排除能力。它与 kubectl 和 Helm 等现有工具集成,并利用 AI 进行根本原因分析和日志提取。该技能包提供了集群状态、安全审计、网络检查和成本分析等命令,为用户提供了一种更智能、更高效的方式来管理其 Kubernetes 环境。
-
HELM 系统优化 GPU HBM 以降低生成式推荐延迟
研究人员开发了 HELM 系统,旨在通过动态管理嵌入(EMB)和 KV 缓存之间的高带宽内存(HBM)分配来优化生成式推荐模型的性能。现有方法通常无法适应不断变化的工作负载需求,导致错失显著的延迟改进。HELM 利用基于 PPO 的控制器进行自适应内存分配,并采用感知 EMB-KV 的调度器来联合管理 HBM 和请求路由,从而大幅降低了 P99 延迟。
-
AI代理需要“AgentOps”上下文;KServe简化AI推理部署
引入了AgentOps的概念,将其定位为基础设施即代码(Infrastructure as Code)之上的一个层级,专注于AI代理在采取行动前所需的上下文理解。这包括定义什么是事实、什么已经过验证以及不应重复哪些决策。另外,还提供了一份nxs-universal-chart v3.0指南,详细介绍了使用KServe部署AI推理模型所需的组件,如流量路由、自动扩展和监控,以简化部署流程。
-
AI模型评估正成为昂贵的瓶颈,成本已超越训练费用
AI模型评估正变得成本高昂,近期基准测试的成本高达数万美元,并消耗数千个GPU小时。对于本质上更复杂且对设置变化敏感的基于代理的评估而言,这种高成本尤为突出。虽然存在通过子采样降低静态基准测试成本的方法,但这些技术对于基于代理的评估的动态和嘈杂特性效果不佳,从而造成了研发瓶颈。