LM Evaluation Harness
PulseAugur coverage of LM Evaluation Harness — every cluster mentioning LM Evaluation Harness across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI Harnesses,而非模型,是新的科技战场
据dev.to的一篇文章称,AI竞赛已从开发更大的模型转向完善围绕它们的“harness”。这个harness包括提示、工具和控制流,已成为Anthropic、OpenAI和Google等科技巨头的新战场。差异化现在源于这些harness能多有效地让模型执行任务,而不是模型本身的优越性。公司正在投资它们的harness生态系统以实现用户锁定并提供独特的功能,其中Anthropic专注于开放协议和可重用技能,而OpenAI则强调工具执行…
-
Harness Engineering:构建生产级 AI Agent 的学科
Harness engineering 被视为构建生产级 AI Agent 的关键学科,强调围绕代码或“harness”构成了 Agent 架构的大部分,而非语言模型本身。这种观点将焦点从模型的能力(这些能力是租用的且可能随时变化)转移到可控且可拥有的 harness 上。该术语的起源追溯到现有的概念,如测试 harness、评估 harness 和强化学习环境,突出了一个共同的模式:一个小的核心组件被一个更大的、支持其功能的脚手架所包围。
-
使用Qwen2.5-0.5B评估LLM的成本低于1美元
这篇博文详细介绍了一种经济高效的评估大型语言模型的方法,证明了运行全面的基准测试的成本可以低于一美元。作者使用免费的Google Colab T4实例在三个不同的任务上测试了Qwen2.5-0.5B模型:GSM8K用于数学推理,HellaSwag用于常识,TruthfulQA-MC2用于真实性。实验重点是测量运行时间和成本,利用lm-evaluation-harness并进行特定调整以优化性能和降低费用,例如限制生成令牌的长度。
-
AI模型评估正成为昂贵的瓶颈,成本已超越训练费用
AI模型评估正变得成本高昂,近期基准测试的成本高达数万美元,并消耗数千个GPU小时。对于本质上更复杂且对设置变化敏感的基于代理的评估而言,这种高成本尤为突出。虽然存在通过子采样降低静态基准测试成本的方法,但这些技术对于基于代理的评估的动态和嘈杂特性效果不佳,从而造成了研发瓶颈。