PulseAugur
实时 06:18:41
实体 HarvestBench

HarvestBench

PulseAugur coverage of HarvestBench — every cluster mentioning HarvestBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_239200 ·

    新的基准测试衡量LLM代理避免杀死动物的意愿

    一个名为HarvestBench的新基准测试已被开发出来,用于评估大型语言模型(LLM)代理对避免伤害生物的重视程度。该基准测试模拟了一个合作的玉米收割场景,其中LLM代理控制拖拉机,系统测量它们为避免碾压田间的动物而愿意支付的成本(以燃料成本衡量)。结果显示,不同模型之间的杀死率存在显著差异,一些代理对价格和简报条件表现出敏感性,而另一些则表现出很高的残忍率。