PulseAugur
实时 23:41:52
实体 EQ-Bench3

EQ-Bench3

PulseAugur coverage of EQ-Bench3 — every cluster mentioning EQ-Bench3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_249076 ·

    字节跳动HarnessDev评估大型语言模型在代理框架工程方面的能力

    来自字节跳动Seed及其他机构的研究人员开发了HarnessDev,这是一个评估大型语言模型(LLM)自行设计代理框架能力的全新评估框架。与固定框架的传统基准测试不同,HarnessDev评估模型自身为框架编写的代码。在创建阶段,模型从基本原语构建框架;在演化阶段,模型利用执行反馈进行优化。初步结果显示,不同模型和领域表现各异,Opus 4.8在编写和机器学习实验方面表现强劲,而GPT-5.5在搜索任务方面表现出色。