PulseAugur
实时 13:44:41
实体 In-context Laziness

In-context Laziness

PulseAugur coverage of In-context Laziness — every cluster mentioning In-context Laziness across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_245358 ·

    新的基准评估大型语言模型在真实世界可穿戴健康数据上的推理能力 · 跟踪 2 个来源

    研究人员开发了两个新的基准测试 HealthLoopQA 和 WearableQA,旨在评估大型语言模型 (LLM) 在解读来自可穿戴设备的复杂、纵向健康数据方面的能力。HealthLoopQA 专注于糖尿病护理,包含一个包含十一种推理能力的分类法以及一个用于设备故障和网络物理攻击的模拟测试平台。WearableQA 则使用了来自 200 名用户、为期 500 天的真实世界数据,包含 16 种类型的 4,084 个多项选择题,以评估数…