实体
BoolQ
BoolQ
PulseAugur coverage of BoolQ — every cluster mentioning BoolQ across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新基准套件评估大语言模型在吉尔吉斯语上的理解能力
研究人员开发了KyrgyzLLM-Bench,这是一个旨在评估大语言模型(LLMs)在吉尔吉斯语上表现的新基准套件。该套件包括了本地创作的数据集,如KyrgyzMMLU和KyrgyzRC,以及已建立基准的翻译版本,如WinoGrande和TruthfulQA。研究评估了26个LLMs,结果显示,对于WinoGrande和BoolQ等任务,模型排名通常会从英语迁移到吉尔吉斯语,但HellaSwag由于翻译的痕迹可能存在显著的性能差距。研…
-
新的强化学习框架优化LLM KV缓存以实现高效推理
研究人员开发了一个名为KV Policy (KVP) 的新颖框架,通过优化键值(KV)缓存来解决大型语言模型(LLM)的内存需求。KVP将KV缓存驱逐重构为一个强化学习问题,训练轻量级代理来预测未来解码的token有用性。该方法在长上下文和多轮对话基准测试中显著优于现有的启发式方法,并展示了在不改变底层LLM的情况下泛化到新任务和更长序列长度的能力。
-
Regret Pre-training 提升语言模型知识接地能力
研究人员开发了一种名为 Regret Pre-training 的新自监督学习框架,以改进因果语言模型。该方法利用了通常在标准因果训练中不可用的未来信息,通过使用双视图架构。该框架训练模型同时生成因果学生分布和未来条件教师分布,最小化它们之间的差异以传递面向未来的信号。在九个下游任务上的实验显示准确性显著提高,其中一种配置将 BoolQ 的性能提高了 18 个百分点以上。