BoolQ
PulseAugur coverage of BoolQ — every cluster mentioning BoolQ across labs, papers, and developer communities, ranked by signal.
-
新框架支持在考虑热约束的边缘设备上进行鲁棒的LLM微调
研究人员开发了Thermo-FL,一个用于在边缘设备上进行大型语言模型联邦微调的新框架。该方法通过将热感知纳入训练过程,解决了硬件不稳定和对抗性攻击带来的挑战。Thermo-FL根据设备温度动态调整本地适配器训练和更新传输密度,而鲁棒的服务器端聚合管道TERRA则过滤和验证稀疏更新,以在BoolQ和GSM8K等基准测试中保持模型完整性和性能。
-
新的Transformer架构探索稀疏令牌路由以提高效率
研究人员开发了SEWN,一种新颖的双流Transformer架构,旨在通过选择性地处理令牌来提高效率。该模型使用学习到的门控机制,通过轻量级或全容量处理路径来路由令牌。实验表明,与参数匹配的基线相比,这种路由机制在准确性方面几乎没有变化,而令牌重要性信号的有效性高度依赖于学习方法。
-
MAPLE框架优化MoE LLM专家分配以提高效率
研究人员开发了MAPLE,一个新颖的框架,旨在优化混合专家(MoE)Transformer模型中专家的分配。与将专家均匀分布在所有层中的传统方法不同,MAPLE根据层级敏感性自适应地重新分配专家预算。这种即插即用方法在不改变模型权重或需要重新训练的情况下提高了性能。实验表明,MAPLE在DeepSeek-MoE-16B等模型上提高了准确性,并显著降低了服务延迟和提高了吞吐量。
-
新框架实现跨模型规模的知识迁移
研究人员开发了一种名为 Activation-Prune-Merge (APM) 的新颖框架,通过从更大、架构不同的模型迁移知识来增强较小的语言模型。APM 根据任务条件激活图谱,从供体模型中识别并提取层、隐藏维度和注意力头等关键组件。然后,将提取的切片以小的插值系数注入到接收模型中,从而在无需精确结构对齐的情况下提高其能力。该方法在 16 个基准测试中显示出显著的准确性提升,包括在 RTE、QNLI 和 BoolQ 上的显著改进,表…
-
新基准套件评估大语言模型在吉尔吉斯语上的理解能力
研究人员开发了KyrgyzLLM-Bench,这是一个旨在评估大语言模型(LLMs)在吉尔吉斯语上表现的新基准套件。该套件包括了本地创作的数据集,如KyrgyzMMLU和KyrgyzRC,以及已建立基准的翻译版本,如WinoGrande和TruthfulQA。研究评估了26个LLMs,结果显示,对于WinoGrande和BoolQ等任务,模型排名通常会从英语迁移到吉尔吉斯语,但HellaSwag由于翻译的痕迹可能存在显著的性能差距。研…
-
新的强化学习框架优化LLM KV缓存以实现高效推理
研究人员开发了一个名为KV Policy (KVP) 的新颖框架,通过优化键值(KV)缓存来解决大型语言模型(LLM)的内存需求。KVP将KV缓存驱逐重构为一个强化学习问题,训练轻量级代理来预测未来解码的token有用性。该方法在长上下文和多轮对话基准测试中显著优于现有的启发式方法,并展示了在不改变底层LLM的情况下泛化到新任务和更长序列长度的能力。
-
Regret Pre-training 提升语言模型知识接地能力
研究人员开发了一种名为 Regret Pre-training 的新自监督学习框架,以改进因果语言模型。该方法利用了通常在标准因果训练中不可用的未来信息,通过使用双视图架构。该框架训练模型同时生成因果学生分布和未来条件教师分布,最小化它们之间的差异以传递面向未来的信号。在九个下游任务上的实验显示准确性显著提高,其中一种配置将 BoolQ 的性能提高了 18 个百分点以上。