ARC challenge
PulseAugur coverage of ARC challenge — every cluster mentioning ARC challenge across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的Arkios语言模型在英语-尼泊尔语文本上进行训练
研究人员推出了Arkios,一个拥有10.4亿参数的语言模型,该模型在1500亿个英语和尼泊尔语的token上进行了训练。该模型使用了自定义训练堆栈和梵文感知分词器。评估显示,Arkios在ARC-Easy和ARC-Challenge基准测试中表现优于同类开放模型,但这可能是由于与基准测试的数据重叠,而非整体能力。该研究还强调了评估低资源语言模型所面临的挑战,因为标准的单项选择题提示可能导致尼泊尔语理解的随机猜测结果。
-
新的 Credal LLM 改进了不确定性表示并减少了幻觉
研究人员引入了 Credal 大型语言模型 (CLLM),以解决 LLM 生成自信但错误的答案的问题。与使用单一预测分布的标准 LLM 不同,CLLM 采用 LoRA 适配器集成来创建 Credal 集。该集合暴露了一系列合理的分布,从而可以推导出更好地反映不确定性的承诺分数。所提出的方法,Credal Token Commitment (CTC) 和 Semantic Commitment Consistency (SCC),在 G…
-
新的FPO方法无需反向传播即可适应LLM,提高吞吐量
研究人员开发了一种名为前向传播仅(FPO)训练的新方法,该方法无需通过模型层进行反向传播即可适应大型语言模型。与标准微调方法相比,该技术实现了显著更高的吞吐量并使用了更少的内存。FPO在域外基准测试中保持了性能,这是全网络微调不总是能复制的特性。该方法依赖于这样一个观察结果:Transformer中后期层的预测误差可以近似真实梯度,从而无需复杂的自动梯度图构建即可将误差信号直接应用于目标层。
-
研究审计多智能体LLM中的潜在通信
一项新的研究论文调查了多智能体大型语言模型中潜在通信的有效性,特别是检查了中继键值(KV)缓存的作用。该研究通过用操纵过的版本替换实际缓存来因果审计这些系统,发现当接收方需要发送方的私有信息时,中继缓存会显著提高性能。然而,当不需要私有信息时,性能差异可以忽略不计,这表明观察到的收益并非总是由于真正的“潜在思维”传输。研究还强调,缓存效应的影响可能差异很大,一些方法在缓存清零时显示出显着的性能下降,而另一些方法则对不匹配的缓存表现出最小的影响。
-
新的HG-CRC框架增强了LLM在子群体中的风险控制
研究人员开发了一个名为分层组条件共形风险控制(HG-CRC)的新框架,以提高大型语言模型的可靠性。该方法确保风险保证不仅在整体上得到满足,而且在模型用户群体的特定子群体中也得到满足,解决了边际保证可能掩盖群体过度暴露于错误的问题。HG-CRC通过应用分层结构和Bonferroni校正来实现这一点,仅需要一个独立的校准集而无需重新训练模型。在Qwen3-4B和Llama 3.1 8B-Instruct等模型上的评估表明,在ARC Cha…
-
新研究强调了大型语言模型和视觉语言模型中思维链的低效和过度自信
研究人员发现,大型语言模型(LLMs)的思维链(CoT)提示存在低效问题,其中有效但冗余的推理步骤会增加计算成本,但不会提高准确性。新开发的诊断基准 RIV-GSM8K 和一个名为 CAID 的指标,用于识别和惩罚这些“信息泡沫”步骤。一种事后压缩策略 PACE,利用 CAID,在保持准确性的同时,在各种基准测试中显著减少了 token(31-53%)。另外,值得注意的是,视觉语言模型(VLMs)中的 CoT 提示可能导致过度自信,这…
-
新方法通过自适应解码策略提高 LLM 推理速度
研究人员开发了 BlockPilot,一种新颖的投机解码方法,可自适应地预测生成文本的最佳块大小。该方法通过学习一种策略来提高效率,该策略根据预填充表示来选择块大小,从而实现显著的加速和更长的接受长度。此外,另一篇论文介绍了一种用于掩码扩散语言模型的连续解码框架,该框架允许 token 累积部分进度,为文本生成提供了更灵活的方法。
-
新的剪枝方法可保留LLM推理性能
研究人员开发了一种名为因果归因剪枝(CAP)的无训练新方法,可在不损害其推理能力的情况下减小大型语言模型的规模。CAP通过衡量注意力头对推理任务的因果影响来识别和剪枝不那么关键的注意力头。与Wanda等现有方法相比,该方法在ARC-Challenge等基准测试上表现出显著的改进,并在中等稀疏度水平下对Llama-3和Mistral-7B-Instruct等模型显示出潜力。
-
新研究绘制语言模型社会推理的起源图谱
研究人员开发了一种方法,通过分析其训练数据来理解语言模型中社会推理能力的来源。他们使用基于梯度的归因方法对 Dolma3 数据集进行分析,绘制了语料库中对社会推理和 STEM 推理有贡献的特定区域。研究发现,社会推理和 STEM 推理的来源数据不同,推理能力比事实知识对这些差异更敏感。有针对性的遗忘实验部分验证了这些发现,表明移除高归因数据箱会损害对齐基准。
-
HRM-Text:拥有10亿参数的新型架构模型挑战LLM范式
Sapient Intelligence开发的一款名为HRM-Text的新语言模型,因其创新的架构而受到关注,该架构侧重于内部推理,而非仅仅增加模型规模或训练数据。该模型仅拥有10亿参数,训练成本约为1500美元,在MATH和GSM8K等基准测试中取得了令人印象深刻的分数。这种被称为分层推理模型(HRM)的架构强调潜在推理,允许模型在产生输出之前在其内部状态中执行多轮、分层和递归计算,这一概念也得到了Yoshua Bengio团队研究的探索。
-
新的量化感知训练方法实现近乎无损的大模型性能
研究人员开发了一种新的大语言模型(LLM)量化感知训练(QAT)方法,称为Max-Window Scale Estimation。该技术解决了两种失效模式:amax饱和(延迟的尺度估计会破坏表示)和灾难性遗忘(激进的学习率会抹去预训练知识)。通过采用保守的DTS策略和BF16预热,该方法显著降低了在MMLU和HellaSwag等基准测试上的性能下降,实现了近乎无损的结果,且训练损失偏差极小。
-
语言模型的自验证有效性因任务和模型而异
研究人员调查了语言模型将其自身答案作为置信信号进行验证的有效性。他们使用 Phi-2 和 Qwen 等各种模型在 ARC-Challenge 和 TruthfulQA-MC 数据集上进行的研究发现,自验证的效用高度依赖于特定任务、模型家族和提示设计。虽然它在 ARC-Challenge 上对某些 Qwen 模型显示出显著改进,但在 TruthfulQA-MC 上的可靠性不太一致,其他基线模型在该数据集上通常表现更好。研究结果表明,自验…
-
研究人员挑战 ARC 赛题,寻求非 LLM 的通用人工智能研究路径
通用人工智能 (AGI) 的 ARC 挑战赛正由一位研究人员攻克,他专注于 AGI3。该挑战提供了一条不同于大型语言模型的研究方向。ARC 奖旨在推动通用人工智能领域的发展。