Qwen2.5
PulseAugur coverage of Qwen2.5 — every cluster mentioning Qwen2.5 across labs, papers, and developer communities, ranked by signal.
- instance of CatalyzeX 90%
- instance of Gotit.pub 90%
- instance of ScienceCast 90%
- instance of Qwen2.5-72B 90%
- used by alphaXiv 70%
- used by Grpo 70%
- instance of qwen2.5:7b 70%
- instance of Pythia 70%
- instance of Llama2Vec: Unsupervised adaptation of large language models for dense retrieval 70%
- used by Qwen3-4B 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
12 天有情绪数据
-
新框架模拟AI对齐规模法则
研究人员提出了一个新的框架来分析AI对齐挑战如何随着模型规模的增大而扩展,将对齐视为一组可衡量的关系而非单一属性。他们的模型表明,对于某些风险,对齐负担会随着模型能力增强而增加,而对于其他风险,则会减少。对Pythia分类器和Qwen模型的初步实验表明,虽然真实性和陈述性倾向随着规模的增大而提高,但谄媚和植入后门等问题呈现出更复杂的规模行为。
-
FP8量化成本节省因模型输出问题而产生误导
一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。
-
新的LLMAE方法将语言模型转变为文本自动编码器
研究人员开发了一种名为LLMAE的新方法,将预训练的仅解码器语言模型重新用作高保真连续文本自动编码器。该技术通过结构化注意力掩码和LoRA适配,实现了从中间层的激活创建固定长度的潜在瓶颈。LLMAE在文本序列重建方面表现出高精度,在Gemma 3和Qwen2.5模型上保留了高达97%的原始文档逐字内容。该方法还通过训练一个直接在LLMAE潜在空间中生成详细图像字幕的扩散模型来展示其效用。
-
新的HARPO框架提高了大型语言模型的忠实度和创造力
研究人员开发了HARPO,一个旨在提高大型语言模型忠实度和创造力的新型强化学习框架。HARPO使用一个在可验证反馈上训练的具身智能生成奖励模型(HA-GRM)来评估输出。一个关键组件,选择性激活机制(SAM),确保创造性奖励仅应用于被HA-GRM判定为无幻觉的输出。实验表明,HARPO在包括Qwen2.5和Qwen3在内的各种Qwen模型上显著降低了幻觉率并提高了创意写作分数。
-
新工具可确定性地评估LLM基准,标记模型可复现性问题
一款名为Crucible的新工具已被开发出来,用于解决当前大型语言模型(LLM)基准测试的缺陷。Crucible不依赖其他模型来评判性能,而是使用确定性的评分系统,进行正则表达式和JSON路径等精确比较。这种方法旨在提供可复现的结果,并识别出区分度不足以区分不同模型的任务。该工具还突出了专有模型存在的问题,指出当由于无法公开访问特定模型版本而无法重现运行结果时的情况。
-
新的QK-Wanda方法通过耦合查询和键来改进LLM剪枝
研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。
-
Jev 方法使 AI 能够在不生成答案的情况下进行选择
本文介绍了 Jev,一种使 AI 模型能够在不生成答案的情况下选择答案的方法,重点关注速度、准确性和校准。文章探讨了如何在 Azure 上实现 Jev,并讨论了使用 Qwen2.5 模型进行的实验以证明其有效性。核心思想是利用校准决策模型来实现更高效、更可靠的 AI 响应。
-
新研究表明新鲜草图可加速岭回归
一篇新发表在arXiv上的研究论文探讨了在岭回归中使用“新鲜草图”的优势,这是一种用于加速大规模回归问题的技术。论文表明,在每一步绘制新的随机数,而不是重复使用相同的草图,可以带来更强的收敛保证和更快的收敛速度。在合成数据和真实世界数据上进行的实验,包括在Qwen2.5表示上的测试,支持了这些理论发现。
-
AI预训练和中期训练增强奖励适应性
研究人员探讨了预训练和中期训练如何促进AI模型有效适应奖励。他们的研究描述了在训练奖励上达成一致但可能导致新输入结果不同的机制。他们证明了与任务无关的源观察对于解决这种歧义至关重要。使用预训练的Qwen2.5检查点在八个世界进行的实验表明,使用正确的源和首次操作监督训练的序列模型,与对照组相比,成功率显著提高,这突显了信息获取和奖励指导学习之间的分工。
-
新框架通过无套利衡量语言模型理解能力
研究人员开发了一个名为 Arbitr 的新框架,旨在通过将语言模型理解问题化为无套利问题来改进其理解能力。该方法将理解定义为有界交易者无法利用模型概率输出中的逻辑不一致性来保证获利。研究发现,包括 Qwen2.5 和 Phi-3.5 在内的标准语言模型极易受到此类利用,尤其是在参数量较小的情况下,此时置信度可能具有误导性。Arbitr 训练在不损害任务准确性的情况下,显著降低了跨各种逻辑模式的可利用性。
-
AI模型在决策任务中优先考虑标签而非定义
一项关于 Jev 类型决策模型的新研究表明,这些用于分类和路由的系统在选项标签和书面定义之间表现出强烈的偏见。研究人员发现,即使删除了定义,准确性也基本保持不变,而将选项重命名为“A”和“B”等通用标签会显著提高性能。这种“选项标签偏见”被追溯到提示渲染而非模型的决策头,并确定了特定的代码表达式是原因。该研究还提出了一个测试,供从业者识别其模型中的这种偏见,并提出了缓解策略。
-
LLM 的注意力机制在新颖的语境和不同模型中表现出独特的行为 · 跟踪 3 个来源
研究人员正在探索大型语言模型(LLM)的内部机制,特别是注意力函数,如何影响它们在新颖语境下的行为。一项研究提出了一种“函数混合注意力”(MoFA),该模型为 softmax 和 sigmoid 头分配固定的比例,发现这种比例对分布内任务的影响很小,但对分布外性能有显著影响,并根据比例区分文本类型。另一篇论文回顾了 LLM 中注意力机制的演变,通过记忆表示、更新、访问、读出和整合等视角分析了上下文记忆的发展,强调了深度和异构架构如何协…
-
研究发现,训练后的大语言模型更有趣但多样性降低
一项研究调查了训练后是否能增强大型语言模型的幽默感,发现虽然它通常能使其更有趣,但也会降低响应的多样性。该研究追踪了 Tulu 3、OLMo 3.1 和 Qwen2.5 等模型在训练后 11 个阶段的表现,使用了超过 2,300 次人工评分的正面评价。结果表明,后期训练阶段产生了更搞笑、更简洁的笑话,但模型倾向于重复类似的笑话结构。
-
新研究通过内部探测和模型聚合解决 LLM 幻觉问题
研究人员正在开发检测和减轻大型语言模型 (LLM) 幻觉的新方法。一种方法涉及探测模型内部状态,以确定幻觉的确切发生和持续,表明外部观察者在检测方面与模型本身一样有效。另一种策略侧重于聚合多个廉价的开源模型,充当可靠的裁判,以较低的成本实现接近前沿模型的性能。此外,针对特定模态(如视听 LLM)的新技术正在出现,通过引导内部问题状态来解决源混淆的地面化幻觉。
-
新研究解决 LLM 训练效率、容错和微调优化问题 · 跟踪 9 个来源
arXiv 上发布的多篇研究论文探讨了优化大型语言模型 (LLM) 训练和微调的新方法。Leto 引入了一个系统,用于在 LLM 训练期间从硬件故障中更快地就地恢复,显著提高了生产性训练时间。其他论文侧重于高效的微调技术,包括使用 LOOM 进行在线数据选择,使用零阶和一阶优化方法 (ZFO) 进行自适应步长选择,以及使用 LoRA-Norm 进行训练后归一化以平衡适应性增益。此外,TACO 为 LLM 微调提供了一种内存高效的优化器…
-
研究显示 LLM 在处理嘈杂文档时遇到困难
一篇新的研究论文对几种开源大语言模型(LLM)从文档中提取键值对的性能进行了基准测试,特别考察了它们在光学字符识别(OCR)噪声下的表现。研究发现,尽管 LLM 在处理干净文本时表现良好,但在面对嘈杂的 OCR 输入时,其准确性会显著下降。随着输入损坏的增加,模型之间的性能差异也减小了,这凸显了在实际场景中 OCR 质量成为主要的限制因素。该研究识别出常见的失败模式,如键值错位和幻觉,强调了在 OCR 技术和 LLM 的语义推理能力方…
-
新研究探讨VLA模型效率和延迟权衡 · 跟踪2个来源
两篇新研究论文探讨了视觉-语言-动作(VLA)模型的效率和性能。第一篇论文分析了SmolVLA,展示了ONNX等部署优化如何显著降低延迟,但可能会影响任务成功率,尤其是在空间任务中。第二篇论文研究了高效VLA模型的设计,发现动作头初始化对性能至关重要,并且当前的扩展实践在准确性方面可能会带来边际效益递减的延迟。
-
语言模型被测试为紧凑型规范预言机
研究人员探索使用语言模型作为“规范预言机”来回答有关复杂系统的问题,旨在平衡细节与简洁性。他们比较了将学习到的事实存储在外部笔记中与修改模型权重的方法。对于Qwen2.5 7B模型,基于权重的预言机在结构化世界上的准确率比非结构化世界高出18.5个百分点,尽管这需要更多的存储空间(175 KiB 对比 16 KiB)。这表明调整后的权重更擅长利用潜在结构,而外部笔记在存储效率方面更高。
-
自动印地语 QNLP 超级标记减轻了手动注释负担
研究人员开发了一种自动超级标记方法,用于印地语量子自然语言处理 (QNLP),以解决语法类型分配所需的手动工作。该方法将印地语预群超级标记视为一个标记级别分类任务,利用了 380 个句子的手动注释语料库。结果表明,在低资源环境下,简单的词汇和上下文模型表现强劲,上下文回退达到了 64.56% 的准确率。基于提示的方法与 Qwen2.5 表现较差,但词汇修复将 LLM 辅助预测提高到 64.08%,这凸显了将符号语法知识与生成模型相结合的好处。
-
Qwen2.5模型在数学任务中显示出相关的验证器错误 · arXiv论文
一篇新论文研究了Qwen2.5-1.5B模型生成的完成组内验证器错误的独立性。该研究分析了多个数学数据集上近25,000组八个完成项,发现组内验证器错误具有显著的0.530的相关性。这种依赖性因答案格式而异,分数和符号表达式比单位注释显示出更强的聚类。研究结果表明,对验证器噪声的分析应考虑提示难度和答案形式,而不是仅仅依赖于聚合错误率。