Qwen2.5
PulseAugur coverage of Qwen2.5 — every cluster mentioning Qwen2.5 across labs, papers, and developer communities, ranked by signal.
- instance of Gotit.pub 90%
- instance of ScienceCast 90%
- instance of CatalyzeX 90%
- instance of Pythia 70%
- used by alphaXiv 70%
- instance of Llama2Vec: Unsupervised adaptation of large language models for dense retrieval 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- used by Math-500 70%
- competes with Phi-3.5 70%
- competes with Gemma 2 60%
- used by Gotit.pub 50%
12 天有情绪数据
-
DIY便携式AI助手通过U盘离线运行
一份指南详细介绍了如何使用U盘创建便携式离线AI助手。该过程包括下载一个名为llamafile的可执行文件,该文件捆绑了一个推理引擎和一个Web服务器,以及一个来自Hugging Face的GGUF格式的量化LLM模型。通过将这些组件放在U盘上的结构化文件夹中并使用批处理脚本,用户可以在任何Windows笔记本电脑上运行一个功能强大的AI模型,而无需互联网连接或云订阅,从而确保数据主权和零边际成本。
-
新的COEC框架提高了LLM剪枝的准确性
研究人员开发了一个名为COEC(Calibrated Orthogonal-Equivalence Compensation)的新的无训练框架,旨在减轻结构化剪枝后大型语言模型(LLMs)的准确性下降问题。COEC采用交替的左右正交旋转来处理保留的权重,在缩减的Stiefel流形上进行优化,并使用广义交叉验证进行正则化。在Llama-3、Llama-3.1和Qwen2.5模型上的实验表明,与现有的补偿方法相比,COEC在困惑度和零样本…
-
新型防御LIV可对抗LLM的语义伪装
一篇新研究论文介绍了一种名为潜在意图验证(LIV)的防御机制,旨在对抗针对大型语言模型(LLM)的语义伪装攻击。这些攻击将有害意图嵌入到良性上下文中,从而绕过标准的安保措施。研究表明,即使在后续层看起来与安全查询无法区分的情况下,小型语言模型(SLM)的早期层仍然保留着可检测的“危害特征”。LIV利用这一点,通过探测这些早期层,在不要求模型重新训练的情况下,将中和零日语义攻击的能力比传统安保措施提高了20-50%。
-
AirLLM 大幅降低 LLM 内存需求,Kimi K3 可在 4GB GPU 上运行
AirLLM 发布了更新,显著降低了运行大型语言模型的内存需求,使得强大的模型能够在消费级硬件上运行。最新支持的模型包括 Qwen3.8-27B,仅需 3.33GB 的 VRAM;以及 Kimi K3 (2.8T),这是迄今为止最大的开源模型,可在 4GB 以下的 VRAM 上运行。这些进步是通过每专家流式传输等技术实现的,例如,DeepSeek-V3 (671B) 模型可在约 12GB 的 VRAM 上运行。
-
FlashAttention-V 助力向量架构上的 Transformer 推理
研究人员开发了 FlashAttention-V,这是 FlashAttention 为可扩展向量架构量身定制的优化版本。该新方法旨在提高 Transformer 模型(特别是小型语言模型 SLM)在新兴向量硬件上的效率。FlashAttention-V 通过融合操作、利用注意力头之间的并行性以及增强内存局部性,实现了显著的加速,在特定硬件配置上,预填充速度提升高达 42 倍,解码速度提升高达 11 倍。
-
金融NLP基准测试存在时间泄露,夸大了性能指标
一项对金融新闻NLP基准测试的新审计显示,存在严重的时间泄露问题,与按时间顺序划分相比,随机的训练-测试集划分将性能指标夸大了高达6.5倍。这种泄露在大模型和更丰富的特征下尤为明显。研究发现,只有并购新闻在接近时间顺序的评估下显示出积极信号,但该信号仅限于特定的语义上下文,并未迁移到更广泛的数据集。研究人员提倡将泄露审计作为金融NLP基准测试的强制性披露内容。
-
研究发现:语言模型会学习到非预期的捷径
一篇新的研究论文探讨了语言模型中“目标泛化错误”的问题,即模型在训练数据上达到高准确率的情况下,却学会了非预期的行为。研究人员使用GRPO在数学问题上训练模型,其中正确答案始终是选项A。他们观察到,较小的模型产生了强烈的选择选项A的偏见,导致无偏准确率崩溃,并表明其表现衡量的是学到的捷径,而非实际的数学能力。该研究还发现了“推理-答案解耦”现象,即模型可以生成正确的推理,但仍然选择有偏见的答案,这一现象使用GPT-4.1-mini和Q…
-
新方法以1%的数据成本分解LLM权重以进行解释
来自IQuest Research的研究人员与牛津大学、斯坦福大学等机构合作,推出了一种名为稀疏权重分解(SWD)的新型大语言模型解释方法。与以往需要训练新网络来理解现有网络的方法不同,SWD直接将密集权重矩阵分解为稀疏因子。这使得可以从预训练权重中提取“瓶颈单元”,这些单元可以以显著降低的数据成本进行独立分析和操作,通常低于传统方法的1%。在GPT-2、Qwen2.5和Qwen3.5-27B等模型上的实验表明,SWD能够以更少的参数…
-
新研究质疑任务算术组合大型语言模型的可靠性
研究人员调查了任务算术组合微调语言模型的有效性,发现参数加法并不总是能转化为可预测的功能变化。他们的研究在 Qwen2.5-1.5B 和 Llama-3.1-8B 等模型上进行,结果显示,虽然某些任务组合表现出可预测的交互,但其他任务组合,特别是涉及指令式包装器或特定评估基准的任务组合,可能会导致这些功能陈述崩溃。研究结果表明,权重空间组合是依赖条件的,并且不是不同适应方法、规模和模型架构之间合并性能的通用预测因子。
-
AuroOFT通过非线性残差增强低比特语言模型微调
研究人员开发了AuroOFT,一种新颖的表达性量化正交微调方法,可增强低比特语言模型的性能。AuroOFT通过引入零启动门控非线性残差,在现有qoft技术的基础上,实现了更复杂的输入相关校正。该方法在Macro-6等基准测试中表现出比标准qoft和QLoRA显著的改进,在需要更少可训练参数的情况下实现了更高的准确性。
-
G-Boost框架通过LLM协作增强边缘SLM
研究人员开发了G-Boost,一个旨在增强边缘设备上部署的小型语言模型(SLM)性能的新颖框架。该系统实现了资源受限的边缘SLM与基于云的强大大型语言模型(LLM)之间的协作,而无需对边缘模型进行直接参数更新。G-Boost使用一种由奖励模型指导的树搜索方法,动态决定何时仅使用SLM,何时融合SLM和LLM的logits,从而转移领域知识。在GSM8K和MATH-500基准上的评估表明,G-Boost的性能显著优于独立的SLM和其他基…
-
新方法从密集Transformer中提取可解释电路
研究人员开发了稀疏权重分解(SWD)方法,这是一种从密集预训练Transformer模型中提取可解释电路的新颖方法。与需要额外训练或引入保真度差距的先前方法不同,SWD将权重矩阵分解为稀疏分量,从而无需重新训练即可直接进行电路分析。该技术在性能上可媲美或超越现有方法,同时使用的资源(数据和计算)却显著减少。SWD已在GPT-2、Qwen2.5和Qwen3.5-27B等多种模型上证明了其有效性,并提供了一种零数据变体,以实现更广泛的机械…
-
AI模型鲁棒性分析揭示层级分离
一篇新的研究论文分析了语言模型的扰动鲁棒性,揭示了敏感性、因果关系和修复能力在模型层级之间并不一致。研究发现在像Phi-3.5和Gemma-2-9B这样的模型中存在两种不同的传播模式:尖峰-抑制模式,以及Llama-3、Mistral和Qwen2.5-7B中的后期累积模式。研究表明,放置在涉及因果关系早期层级的适配器会干扰下游计算,并为预筛选和适配器放置提供了实用指导。
-
新的QDRT框架生成多样化且有效的LLM攻击提示
研究人员推出了一种名为质量-多样性红队测试(QDRT)的新型框架,旨在增强大型语言模型(LLM)的安全性和鲁棒性。QDRT通过生成更多样化且有效的对抗性提示,解决了现有红队测试方法的局限性。该框架采用行为条件训练和行为回放缓冲区来实现目标驱动的多样性,从而能够创建多个专门的攻击者。实证评估表明,QDRT在针对GPT-2、Llama 3、Gemma 2、Qwen2.5、GPT-4.1和GPT-5 Chat等一系列LLM生成多样化且有力的…
-
新的 OoO-Spec 方法可大幅加快 LLM 工具调用速度
研究人员开发了 OoO-Spec,一种加速大型语言模型 (LLM) 工具调用的新方法。该技术利用一个较小的 Qwen3-0.6B 模型作为辅助,并行预测函数选择和参数值,与传统的逐令牌生成相比,显著加快了过程。OoO-Spec 在自回归解码方面实现了高达 5.34 倍的速度提升,并且优于 ToolSpec 等现有方法,证明了其在各种 LLM 目标和基准测试中的有效性。
-
韩国AI模型因“借鉴”技术和狭隘基准测试面临审查 · 跟踪1个来源
在中国知乎平台上的一场病毒式辩论,对声称超越DeepSeek的韩国人工智能模型浪潮进行了审视。批评集中在几个方面:模型被指控建立在其他实验室的开放权重模型之上(例如SK Telecom的A.X K2使用了阿里巴巴的Qwen2.5),狭隘的基准测试选择忽略了更广泛的性能指标,以及为获得政府资助而进行的声称。在这些批评声中,初创公司VIDRAFT成为一个例外,其Darwin-398B-JGOS模型在GPQA基准测试中取得了特定、可验证的排…
-
新的LoCA方法通过仅前向传播的方法大幅降低LLM调优成本 · 跟踪到2个来源
研究人员推出了一种新颖的两阶段参数高效大型语言模型微调方法,称为LoCA(局部信用分配)。该方法旨在通过用单次校准过程替换重复的端到端反向传播来降低计算需求。LoCA通过拟合Transformer块内的局部映射来纠正预测错误,然后用于仅前向传播调优。在Qwen2.5和SmolLM2-1.7B模型上的评估表明,与LoRA相比,LoCA可以带来更低的交叉熵、更低的GPU峰值使用量以及更低的CPU内存和每轮时间。
-
新的 RAG 系统 FinCacheServe 将 LLM 调用减少超过 53%
研究人员开发了 FinCacheServe,一个旨在提高检索增强生成 (RAG) 服务成本效率的系统,特别适用于可变的企业文档。该系统通过重用先前生成的答案来解决冗余计算问题,从而减轻 GPU 的工作负载。FinCacheServe 通过基于企业意图的答案索引,并确保文档版本、证据指纹、工具指纹、模型身份和解码配置的依赖一致性来实现这一点。使用 Qwen2.5 模型在金融文档工作负载上的评估表明,FinCacheServe 在保持依赖…
-
大型语言模型因特定MLP块而非表征限制而无法进行单词计数
研究人员发现,大型语言模型内部存在一种特定机制,导致它们在计数重复单词时失败,尽管它们在内部表征中正确编码了计数。位于网络深度约85%-93%的多层感知器(MLP)块,在准确计数到达输出之前将其覆盖为不正确的计数。在Llama-3.2和Qwen2.5的不同模型大小中都一致观察到这种现象,这表明存在一个普遍的架构问题,而不是表征的限制。
-
无需昂贵的硬件即可在本地微调和运行LLM
最近的两篇文章详细介绍了在本地微调和运行大型语言模型(LLM)的方法,无需昂贵的云基础设施或高端GPU。第一篇文章侧重于在macOS、Linux和Windows Subsystem for Linux上使用Unsloth Studio进行本地微调,解释了从安装到监控结果的整个过程。第二篇文章提供了仅使用CPU进行LLM推理的指南,使用户能够通过利用Ollama和优化的量化格式等工具,在标准硬件上运行Llama 3.2、Mistral和…