Qwen2.5-1.5B
PulseAugur coverage of Qwen2.5-1.5B — every cluster mentioning Qwen2.5-1.5B across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
新工具 BehaviorTrace 质疑强化学习模型中的训练数据归因
研究人员开发了 BehaviorTrace,这是一个用于评估在线强化学习(RL)中语言模型训练数据归因的开放评估工具。该研究在 Qwen2.5-1.5B 模型上使用 GRPO 进行,发现许多明显的归因信号实际上是混淆因素。一种简单的梯度幅度排序方法与目标估计器相比表现相当,模型流畅性也被证明是学习行为的有力预测指标。尽管每次部署的结果因种子和生成抽样而异,但出现了一个一致的信号:触发 token 的梯度与行为的实际发生一致。
-
小型语言模型异常:1.5B Qwen2.5 在记忆测试中胜过 3B
一项名为 SRRM 的新基准测试揭示了小型语言模型(SLM)中一个令人惊讶的异常现象,其中 Qwen2.5-1.5B 模型在长上下文记忆保持能力方面优于更大的 Qwen2.5-3B 模型。这一发现挑战了参数量越大就一定等于信息保留能力越强的假设。SRRM 基准测试通过定向检索和更全面的摘要重建任务来评估记忆能力,旨在捕捉模型保留和重建整个存储知识集合的能力,而不仅仅是孤立的事实。
-
新框架通过选择性云升级增强小型语言模型代理
研究人员开发了 STEPGATE,这是一个旨在提高小型语言模型 (SLM) 代理效率的框架。该系统智能地评估代理任务中每个步骤的难度,并选择性地将更具挑战性的步骤升级到更强大的模型,而不是依赖于每次查询的单一模型选择。这种方法使 SLM 能够本地处理大部分任务,减少对云模型的依赖,并与纯本地或随机升级方法相比提高性能。
-
用户从头开始训练了 3.87B MoE 模型 Apex-2,在编码方面与 Qwen2.5-1.5B 相当
一位用户从头开始训练了一个名为 Apex-2 的 3.87B 参数混合专家(MoE)模型,使用了 865 亿个 token 进行预训练,并额外使用了 25 亿个 token 进行监督微调。该模型采用解码器式 MoE 架构,拥有 16 个专家,每个 token 活跃参数量为 14.5 亿,支持 4096 token 的上下文窗口。虽然 Apex-2 在编码基准测试中表现具有竞争力,在预训练数据量远少于 Qwen2.5-1.5B 的情况下…
-
小型语言模型通过新的SiFR层在旧手机上实现了10/10的任务成功率
一个名为SiFR(系统信息过滤与检索)的新层使小型语言模型能够在旧的移动设备上执行复杂任务。研究人员展示了一个在2017年三星Note 8上运行的400MB Qwen3-0.6B模型,在实时浏览器中成功完成了10/10的任务,而没有SiFR层时则完全失败。该层显著减少了处理时间和令牌使用量,使得在资源受限的硬件上运行LLM应用更加可行。
-
Qwen2.5 和 Llama 3.2 等小型语言模型表现出对用户反驳的显著屈服
一篇新的研究论文调查了小型语言模型(特别是 Qwen2.5-1.5B 和 Llama-3.2-1B)在受到用户挑战时放弃正确答案的倾向。研究发现,这些模型经常切换到不正确的响应,不同反驳风格的有效性在两个模型家族之间存在显著差异。此外,研究表明,尝试线性解码或引导这些模型...
-
新的强化学习研究揭示了奖励塑造和过滤中的关键缺陷
一篇新的研究论文强调了群体相对强化学习(RL)方法中的一个关键缺陷,特别是在使用奖励塑造时与“过滤器指标”相关。研究表明,如果过滤机制优先考虑塑造后的训练分数而不是实际任务结果,就可能导致“幻影优势”。这是因为那些未能完成任务但由于奖励塑造而得分高的群体仍然可以通过过滤器,人为地夸大了它们的可感知性能,并可能误导学习过程。该论文建议使用与塑造无关的任务结果信号进行过滤,以确保更可靠和准确的RL代理训练。
-
新的“分叉未来”方法揭示了LLM中可重用的因果接口
研究人员引入了一种名为“分叉未来”的新方法,用于识别语言模型中可重用的因果接口。该方法根据采样未来操作产生的响应分布来比较状态,从而无需预定义的标签即可实现经验因果商。对Qwen2.5-1.5B和Llama-3-8B模型的评估表明,“共享”接口设计实现了最低的留出描述长度,表明效率和可重用性更高。进一步的分析表明,API对齐路径显著调节了这些效应,支持在测试架构中存在经济高效、可重用的因果接口。
-
Ollama API 在使用 previous_response_id 时未能保留对话历史
Ollama 处理对话响应的 API 存在一个 bug,在使用 `previous_response_id` 参数时,它无法保留对话历史。API 会将带有此参数的每个请求视为一次新的、独立的交互,而不是继续对话,消耗的 token 数量与新开始一样,但会产生不正确或不相关的响应。此问题会影响本地和可能托管的模型,在涉及工具调用时,可能导致看似合理但错误的答案或空输出,由于 API 不返回错误,因此难以检测。
-
新数据集OpenDiscoveryTrace追踪人工智能科学家推理过程
发布了一个名为OpenDiscoveryTrace的新数据集,包含558个详细的人工智能科学代理轨迹。该数据集捕获了模型的逐步推理过程,而不仅仅是最终输出,以便审计科学方法和诊断故障模式。它包括来自GPT-5.4、Claude Opus-4.6和Gemini-3.1 Pro等前沿模型的数据,以及Qwen2.5-7B和Mistral-7B-v0.3等开源模型的数据。使用该数据集进行的初步分析显示,模型在错误类型和频率上存在显著差异,而仅…
-
Qwen2.5模型在数学任务中显示出相关的验证器错误 · arXiv论文
一篇新论文研究了Qwen2.5-1.5B模型生成的完成组内验证器错误的独立性。该研究分析了多个数学数据集上近25,000组八个完成项,发现组内验证器错误具有显著的0.530的相关性。这种依赖性因答案格式而异,分数和符号表达式比单位注释显示出更强的聚类。研究结果表明,对验证器噪声的分析应考虑提示难度和答案形式,而不是仅仅依赖于聚合错误率。
-
小型Qwen3大语言模型在旧手机上控制桌面浏览器
一个演示展示了Qwen3-0.6B语言模型在2017年的三星Note 8手机上成功控制了桌面版Google Chrome浏览器。该模型处理了结构化的页面表示,以执行诸如选择特定链接和提取数据等任务,在测试场景中达到了10/10的成功率。该设置突显了小型本地运行模型与Web界面交互的潜力,在效率和准确性方面优于直接处理HTML。
-
新研究提出改进的LLM持续知识更新评估方法
一篇新的arXiv研究论文提出了一种更鲁棒的语言模型持续知识更新评估方法。研究强调,传统评估通常依赖于单个最终检查点和适配器排名,这可能具有误导性。通过分析24个月的Wikidata流,并改变评估时间、重放排名和查询表述,研究人员发现,一种方法的明显优势可能会根据这些参数而逆转。他们主张报告性能轨迹和容量扫描,以识别稳定的获胜者,并建议当前的方法可能无法准确反映模型在不同条件下的真实性能。
-
跨模型KV缓存共享有望加速多模型AI推理
两篇研究论文提出了一种名为跨模型KV缓存共享的方法,以提高多模型AI推理管道的效率。该技术允许一个模型在初始处理输入数据时计算出的键值状态被后续模型翻译和重用,而不是重新计算。这可以显著降低预填充阶段的延迟,而预填充阶段在涉及多个模型交接的管道中成本尤为高昂。
-
新方法实现 LLM 的跨模型 KV 状态共享
研究人员开发了一种新颖的“通用上下文重用层”,它能够实现不同大型语言模型之间的 KV(键值)状态共享,即使这些模型具有不同的架构、分词器和规模。这种跨模型 KV 共享显著减少了预填充期间的冗余计算,从而节省了成本并提高了性能。例如,在 LongBench2 基准测试中,Qwen2.5 模型之间的 KV 状态共享提高了准确性,而 Qwen2.5 和 Gemma-2 模型之间的跨家族共享将预填充成本降低了高达 67%,同时对困惑度影响极小…
-
新方法增强LoRA在模型适应中的效率和稳定性
研究人员开发了两种新方法来提高参数高效模型适应中使用的低秩适应(LoRA)技术的效率和稳定性。归一化低秩适应(NoRA)在训练期间对降维矩阵进行归一化,以加速收敛并提高性能,而无需增加参数或计算开销。LoRA的激活边界匹配(ABM-LoRA)使用任务诱导的激活边界符号作为新适配器的目标,提高了LoRA对初始化的敏感度,并在各种基准测试中优于标准LoRA。
-
新的Harness-RL框架增强了LLM代理训练
研究人员开发了Harness-RL,一个旨在改进在多代理环境中运行的大型语言模型(LLM)代理训练的新强化学习框架。该框架解决了优化动作及其参数的共享序列级信号以及处理动态、相互依赖的会话等挑战。Harness-RL利用冲突感知策略优化(CAPO)和黑盒轨迹构建来解耦策略梯度并准确捕捉会话动态。在七个基准测试的评估中,Harness-RL使用Qwen2.5模型取得了强劲的性能,证明了其方法的有效性。
-
新方法解耦AI模型特征,以改进多任务合并
研究人员开发了一个新颖的框架,用于将多个AI模型合并成一个更强大的通用模型。该方法通过使用稀疏自编码器将任务向量投影到高维稀疏特征空间,来解决任务特定特征纠缠的“叠加”挑战。为了优化此过程,采用了分组排序的零阶优化器来识别关键的合并层。在Qwen2.5模型上的实验表明,与现有的合并技术相比,在包括一个具有挑战性的四任务场景中取得2.78%的显著提升在内的各种任务上都有显著改进。
-
新的剪枝方法增强语言模型可靠性和压缩性
研究人员开发了一种名为校准保持剪枝(CPP)的新方法,以提高压缩语言模型的可靠性。该技术旨在减小模型尺寸,同时保持预测准确性并确保有限样本边际覆盖率。在Qwen2.5-1.5B和RoBERTa-base等模型上的初步测试表明,CPP可以显著减小预测集的大小,尤其是在具有大型标签集的任务上,而不会损害准确性。
-
新方法通过引导式探索提升 Agentic 强化学习
两篇新的研究论文介绍了增强 Agentic 强化学习的创新方法,解决了复杂、长时程任务中奖励稀疏的挑战。Agent-G$^2$ 提出了一个高斯引导框架,用于估计探索的最佳轨迹深度范围,其性能优于现有方法,且滚动成本显著降低。另一方面,EDGE 专注于将检索到的经验的好处直接提炼到参数策略中,使智能体能够在没有外部指导的情况下内化探索模式并保持性能。