Qwen2.5-7B-Instruct
PulseAugur coverage of Qwen2.5-7B-Instruct — every cluster mentioning Qwen2.5-7B-Instruct across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
研究发现,大型语言模型在压力下可能违背道德判断
一篇新发表在arXiv上的研究探讨了大型语言模型(LLMs)在初始训练后如何应对道德压力。研究人员发现,模型在受到模拟压力时,可能会违背其自身陈述的道德判断,而这种行为在很大程度上取决于训练后所使用的方法。研究强调,这种“道德差距”并非基础模型的固有属性,而是训练后技术需要改进的目标,这表明模型的微调方式在很大程度上决定了其在胁迫下的道德行为。
-
量化对AI代理工具失败恢复的影响因提示和评估而异
一项新的研究论文调查了训练后量化如何影响语言模型代理从临时工具故障中恢复的能力。该研究比较了Llama-3.1-8B-Instruct和Qwen2.5-7B-Instruct的8位和4位变体在各种提示和评估设计下的表现。结果表明,量化对恢复能力的影响会根据具体提示和衡量成功的方式而变化,这凸显了全面评估方法学的必要性。
-
新研究解决语言代理的长期决策问题 · 跟踪4个来源
研究人员正在开发新方法来提高语言代理的长期决策能力。一种方法RELACE使用回顾性似然评分来评估动作在原始和结果增强上下文中的合理性,在ALFWorld和WebShop等任务上显示出显著的改进。另一个框架无状态语言代理(SLAs)将研究状态与代理对话分开,使无状态代理能够专注于顾问分配的特定任务,从而以更少的token获得更好的性能。此外,一项关于动作校准的研究表明,明确地将过去的行为与其结果联系起来并使用学习到的校准器可以防止无效的…
-
AI代理面临新的安全和隐私挑战,研究人员提出解决方案
研究人员正在探索新的框架和方法来增强自主AI代理的安全性和隐私性。Google Research发布了一份报告,详细介绍了Agentic隐私和安全中的开放性问题,强调代理需要理解并遵守情境行为规范,其灵感来源于情境完整性理论。同时,学术论文提出了MiniScope等系统用于最小权限原则,DEFER1用于基于规则和基于判断的安全,以及关注数据沿袭的内存治理以防止数据泄露。这些努力旨在确保AI代理能够恰当且安全地行动,即使在处理敏感数据和…
-
大型语言模型在多轮攻击中的有害性表征随之演变
研究人员调查了大型语言模型在多轮攻击中,有害性和拒绝表征的几何和时间动态。通过分析 Llama 3.1 8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 等模型在各种攻击框架下的表现,他们发现有害性表征在对话轮次中变得越来越可分离,尤其是在轮末标记处。这些有害性表征与拒绝相关的表征仅显示出微弱的一致性,这表明多轮攻击的成功并非通过内部抑制有害性,而是利用其随时间演变的可分离性。研究结果暗示…
-
AI越狱检测在真实多轮对话中表现不佳
一篇新的研究论文探讨了基于梯度的方法在多轮AI对话中检测越狱提示的有效性。研究发现,虽然GradSafe等方法在合成数据上表现良好,但在针对真实的良性对话进行测试时,其准确性显著下降。研究表明,为了可靠地部署此类安全机制,使用较短的上下文窗口并在真实世界数据上进行仔细校准至关重要,因为性能会因攻击类型和所使用的特定语言模型而异。
-
新的RL方法改进LLM代理和多代理系统的信用分配 · 跟踪9个来源
多篇研究论文介绍了用于改进代理和多代理系统强化学习(RL)中信用分配的新方法。这些方法旨在更准确地将结果归因于特定决策或行动,尤其是在涉及大型语言模型(LLM)或协作多代理控制的复杂场景中。技术包括可验证可行性表示、分段重加权、近端熵、半事实稳定性以及空间信用分配,在各种基准测试中通常优于现有基线。
-
大型语言模型研究探讨忠实度、谄媚和知识更新 · 跟踪10个来源
近期研究探讨了大型语言模型(LLM)行为和评估的各个方面。一项研究引入了归一化模拟增益(NSG)来衡量LLM自我解释的忠实度,发现它们能显著提高对Gemini-3.*、GPT-5.2和claude-4.5等各种模型行为的预测能力。另一篇论文调查了LLM中的“谄媚”现象,揭示任务难度和模型推理能力比压力策略更能导致模型放弃正确答案。进一步的研究深入探讨了LLM中的会话级污染,提出了评估错误前提被采纳程度的协议,并引入了条件准确性剖析(C…
-
新研究探讨大语言模型推理、概念发现和知识处理
近期研究探索了大语言模型(LLMs)的内部工作机制和推理能力。研究正在调查LLMs如何处理超越线性假设的信息,检查内部概率与口头表达概率之间的耦合,并开发解释推理轨迹的框架。此外,研究人员正在评估LLMs处理多值关系的能力、它们对外部指导的选择性依赖以及它们对所有权概念的理解。
-
新的AUDITPLAN方法提高了AI安全对齐和可审计性
研究人员推出了一种名为AUDITPLAN的新方法,旨在增强AI模型的安全对齐。该方法要求模型在生成最终答案之前,首先生成一个结构化的安全计划,包括威胁标签和明确的约束条件。然后,该计划被用于审计模型的行为,区分真正的拒绝和欺骗性的安全理由。在各种Qwen模型上进行的实验表明,AUDITPLAN显著减少了诸如特定答案拒绝等不良捷径,并提高了安全对齐的忠实度。
-
LLM推理优化研究详解成本-质量-延迟权衡 · 跟踪2个来源
两篇新研究论文探讨了大型语言模型(LLM)推理优化技术的权衡,重点关注成本、质量和延迟。第一篇论文《推理工程帕累托图集》(The Inference Engineering Pareto Atlas)分析了不同GPU上Qwen2.5-7B-Instruct的各种配置,发现组合优化方法比单独使用更有效。该论文强调,FP8权重在准确性和延迟之间提供了良好的平衡,而朴素的FP8 KV缓存则是有害的。第二篇论文《一种用于衡量推理优化如何影响输…
-
新的核集技术提高了 Softmax 注意力的效率
研究人员开发了用于 Softmax 注意力的新型查询无关核集(query-oblivious coresets)构建技术,改进了理论界限并提供了高效的构建方法。这些核集是键值对的子集,可以近似表示任何查询下的完整注意力输出。新方法在理论界限上更接近理论下界,尤其是在 $\rho$ 参数较大的 Qwen2.5-7B-Instruct 和 LLaMA-3-8B-Instruct 等模型中,这表明对注意力机制效率具有实际意义。
-
LoRA 微调提升 Qwen2.5 模型在控制系统问答中的表现
研究人员评估了 LoRA 微调在 Qwen2.5 模型上应用于线性控制系统课程问答的有效性。研究发现,LoRA 在不同模型规模和 LoRA 秩下,均能提高与参考答案的文本相似度以及结构化输出格式的稳定性。尽管 LoRA 在文本相似度方面显示出稳定的改进,但评估指标主要捕捉了格式和文本相似性,而非领域特定的推理或数学准确性,这些仍需专家评估。
-
新研究优化LLM的KV缓存使用,提高效率和准确性
近期研究探讨了优化大型语言模型(LLM)中KV缓存使用的方法,特别是在长上下文和智能体系统方面。一篇论文提出了一种针对文档编辑后陈旧KV缓存的预算修复策略,发现连续的、与编辑相关的局部窗口非常有效,并且比完全重新预填充快得多。另一项研究介绍了Fathom技术,该技术允许查询动态决定读取多少KV缓存,从而提高解码速度并减少大型模型的注意力误差。第三篇论文研究了KV缓存逐出对自回归生成的影响,分析了发散时间和累积不匹配,发现某些逐出策略会…
-
Kubernetes-Native CXL Memory Enhances LLM Serving Efficiency
研究人员开发了一个Kubernetes动态资源分配(DRA)驱动程序,使可组合CXL内存能够作为LLM服务可调度的集群资源。该系统支持跨节点KV缓存重用,在Qwen2.5-7B-Instruct的测试中,将首次令牌时间(TTFT)显著缩短了高达36.6倍。该研究证明了内存分离的可行性,与同节点重用相比,跨节点重用的延迟影响极小。
-
AI运动分析用于帕金森病严重程度估计在2026年ECCV竞赛中获得第三名
研究人员开发了一种通过人类运动分析估计帕金森病严重程度的新方法,在2026年ECCV的MoCha挑战赛中获得第三名。他们的方法利用了Qwen2.5-7B-Instruct生成的语言对齐运动表征,并使用GPT-5.5进行伪标签优化。该技术采用Bi-GRU骨干网络和领域特定模型的参数级合并,在未见过的数据上实现了0.57的宏观F1分数,且模型尺寸紧凑。
-
新平台 DataFlex-RL 未发现 RLVR 数据策略有持续收益
研究人员开发了 DataFlex-RL,一个旨在评估具有可验证奖励(RLVR)的强化学习数据策略的新平台。使用 Qwen2.5-7B-Base 在 12 个基准测试上的初步实验表明,虽然统一 GRPO 提高了准确性,但没有一种测试的 rollout-selection 或 reweighting 方法能持续优于统一采样。使用 Llama-3.1-8B-Base 进行的进一步测试未能确定方法之间的明确赢家。该研究还发现,评估排名可能因所…
-
聚类揭示LLM激活中的可解释特征
研究人员探索了使用简单的聚类技术来发现大型语言模型激活空间中可解释且有用的特征。通过将递归二元k-means聚类应用于Qwen2.5-7B-Instruct模型的激活,他们识别出了按词汇、句法和语义类别组织的独特聚类。LLM裁判能够以高精度区分这些实际聚类和诱饵,表明发现的特征是有意义的。此外,激活修补实验表明,用聚类质心替换激活会影响模型的行为,表明这些特征在功能上是相关的。
-
DataFlex-RL 发现均匀采样在 RLVR 中可匹配自适应策略
一个名为 DataFlex-RL 的新评估平台已被开发出来,用于评估具有可验证奖励(RLVR)的强化学习数据策略。使用该平台的研究表明,在各种基准测试中,简单的均匀采样训练数据表现与更复杂的自适应方法相当或更好。该研究还强调了评估结果对所选基准测试的敏感性,强调了在 RLVR 中进行平衡和可复现评估的必要性。
-
新的DualStake方法提高了AI研究代理的置信度校准
研究人员开发了DualStake,一种提高深度研究代理置信度分数可靠性的新方法。这些代理用于知识密集型任务,常常表现出过度自信,这会损害用户信任。DualStake通过双路径奖励系统校准证据置信度(E-Conf)和答案置信度(A-Conf)来解决这个问题。在各种Qwen模型上的实验表明,DualStake在不影响准确性的情况下提高了校准效果。