qwen2.5:7b
PulseAugur coverage of qwen2.5:7b — every cluster mentioning qwen2.5:7b across labs, papers, and developer communities, ranked by signal.
- instance of Gotit.pub 90%
- instance of ScienceCast 90%
- instance of alphaXiv 90%
- instance of Qwen2.5-1.5B 90%
- instance of Qwen2.5-3B 90%
- used by Gotit.pub 70%
- used by ScienceCast 70%
- used by alphaXiv 70%
- competes with Llama 3-8B 70%
- used by llama3.1:8b 70%
- used by Grpo 70%
- competes with Llama 3.2:3b 70%
13 天有情绪数据
-
提示使用日语时,大型语言模型编造日本法律条文的频率更高
开发了一个新的基准测试,用于检验大型语言模型(LLMs)在多大程度上能依据实际的日本法律条文来回答问题。该基准测试使用了包含超过6900条法律条文的官方e-Gov法律API v2,来验证LLMs引用的准确性。测试结果显示,当使用日语提示时,三分之二的本地LLMs编造法律条文的频率高于使用英语提示时,这表明存在与语言相关的 grounding 问题。
-
新框架通过选择性云升级增强小型语言模型代理
研究人员开发了 STEPGATE,这是一个旨在提高小型语言模型 (SLM) 代理效率的框架。该系统智能地评估代理任务中每个步骤的难度,并选择性地将更具挑战性的步骤升级到更强大的模型,而不是依赖于每次查询的单一模型选择。这种方法使 SLM 能够本地处理大部分任务,减少对云模型的依赖,并与纯本地或随机升级方法相比提高性能。
-
新的自我蒸馏方法在没有外部教师的情况下提高了LLM性能 · 跟踪4个来源
研究人员推出了一些新颖的语言模型自我蒸馏技术,旨在提高性能,而无需外部教师或真实标签。激活条件自我蒸馏(ACSD)从模型激活中提取引导向量来指导学习,在数学和编码基准测试中取得了高精度。另一种方法,知识到提示(K2P),从教师解决方案中合成和优化可重用的指令,用于无标签蒸馏。此外,InFlow将该过程建模为信息流,根据信念转移检索和选择信息源,以增强策略内自我蒸馏。
-
新研究探讨大型语言模型在临床医学中的评估与应用 · 追踪 8 个来源
多篇研究论文正在探索大型语言模型(LLMs)在临床环境中的评估与应用。其中一篇论文介绍了 STEP-CTS,一种从临床时间序列中为 LLM 预测选择可追溯证据的方法,其表现优于现有的基于文本的基线。另一篇论文回顾了用于评估 LLM 临床推理的现有评分标准,指出了在时间综合和忠实度等方面的差距。此外,研究还在调查临床分诊中开源 LLM 的偏见,开发用于医学图像推理的多模态 LLM,并创建 KlinikeBench 等基准来评估 LLM …
-
Yingsuan AI网关实现DeepSeek和Qwen模型间的无缝切换
Yingsuan AI提供了一个兼容OpenAI的网关,允许开发者在不更改代码的情况下,在包括DeepSeek和Qwen在内的不同大语言模型之间进行切换。通过实现标准的OpenAI API契约,该网关将模型选择视为运行时配置,从而能够基于成本、能力或回退机制进行动态路由。这种方法简化了模型管理,并允许灵活的部署策略,例如将更便宜的模型用于常规任务,将更强大的模型用于复杂问题。
-
人工智能代理商在与一致的合作伙伴配对时学会提高价格
一篇新发表在arXiv上的研究探讨了定价代理商如何在重复的Bertrand竞争场景中学习设定价格。研究发现,与一致的合作伙伴配对的代理商会持续设定更高的价格,将利润提高了约0.27的竞争利润与垄断利润之间的差距。即使代理商看不到对手的价格,也观察到了这种效应,这表明存在一种学习到的惩罚机制或独立于直接观察的战略定价。使用Qwen2.5模型进行的探索性测试表明,当对手的价格从提示中省略时,会出现类似的定价行为。
-
新研究解决 LLM 训练效率、容错性和微调优化问题 · 跟踪 9 个来源
arXiv 上发布的多篇研究论文探讨了优化大型语言模型 (LLM) 训练和微调的新方法。Leto 引入了一个系统,用于在 LLM 训练期间从硬件故障中更快地就地恢复,显著提高了生产性训练时间。其他论文侧重于高效的微调技术,包括使用 LOOM 进行在线数据选择,使用零阶和一阶优化方法 (ZFO) 进行自适应步长选择,以及使用 LoRA-Norm 进行训练后归一化以平衡适应性增益。此外,TACO 为 LLM 微调提供了一种内存高效的优化器…
-
新方法改进策略内蒸馏以增强人工智能能力 · 跟踪 7 个来源
研究人员正在探索策略内蒸馏(OPD)的高级技术,通过结合多个“教师”模型来增强语言模型的能力。LEGO-OPD 和 SAKI 等新方法侧重于分解和路由教师信号,以在不降低性能的情况下改善视觉基础和推理。SCOUT 和 MAESTRO 等其他方法解决了教师-学生前缀不匹配的挑战,并优化了教师干预策略,以防止性能下降并确保跨不同任务的平衡能力集成。
-
新研究探讨LLM长上下文检索和RAG策略 · 追踪9个来源
近期研究探索了大型语言模型(LLMs)如何处理长上下文,研究调查了性能提升背后的机制。一篇论文检查了思维链(CoT)推理,发现它能够实现定向检索和比广泛检索更紧凑的表示。另一项研究分析了不同的位置编码选择,如RoPE和滑动窗口注意力,如何将模型从位置检索转移到语义检索,从而影响问答等任务的性能。此外,研究比较了各种检索增强生成(RAG)策略,强调了重排序和后期交互对于科学问答的重要性,并引入了学习检索动作和自我评估探索的新框架,以增强知识检索。
-
开源模型被训练用于编写Atlassian Forge应用
一位开发者训练了一个拥有270亿参数的开源模型Qwen3.8-27B,使其能够生成Atlassian Forge应用程序。这个微调后的模型在其基础版本上表现出显著的改进,能够生成有效的Forge清单和可编译的应用程序,这是基础模型无法实现的壮举。开发者声称,这是第一个专门为编写Forge应用而训练的开源模型,其性能指标和训练细节已在Hugging Face和GitHub上公开。
-
新框架使用免费LLM进行自动化渗透测试
研究人员开发了PentestChain,一个用于自动化渗透测试的新框架,该框架利用免费层级和本地大型语言模型(LLMs)来降低成本。该系统采用成本感知型AI级联,优先使用qwen2.5:7b等本地模型,然后再使用免费层级云服务,从而使小型组织能够进行持续的自动化测试。PentestChain还分析了暴露其模型上下文协议(MCP)接口相关的安全风险并提出缓解措施,同时建立了一个可复现的评估协议,用于与现有工具进行基准测试。
-
Ollama 的 token 速度指标因缓存膨胀而产生误导
一篇最新的博文指出,Ollama 在报告模型性能方面存在显著差异,尤其是在 token 生成速度方面。作者演示了 Ollama 的默认指标可能产生误导,通过将缓存的 token 计入计算来夸大报告的每秒 token 数。这导致对实际模型吞吐量的表示不准确,特别是在提示元素被重复使用的对话场景中。该博文建议进行修正计算,考虑未缓存的 token,以提供更真实的性能衡量。
-
新的 EviScope 基准测试 LLM 的地面能力,超越答案准确性
研究人员开发了 EviScope,这是一个旨在评估地面语言模型的忠实性和效率的新基准。该基准引入了配对反事实,通过添加、删除或矛盾证据来改变证据,以评估模型在简单答案准确性之外如何处理事实地面。对 Qwen2.5-7B、Llama 3.1 8B 和 Gemini 3.5 Flash 等模型的测试表明,EviScope 可以揭示传统指标遗漏的模型特定地面行为,突出了诸如不支持的答案和冲突盲点等问题。
-
本地 LLM 裁判表现出高度一致性但与人类评分的协议度较低
一项发表在 arXiv 上的新研究评估了本地大型语言模型(LLMs)作为其他模型裁判时的可靠性。研究人员发现,像 LLaMA-3-8B 和 Qwen2.5-7B 这样的模型在评分时表现出高度的一致性,但它们与人类判断的一致性有限。LLaMA-3-8B 与人类评分的皮尔逊相关系数为 0.275,Qwen2.5-7B 达到 0.340,这表明内部一致性与外部有效性之间存在显著差距。
-
RAG管道遭受间接提示注入攻击,安全防护措施成功阻止
一位安全研究员演示了针对检索增强生成(RAG)管道的间接提示注入攻击。该攻击涉及在RAG系统会检索的文档中嵌入恶意指令,导致模型执行未经授权的操作,例如将整个对话发送到攻击者控制的地址。攻击者无需直接与聊天机器人互动,用户也未意识到被攻击。研究员展示了重新启用的特定安全防护措施成功阻止了此类攻击。
-
VANGUARD 团队的 IROH 系统赢得 JOKER 2026 幽默排名任务
VANGUARD 团队开发了 IROH,一个三阶段检索系统,在 JOKER 2026 赛道任务 1 英语竞赛中获得第一名。该系统结合了混合检索方法、交叉编码器重排以及大语言模型裁判的集成。关键发现表明,带有推理蒸馏的裁判对于排名质量至关重要,而结构化的硬负例可能会损害泛化能力。值得注意的是,像 Qwen2.5-7B 这样经过良好校准的小型模型,使用通用推理,其表现优于大型 Gemma-4-31B 配置。
-
使用 LoRA 和 Unsloth 使 LLM 微调更易于访问 · 跟踪 2 个来源
两篇文章详细介绍了使用参数高效技术微调大型语言模型(LLM)的方法。第一篇文章解释了如何使用 LoRA(低秩适配)和 Unsloth 微调 7B LLM,展示了自定义普什图方言数据集的训练损失显著降低。第二篇文章重点介绍了 Unsloth Studio,概述了以 ChatML 格式准备对话数据集的过程,以及微调 Llama-3.1-8B 等模型以完成特定任务,并将微调与检索增强生成(RAG)进行对比。
-
新协议评估AI导师对不投入学习的学生的回应
研究人员开发了一种名为“不投入学习学生模拟器”(DAS2)的新协议,通过模拟五种学习者投入状态:投入、摸鱼、空转、偏离主题和混合状态,来评估AI导师。该协议旨在评估AI导师对不投入学习学生行为的反应,这对于有效的教学策略至关重要。使用ASSISTments09数据集进行的评估表明,DAS2显著缩小了模拟和真实辅导课程在摸鱼和空转状态下的性能差距。虽然微调后的Qwen2.5-7B在响应时间上更接近真实情况,但仅使用提示的GPT-4o生成…
-
开发者为本地 LLM 构建智能路由器
一位开发者创建了一个智能模型路由器,旨在优化资源受限的 CPU 上本地大型语言模型(LLM)的使用。该路由器根据任务类型、复杂性和性能历史动态选择最合适的 LLM,并强制要求复杂任务至少使用 30 亿参数的模型。它在不同大小的模型(例如 3B、7B、14B)之间切换,以平衡质量和延迟,并在可靠性方面回退到 Groq 或 Gemini 等云 API。该系统旨在提高在本地运行 LLM 时的决策能力和效率。
-
新数据集OpenDiscoveryTrace追踪人工智能科学家推理过程
发布了一个名为OpenDiscoveryTrace的新数据集,包含558个详细的人工智能科学代理轨迹。该数据集捕获了模型的逐步推理过程,而不仅仅是最终输出,以便审计科学方法和诊断故障模式。它包括来自GPT-5.4、Claude Opus-4.6和Gemini-3.1 Pro等前沿模型的数据,以及Qwen2.5-7B和Mistral-7B-v0.3等开源模型的数据。使用该数据集进行的初步分析显示,模型在错误类型和频率上存在显著差异,而仅…