Qwen2
PulseAugur coverage of Qwen2 — every cluster mentioning Qwen2 across labs, papers, and developer communities, ranked by signal.
- 2026-07-24 product_launch Alibaba Cloud launched the Qwen2 series of open-source language models. 来源
-
新的RODE优化器解耦神经网络训练动态
研究人员推出RODE,一种用于神经网络的新型优化引擎,它将矩阵更新的径向和方向分量解耦。这种分离允许不同的更新规则和步长,从而实现更有效和可控的训练。在GPT-2上的实验证明了在范数控制和方向更新方面的改进,而在语言建模和图像分类任务上的比较显示RODE的性能优于Muon变体,实现了更低的损失和最终的全局范数。
-
Ornith-1.0:新型开源编码模型面临集成障碍
Ornith-1.0 是一个新推出的开源权重编码模型,其独特之处在于它在训练过程中学会构建自己的问题解决框架,而不是依赖于预先存在的框架。尽管其参数量为 9B,但它表现出强大的性能,在编码基准测试中可与 Gemma4-31B 等更大模型相媲美甚至超越。然而,用户在将其与 Ollama 等工具集成时遇到了挑战,这主要是由于模板元数据和模型用于工具调用的输出格式存在问题,需要手动配置才能正常运行。
-
Qwen 模型使用 ChatML 格式,社区改进模板
Qwen 模型(包括 Qwen2.5 系列)使用 ChatML 格式来构建对话提示,这与 OpenAI 的早期模型类似。该格式依赖于像 和 这样的特定 token,并且需要精确的换行约定才能正常工作。开发者指出,格式不正确可能导致模型输出和性能出现细微但显著的问题。此外,最近社区的努力集中在为 Qwen 模型改进和优化 Jinja 聊天模板,旨在通过严格遵循原始训练格式来确保兼容性和最佳性能。
-
AI 模型受过时数据阻碍,实时搜索是解决方案
大型语言模型(LLMs)受到知识截止日期的限制,这意味着它们的训练数据在发布时就已经过时。即使是像 Anthropic 的 Claude 4.7 Opus 这样训练数据截止到 2026 年 1 月的先进模型,也无法理解当前事件。为了克服这一限制,通过 API 集成实时搜索数据对于 AI 系统提供准确和最新的信息至关重要,从而实现更有效的代理工作流和复杂的自动化。
-
Qwen VLMs 在复杂说服任务上表现强劲
研究人员使用 ImageArg 数据集评估了视觉语言模型(VLMs)在复杂的亚里士多德说服任务上的表现,该数据集侧重于 Logos、Ethos 和 Pathos 的检测。研究发现 Qwen 系列模型表现有所提升,其中 Qwen3 在 Logos 和 Pathos 任务上表现出色,Qwen2 在 Ethos 检测方面表现强劲。研究人员已公开其代码,以鼓励对 VLMs 在此领域的能力进行进一步研究。
-
阿里云发布 Qwen2 模型系列,具备长上下文和多语言能力
阿里云已发布 Qwen2 系列开源语言模型,提供从 0.5B 到 72B 参数的多种尺寸,包括一个混合专家模型。这些模型在长上下文推理方面能力得到增强,支持高达 128K token,并改进了多语言支持,训练数据涵盖 27 种语言。Qwen2 系列在各种基准测试中表现强劲,使其成为寻求强大且灵活的开源 AI 解决方案的开发者的有力竞争者。
-
无键注意力机制将KV缓存减半,提高Transformer效率
研究人员推出了一种新颖的Transformer注意力机制——无键注意力(Keyless Attention),该机制完全消除了键投影,仅基于查询(queries)和值(values)进行操作。与标准注意力相比,这种方法产生了一个仅值缓存(Value-Only Cache),将KV缓存内存和访问开销减半,同时保持或提高了解码吞吐量。该机制还实现了深度注意力因子分解(Depth-m Attention Factorization),实验表…