PulseAugur
中
实时 18:15:43
实体 Qwen3.5 4B

Qwen3.5 4B

PulseAugur coverage of Qwen3.5 4B — every cluster mentioning Qwen3.5 4B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
73
90 天内 73
发布 · 30天
0
90 天内 0
论文 · 30天
34
90 天内 34
层级分布 · 90 天
主题
关系
时间线
  1. 2026-07-07 research_milestone Researchers presented a method for efficient inference of the Qwen3.5-4B model, achieving significant speedups. 来源
情绪 · 30 天

12 天有情绪数据

最近 · 第 1/4 页 · 共 74 条
  1. TOOL · CL_287166 ·

    新的空间潜在推理框架提高了视觉基础的准确性

    研究人员开发了一个名为空间潜在推理(SLR)的新框架,以提高指向性视觉基础的准确性。SLR围绕几何和视觉状态的有序序列构建监督,利用指尖位置和指向方向来指导过程。该方法在EgoPoint-Ground和YouRefIt等基准测试中提高了性能,与现有技术相比有了显著改进,尤其是在Qwen3.5-4B、Qwen2.5-VL-7B和Qwen3-VL-8B等模型上。

  2. TOOL · CL_284423 ·

    VisionWeave 使多模态大语言模型能够自适应地分配视觉表示,节省 token 并提高性能

    研究人员开发了 VisionWeave,一种用于多模态大语言模型(MLLMs)的新方法,该方法允许它们根据内容自适应地分配视觉表示。这种方法与当前使用固定大小 token 的方法形成对比,后者可能导致细节丢失。VisionWeave 结合了门控空间池化器和粒度路由器,以实现内容自适应粒度和提高效率。在 Qwen3.5-4B 上进行测试并扩展到 Qwen3.8-27B 后,VisionWeave 在八个基准测试中平均节省了 43% 的 …

  3. SIGNIFICANT · CL_283684 ·

    EmpirioLabsAI 发布 Aplomb 1,一款拥有 1M 上下文的 5.3B 决策模型

    EmpirioLabsAI 发布了 Aplomb 1,这是一款开放权重的决策模型,拥有 53 亿参数。该模型拥有 100 万 token 的上下文窗口,并能在单次请求中处理文本、图像、视频和音频。在决策指数的 8 项基准测试中,包括 MMLU-Pro 和 GPQA Diamond,它在高达 53 亿参数的模型中取得了最高分。Aplomb 1 基于 Qwen3.5-4B 和 Qwen3-Omni-30B-A3B-Instruct 构建,…

  4. TOOL · CL_281704 ·

    llama.cpp 优化 hexagon 架构以加速 AI 模型推理

    llama.cpp 项目发布了更新 b11430,专注于 hexagon 架构的性能改进。此次更新为 flash-attention 引入了头并行分区,允许每个核心处理 KV 缓存的特定头分片。这一改变显著提升了 Qwen3-0.6B 和 Llama 3.2:3b 等特定模型的性能,分别测量到高达 58% 和 49% 的提升。更新还包括了受 GGML_HEXAGON_FA_HEAD_SPLIT 标志控制的矩阵乘法和多设备场景的各种优化。

  5. RESEARCH · CL_280788 ·

    AI代理通过openTPU项目设计自己的推理硬件

    一个名为openTPU的开源项目展示了AI设计自身推理硬件的能力。该项目在一个单一的monorepo中详细介绍,包括SystemVerilog中的硬件设计、一个模拟器以及在PCIe卡上运行现代AI模型的宿主软件。该倡议旨在探索AI代理如何为硬件设计做出贡献,并为自身的推理任务构建芯片。

  6. TOOL · CL_269890 ·

    本地LLM对比Claude Code:96%的请求仍需前沿模型

    一位开发者尝试在RTX 4070上使用Qwen3.5 4B模型在本地运行Claude Code AI代理,以降低成本和增强隐私。实验显示,虽然97%的单个代理步骤可以在本地处理,但96%的整体请求需要前沿模型来处理复杂的规划。开发者发现,一个简单的基于规则的路由系统,优先为WebFetch等特定工具执行本地操作,并将复杂任务路由到前沿模型,比概率性方法更有效。

  7. TOOL · CL_274559 ·

    评分标准反应理论通过项目反应建模增强RL奖励

    研究人员引入了评分标准反应理论(RRT),这是一种在需要人类判断的强化学习任务中生成奖励的新颖方法。与对评分标准项求和的传统方法不同,RRT采用双参数项目反应模型,从判断模式中推断出标量质量分数。该方法以Qwen3.5-4B模型为证,在各种数据集上,尤其是在医学和科学领域,显示出优于Group Relative Policy Optimization (GRPO)的性能。RRT还通过自适应Fisher选择减少了所需的判断次数,从而提高了效率。

  8. RESEARCH · CL_266668 ·

    新的 AI 智能体研究聚焦于训练、可靠性和多智能体协调

    多项研究工作正致力于提升 AI 智能体的能力和可靠性。Hugging Face 推出了 AutoSynthData,用于为企业智能体生成训练数据,以及 Holo4,一系列专为多样化接口设计的智能体模型。Apple 的 SCLATE 为持续学习智能体训练和评估提供了基础,而 xAI 的 Team Bots 则允许 AI 同事之间共享上下文和学习。此外,新的研究论文探讨了智能体技能演化(SkillSpec)、资源分配(TRACE)、多智能…

  9. SIGNIFICANT · CL_278903 ·

    Microsoft 发布 FrogNano-4B-2609 用于软件工程任务

    Microsoft 推出了 FrogNano-4B-2609,这是一个源自 Qwen/Qwen3.5-4B 的专门的 40 亿参数语言模型。该模型经过了额外的纯文本后训练,专注于软件工程任务,包括仓库级导航、调试、代码编辑和补丁生成。FrogNano 采用强化学习方法,使用合成软件工程环境和 Leaf 工具执行器,旨在提高长程编码能力。然而,其训练主要以 Python 和英语为中心,并且没有为不受限制的自主部署进行独立的安全性对齐,生…

  10. TOOL · CL_261214 ·

    新的强化学习方法用更少的 token 提升多模态大语言模型的视觉感知能力

    研究人员开发了一种新颖的强化学习方法 Vision-RL2,用于增强多模态大语言模型(MLLMs)的细粒度视觉感知能力。该方法通过将连贯的图像区域视为动作,并根据其对多模态大语言模型答案可能性的影响进行评分,来优化区域提议网络。Vision-RL2 在各种基准测试和多模态大语言模型骨干网络上显著提高了准确性,同时大幅减少了所需的视觉 token 数量,从而降低了计算成本。

  11. TOOL · CL_254910 ·

    新的VLM框架使用专用工具改进遥感分析

    研究人员开发了一种新的遥感变更视觉问答(Change VQA)框架,通过使视觉语言模型(VLM)能够选择性地使用专用工具来提高准确性。该方法解决了VLM在需要显式转换统计、面积测量或空间信息的任务中的局限性。通过集成在双时态语义图上运行的确定性变更分析工具,VLM可以直接回答或利用工具生成的证据来获得更精确的响应。实验表明准确性显著提高,证明了特定于问题的语义证据的价值。

  12. COMMENTARY · CL_253082 ·

    用户寻求 Qwen3.5 4B 的替代品以用于快速本地AI助手

    一位Reddit用户正在寻找本地AI助手模型的推荐,要求其在通用对话、多语言能力和工具使用可靠性方面优于 Qwen3.5 4B。用户优先考虑速度和响应能力,目标是找到一个在有限硬件上能保持类似 Qwen3.5 4B 的 40-50 tokens/秒性能的模型。他们寻求的是显著的提升而非边际改进,重点关注相对于计算需求的整体能力。

  13. RESEARCH · CL_252223 ·

    新方法提高视频问答的准确性和可靠性 · 跟踪3个来源

    研究人员正在开发先进的方法来提高视频问答(VideoQA)模型的可靠性和准确性。一种方法侧重于通过分析响应图并使用直方图梯度提升等技术来优化答案级别的可靠性分数,该方法在HERBench和Perception Test等基准测试中取得了显著改进。另一种方法LOVER采用课程学习策略,将模型从长距离推理适应到短距离推理,在GQA基准测试中取得了最先进的成果。此外,一个名为AutoSkill的框架根据问题类型自动发现和路由帧选择技能,通过…

  14. RESEARCH · CL_254182 ·

    Lightning Weave框架提升AI推理的准确性和效率

    研究人员开发了Lightning Weave,一个旨在提高推理模型准确性和效率的训练后框架。该方法使用on-policy蒸馏技术,将独立训练模型中的不同能力组合到一个单一的学生模型中。实验表明,在HMMT 2025和LiveCodeBench v5等基准测试中取得了显著的改进,特别是对于Qwen3.5-4B模型,其准确性提高,响应token数减少。

  15. TOOL · CL_246303 ·

    微软研究人员发布 FrogNano,一款在合成任务上训练的小型 AI 模型

    来自微软研究院蒙特利尔、Mila 和加州大学圣地亚哥分校的研究人员开发了 FrogNano,这是一个基于 Qwen3.5-4B 构建的拥有 40 亿参数的模型。该模型使用强化学习和合成软件工程任务进行了优化,无需人工标注数据或更大的教师模型。其关键创新在于他们的方法,即在狭窄的难度范围内动态生成任务以优化学习,旨在创建一个能够在有限硬件上运行的编码助手。

  16. TOOL · CL_244925 ·

    新研究探究音频条件化大语言模型中的声学信息丢失

    研究人员调查了音频条件化语言模型为何常常无法利用韵律和情感等关键声学线索。他们的研究发表在arXiv上,在一个Qwen3.5-4B语言模型管道中测试了包括Whisper-Tiny、Whisper-Small、EnCodec、DAC-VAE和WavTokenizer在内的各种音频编码器。研究结果表明,仅更换编码器并不能完全解决问题,因为在情感识别和声音描述等任务中,Whisper变体仍然是最有效的。进一步的分析表明,虽然区分性的声学信息…

  17. SIGNIFICANT · CL_241368 ·

    TokenRhythm 发布 NeoHorse-1,一个在 Agent 反馈上训练的 Agent-Native 模型

    TokenRhythm 与 Wuxinqiong、清华大学、北京大学和阿里巴巴集团合作,推出了 NeoHorse-1,一个 Agent-Native 模型。该模型提供 4B 和 9B 版本,旨在将 Agent 使用工具、接收反馈和纠正错误的经验直接整合到模型的强大功能中。NeoHorse-1 基于 TokenRhythm 此前在 OpenSquilla 路由 Harness 系统上的工作,通过利用 Agent 执行轨迹作为核心训练数据…

  18. SIGNIFICANT · CL_241001 ·

    王云鹤创业公司发布NeoHorse,一款基于执行经验训练的原生智能体模型

    前华为诺亚方舟实验室主任王云鹤创立的初创公司集源律动发布了其首个原生智能体(Agent-Native)模型NeoHorse。该模型在无心琼的支持下,并得到清华大学和北京大学的研究贡献,专注于提升智能体利用工具、解读环境反馈和纠正错误的能力。NeoHorse-1提供4B和9B版本,在智能体后训练(Agentic Post-Training)后表现出显著提升,其中4B版本在具有清晰工作流程和可验证结果的任务上,在多项基准测试中已能媲美甚至…

  19. SIGNIFICANT · CL_241042 ·

    OpenBMB发布MiniCPM5-2B,一款性能媲美Gemma 4-12B的2B模型

    OpenBMB发布了MiniCPM5-2B,这是一款拥有20亿参数的AI模型,其性能可与Gemma 4-12B等更大模型相媲美。该模型在智能密度方面表现出色,并提供强大的日语语言能力,这在其模型尺寸中非常罕见。它在人工智能分析指数上名列40亿参数以下开源模型之首,并根据Apache License 2.0在Hugging Face和ModelScope上免费提供。

  20. RESEARCH · CL_240017 ·

    DeepSeek 拟采购 16 万片华为 AI 芯片;阿里开源自动驾驶模型 · 追踪 1 源

    DeepSeek 据报道计划采购 16 万片华为昇腾 950DT AI 芯片,在内蒙古建设大规模智能计算中心,订单估值达 25.6 亿美元。此次合作旨在提升 AI 模型推理能力,降低延迟和成本,并延伸至大规模集群的联合系统设计。另外,阿里巴巴的 Qwen 团队已开源 Qwen-Drive-1.0-4B,这是一个专为自动驾驶任务设计的视觉语言模型。