PulseAugur
实时 07:49:32
实体 Qwen3.5:9b

Qwen3.5:9b

PulseAugur coverage of Qwen3.5:9b — every cluster mentioning Qwen3.5:9b across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
30
90 天内 70
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 38
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-19 research_milestone Microsoft's Agent Lightning v1.0 improved Qwen3.5-9B's performance on SWE-bench Verified from 41.8% to 56.4%. 来源
情绪 · 30 天

16 天有情绪数据

最近 · 第 1/4 页 · 共 70 条
  1. TOOL · CL_216092 ·

    新的RODE优化器解耦神经网络训练动态

    研究人员推出RODE,一种用于神经网络的新型优化引擎,它将矩阵更新的径向和方向分量解耦。这种分离允许不同的更新规则和步长,从而实现更有效和可控的训练。在GPT-2上的实验证明了在范数控制和方向更新方面的改进,而在语言建模和图像分类任务上的比较显示RODE的性能优于Muon变体,实现了更低的损失和最终的全局范数。

  2. TOOL · CL_215208 ·

    Qwen3.5-9B 模型通过实验性三循环架构得到增强

    一位用户开发了一种受 Nanbeige 4.5 启发的“三循环”模型架构,并将其应用于 Qwen3.5-9B。该实验模型使用 Qwen3.8-27B 的蒸馏 logits 进行训练,与基础 Qwen3.5-9B 相比,在数学、长上下文任务和指令遵循方面表现出显著的改进。然而,由于资源限制,训练被缩短,导致性能出现平台期,推理和翻译能力略有下降。用户认为,通过完整的训练计划和适当的学习率衰减,仍有可能取得进一步的进展。

  3. TOOL · CL_213136 ·

    大型语言模型简洁提示可省钱,缩短输入提示成本更高

    一项新研究发现,指示大型语言模型(LLM)在输出时保持简洁,可以在不影响准确性的情况下显著降低成本。该研究测试了包括 OpenAI、Anthropic 等公司模型在内的九种不同大型语言模型,结果显示平均节省成本 1.5 倍,在某些情况下甚至高达 3 倍。相反,缩短输入提示被证明是适得其反的,会导致成本增加和准确性下降,因为模型会试图弥补丢失的信息。研究还指出,虽然简洁的输出通常是正确的,但它们并不总是能反映模型不受限制的推理过程。

  4. SIGNIFICANT · CL_210096 ·

    Ornith-1.5系列开源LLM发布,可与Claude Opus 4.8匹敌

    AI研究组织Ornith发布了Ornith-1.5系列开源大语言模型。该系列模型有三种尺寸:Ornith-1.5-397B、Ornith-1.5-35B-A3B和Ornith-1.5-9B。最大的Ornith-1.5-397B模型在基准测试得分上可与Claude Opus 4.8相媲美,而最小的Ornith-1.5-9B模型经过量化后,能够在智能手机上运行。Ornith-1.5模型采用了自我改进策略进行训练,包含一个AI模型自身提出挑…

  5. TOOL · CL_211265 ·

    Meta 的 Muse Video 泄露,Replit 提供免费 GPT-5.6 Luna,AI 监管辩论

    Meta 的 Muse Video 模型已在封闭测试中揭晓,展示了其生成具有强大时间一致性和细节的 10 秒视频的能力,包括原生音频。与此同时,Replit 推出了免费模式,允许用户在日常任务中利用 OpenAI 的 GPT-5.6 Luna 模型而无需消耗积分,从而提高生产力。此外,文章还讨论了 AI 监管策略、AI 代理在基准测试中作弊的可能性,以及优化 DeepSeek-V4-Pro 等大型 AI 模型服务的方法。

  6. TOOL · CL_209263 ·

    Microsoft的Agent Lightning v1.0提升了Qwen3.5-9B在SWE-bench上的表现

    微软开发了Agent Lightning v1.0,这是一个连接强化学习以进行智能体训练的系统。这项新工作利用了一个端点代理来集成任何连接器,使训练器能够与环境循环进行交互。通过使用这种方法,并辅以适度的计算资源和6,000个训练示例,微软成功地将Qwen3.5-9B在SWE-bench Verified基准测试上的性能从41.8%提高到了56.4%。

  7. TOOL · CL_208407 ·

    研究发现:大型语言模型内部状态可揭示代码漏洞

    研究人员开发了一种方法,通过分析大型语言模型(LLMs)的内部激活而非仅仅是最终输出来检测代码漏洞。通过在Granite 4.1 8B和Qwen3.5-9B等模型的潜在激活上训练小型探测器,他们发现这些内部状态可以指示C/C++代码中是否存在漏洞。虽然在某些基准测试中,这些探测器取得了有竞争力的结果,但在更具挑战性的数据集上,它们仍然落后于最先进的分类器,这表明在模型原生漏洞筛查方面仍有未来发展的潜力。

  8. TOOL · CL_206796 ·

    研究人员发现AI上下文压缩会导致用户指令丢失

    宾夕法尼亚州立大学的研究人员发现,AI系统在压缩长对话上下文时,倾向于丢弃绝大多数用户定义的规则。这些指令的丢失率平均为83%,可能导致AI代理的行为违背用户偏好。为解决此问题,研究人员开发了一个基于Qwen3.5-9B模型的补充模块,该模块在上下文压缩过程中成功保留了超过90%的关键用户指令。

  9. COMMENTARY · CL_204516 ·

    Qwen3.5 9B 性能在用户对比中与 GPT-4o 展开辩论

    Reddit 上的 r/LocalLLaMA 子版块正在讨论 Qwen3.5 9B 模型与 GPT-4o 的性能对比。用户们正在争论,目前运行 Qwen3.5 9B 的 GPU 性能较弱的系统是否能超越使用 GPT-4o 的旧系统。一位用户声称,拥有视觉能力的 Qwen3.5 9B(小于 7GB)现在已经超越了 GPT-4o。

  10. MEME · CL_204394 ·

    r/LocalLLaMA 用户要求在模型帖子中注明量化级别

    r/LocalLLaMA 子版块的一名用户提议一项新规则,要求用户在其帖子中注明所讨论模型的量化级别。这是为了防止混淆并确保公平比较,因为不同的量化方法会显著影响模型性能。该用户强调了在没有关于所用量化信息的情况下声称模型性能的实例,导致了误导性的比较。

  11. TOOL · CL_194600 ·

    AI模型Qwen3.5、Gemma 4和Bonsai在旧款GPU上进行测试

    一位用户在一台GTX 1080 Ti GPU上测试了三个AI模型——Qwen3.5 9b、Gemma 4 12b和Bonsai 27b,以评估它们在本地处理长播客的性能。目标是创建一个无需依赖云服务的管道,用于生成转录、识别关键片段和制作短视频剪辑。用户进行了侧重于长上下文能力和推理任务的测试,比较了有无审议的性能,并发现结果出人意料。

  12. COMMENTARY · CL_194300 ·

    AI模型发布越来越倾向于更大尺寸,小型模型被抛弃

    消费级硬件用户注意到一个趋势:新发布的大型语言模型主要集中在27B参数及以上,而在8B-12B范围内的新模型越来越少。这一转变使得内存有限的用户,例如使用Macbook Pro M4(16GB内存)的用户,难以找到符合其系统能力的新模型。问题在于,开发高性能的8B-12B参数级别的前沿模型是否在技术上变得不可行。

  13. FRONTIER RELEASE · CL_182987 ·

    Liquid AI 发布 LFM2.5-2.6B:支持128K上下文的设备端智能体模型

    Liquid AI 发布了 LFM2.5-2.6B,这是一款开源权重、专为移动和边缘设备设计的设备端智能体模型。该模型拥有26.9亿参数,128,000个token的上下文窗口,并且无需依赖云API即可执行多步任务,包括规划和工具调用。Liquid AI 报告称,LFM2.5-2.6B 在指令遵循和工具使用基准测试中,与远大于自身的模型相比,表现具有竞争力,同时在各种硬件上保持了低内存使用和快速解码速度。

  14. TOOL · CL_182505 ·

    Liquid AI发布了能够支持手机上128K上下文的2.6B模型

    Liquid AI发布了LFM2.5-2.6B,这是一款专为本地AI应用设计的紧凑型语言模型。尽管其参数量仅为26.9亿,但该模型拥有128K的上下文窗口并支持工具调用,使其适用于多步代理工作流。初步基准测试表明,在特定任务上,其性能可与Qwen3.5-9B等更大模型相媲美,尽管编码和知识密集型工作仍有改进空间。该模型的效率得到了其报告速度的体现,包括在手机上达到30 tokens/秒的速度和低于2.5 GB的内存使用量,这表明其在设…

  15. TOOL · CL_180487 ·

    新的MedUPS框架有助于罕见病例的诊断

    研究人员开发了MedUPS,一个旨在通过关注中间决策而非仅仅最终诊断来辅助罕见病例诊断的新框架。该方法使用了源自真实患者病例的21,874个中期临床决策点的数据集。通过训练模型预测下一个适当的行动,例如订购检查或影像学检查,MedUPS在准确性方面有所提高,有时小型模型甚至优于大型模型。

  16. TOOL · CL_178244 ·

    新系统通过本体引导的提取增强知识图谱构建

    研究人员开发了一种新颖的提取层,旨在提高从不同文档类型构建知识图谱的准确性和一致性。该系统利用本地托管的Qwen3.5-9B模型,在正式本体的指导下提取实体和关系。一项关键创新是动态检索相关的本体切片,显著降低了目录开销。该系统包含一个多阶段优化流程,包括复杂的去重算法和一个嵌入解析子系统,以确保高质量、合并的知识图谱,并提高搜索召回率和纠正质量缺陷。

  17. TOOL · CL_174306 ·

    新多模态数据集 Theia 使用 Qwen3.5 为灾难响应生成

    研究人员开发了一种新的方法来创建和验证一个名为 Theia 的大规模多模态数据集,用于灾难响应。该数据集源自仅视觉的 Incidents1M 数据集,并使用两种 Qwen3.5 模型架构(4B 和 35B MoE)生成了高保真文本描述。采用了一种图像无关的 LLM-as-a-Judge 方法,并使用 Qwen3.5-9B 的自动化验证流程,以确保语义准确性并评估字幕行为,结果显示精度高但召回率低。

  18. TOOL · CL_177152 ·

    前沿大模型高精度提炼答案集编程理论

    一项新研究探索了使用神经符号方法从大型语言模型中提炼答案集编程(ASP)理论。该研究测试了九个模型,包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5 和 DeepSeek V4 Pro 等前沿模型,涵盖了 CLEVR、GQA 和 CLEVRER 三个基准。大多数前沿模型都取得了高精度,其中 Sonnet、Opus 和 DeepSeek V4 Pro 在 CLEVRER 上达到了 90% 以上的准确率…

  19. TOOL · CL_171822 ·

    新的WikiLoop框架联合构建和导航代理原生知识库

    研究人员开发了WikiLoop,一个新颖的框架,能够联合学习构建和导航代理原生维基。该系统允许一个持久的、链接页面的知识库,专为机器导航而设计。该框架使用共享策略,具有构建和导航的不同角色,其中构建者提出由导航者评估的编辑。WikiLoop在AuthTrace等基准测试中表现出改进的性能,尤其是在复杂的多文档查询方面,优于现有方法。

  20. TOOL · CL_171817 ·

    New method classifies fine-grained inconsistencies in financial disclosures

    研究人员开发了一种用于金融披露文本的细粒度不一致分类方法,旨在不仅识别冲突的存在,还识别其具体类型。一项使用合成SBID-FD基准的研究比较了各种模型,包括微调编码器和改编的大型语言模型,如Qwen3.5-9B和GPT-5.4。结果表明,微调的300M编码器取得了具有竞争力的准确性,突显了紧凑型监督模型的效率。研究还表明,虽然提供正确的证据跨度显著提高了分类准确性,但定位质量仍然是一个瓶颈,特别是对于参照不一致性。