PulseAugur
中
实时 00:59:38
实体 Qwen3.5:9b

Qwen3.5:9b

PulseAugur coverage of Qwen3.5:9b — every cluster mentioning Qwen3.5:9b across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
103
90 天内 103
发布 · 30天
0
90 天内 0
论文 · 30天
55
90 天内 55
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-19 research_milestone Microsoft's Agent Lightning v1.0 improved Qwen3.5-9B's performance on SWE-bench Verified from 41.8% to 56.4%. 来源
情绪 · 30 天

13 天有情绪数据

最近 · 第 1/6 页 · 共 106 条
  1. TOOL · CL_287755 ·

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash

    Cloudflare 发布了两个开源决策模型 Clef 和 Clef-flash,用于分类和选择等任务,无需生成文本。这两个模型分别基于 Qwen3.8-27B 和 Qwen3.5-9B 构建,兼容 Jev API,可在 OpenRouter 和 Hugging Face 上获取。初步测试表明,Clef 模型比 Jev 更快,但在更复杂的推理任务上 Jev 表现更好。

  2. TOOL · CL_287130 ·

    强化学习教师在模型合并研究中产生更强的学生模型

    一篇新发表在arXiv上的研究论文,题为“Train4Merge: 一项关于基于OPD的模型合并的RL与SFT教师的受控单教师研究”,调查了在单策略蒸馏(OPD)模型合并中,用于创建专家模型的不同训练算法的有效性。研究人员比较了监督微调(SFT)和强化学习(RL)教师,发现RL教师在代理、推理和感知领域持续产生更强的学生模型。研究观察到,RL指导下的学生模型恢复了更多教师的性能增益,其中一个案例甚至超越了教师的性能。

  3. TOOL · CL_286887 ·

    InfiMed2模型在医疗基准测试中达到SOTA,超越Qwen3.5-9B

    研究人员推出了一系列新的医疗多模态基础模型InfiMed2,有4B和27B参数两种尺寸。这些模型采用阶段感知数据处理设计,利用包含临床知识和生物医学视觉证据的55.68B token语料库。训练流程包括适配视觉编码器、构建广泛的医学知识以及专注于基于证据的数据混合。在监督微调方面,InfiMed2采用答案稳定性和正确性约束选择等技术来生成更具信息量的解释。经过强化学习进一步优化的4B模型在五个基准测试中的平均准确率为66.73%,优于…

  4. TOOL · CL_283784 ·

    Mac 本地 LLM 设置指南:Obsidian 和 Ollama

    本文详细介绍了在内存为 24GB 的 Mac 上本地运行大型语言模型的设置。文章重点介绍了 Obsidian 与 Ollama 的结合使用,并强调了其他指南中经常被忽略的具体配置和故障排除步骤。作者分享了他们使用 Qwen3.5 9B 等模型和 Copilot 等工具的经验,并强调了实现高效本地 LLM 集成的实用建议。

  5. TOOL · CL_283591 ·

    开发者创建了一个AI模型,旨在高置信度地出错

    一位开发者创建了一个名为Bev的AI模型,其设计目的是故意以高置信度提供错误答案。Bev在Qwen3.5-9B上进行了微调,旨在作为测试AI决策管道的对照案例。最初的训练尝试失败了,但通过使用现有的适配器并反转标签,最终成功,导致该模型大约98%的时间出错,同时对其错误响应保持96%的置信度。Bev可通过Hugging Face Spaces和Ollama获取,它既是一个幽默的“人工醉酒智能”,也是一个用于验证系统鲁棒性的工具。

  6. TOOL · CL_280348 ·

    分类后缀可提升 LLM Agent 检测恶意输入的能力

    研究人员调查了使用分类后缀来提高 LLM Agent 检测恶意输入有效性。他们的研究测试了 13 个安全基准和三个开源模型家族的各种后缀,发现附加分类指令比不加后缀更能持续地提高分布外检测能力。后缀的措辞很重要,分类提示比不相关或仅仅是关注提示更有效。这种好处源于分类格式本身,具体标准仅在更严格的阈值下增加精度。研究结果表明,通过 KV 缓存分叉提供的这些分类后缀可以成为激活探测监控器的经济高效的补充,尽管其有效性取决于特定模型和读出方法。

  7. TOOL · CL_277398 ·

    Cloudflare推出Clef-Flash,一个用于快速分类的9B决策模型

    Cloudflare发布了Clef-Flash,一个拥有90亿参数、专为速度和效率设计的决策模型,该模型基于Qwen3.5-9B构建。与传统的聊天模型不同,Clef-Flash在一个前向传播中处理输入状态和类型化问题,并返回预定义答案的概率,而不生成自由文本。这使其适用于支持工单分类等任务,可以快速分类其紧急程度和负责人。Cloudflare还提供了一个名为Clef的更大、经过精度调优的27B参数模型,该模型包含用于图像分类的视觉能力。

  8. TOOL · CL_276079 ·

    PewDiePie 发布“无审查”AI模型,声称被 OpenAI 拉黑

    YouTube 用户 PewDiePie 发布了 Ajax,一个旨在在家用电脑上运行的“无审查”AI模型。他声称在开发 Ajax 期间,OpenAI 因“蒸馏”(使用一个AI模型的输出来训练另一个模型)为由两次封禁了他的账户。Ajax 基于微调的 Qwen3.5-9B 模型构建,旨在作为他 Odysseus 工作区内一个私有的、始终在线的助手,处理网页搜索和电子邮件管理等任务。

  9. SIGNIFICANT · CL_274979 ·

    Cloudflare 发布 Clef 决策模型,支持类型化概率输出

    Cloudflare 推出了 Clef 和 Clef-flash,这是两个开放权重的决策模型,专为特定问题回答而非通用文本生成而设计。这些模型基于 Qwen 主干构建,并兼容 TypeSafe AI Jev API,能够为关于输入状态(包括文本、图像和视频)的预定义问题返回类型化概率。虽然 Clef 和 Clef-flash 在 Banking77 和 CLINC150+OOS 等某些基准测试中表现优于 Jev,但在 GPQA Dia…

  10. TOOL · CL_273254 ·

    蛋白质折叠数据提升LLM推理能力

    研究人员开发了一种名为Fold2Reason的新方法,通过在蛋白质折叠数据上进行训练来提高大型语言模型的推理能力。该方法结合使用离散结构答案和从共享表示中提取的连续3D几何。当应用于蛋白质结构预测时,Fold2Reason的得分显著高于Qwen3.5-9B,高出2.7至3.5倍。此外,该方法通过将宏平均准确率从45.09%提高到48.33%,提升了在包括空间、图和一般推理在内的十个不同推理基准上的性能。这项研究表明,像蛋白质折叠这样富…

  11. TOOL · CL_272779 ·

    Ornith-1.0-9B 对比 Qwen 3.5 和 Gemma4:本地大模型编码性能比较

    一篇博客文章最近比较了三种本地大语言模型(LLMs)在编码任务上的性能:Ornith-1.0-9B、Qwen 3.5 和 Gemma4。Ornith-1.0-9B 是一个基于 Qwen 3.5-9B 构建的专用代理编码模型,在标准开发笔记本电脑上与它的基础模型和 Gemma4-12B 进行了测试。比较侧重于使用 Ollama 和 GGUF 文件进行的实际性能测试,Ornith 在特定的编码代理任务中展现出潜力。

  12. TOOL · CL_280593 ·

    蛋白质折叠数据提升大型语言模型推理能力

    研究人员开发了一种名为Fold2Reason的新方法,该方法利用蛋白质折叠数据来提高大型语言模型(LLM)的通用推理能力。通过在源自蛋白质结构的数据集上进行训练,Fold2Reason在预测蛋白质结构方面表现出显著的改进,在FoldBench上的得分比Qwen3.5-9B高2.7至3.5倍。此外,这种方法在包括空间、图、科学和通用推理任务在内的十个不同基准测试中都提高了性能,宏平均准确率提高了3.23个百分点。该研究表明,整合非语言、…

  13. RESEARCH · CL_273437 ·

    EvoDuet通过协同进化的搜索和解决方案增强LLM科学发现能力 · 跟踪3个来源

    研究人员开发了EvoDuet,这是一种新颖的双层优化方法,旨在通过改进大型语言模型(LLM)利用外部知识的方式来增强科学发现。该方法协同进化解决方案和搜索查询,使LLM能够动态评估知识差距,并决定是检索新文档、重用现有文档还是在没有外部信息的情况下继续进行。EvoDuet在归一化发现方面取得了显著的进步,特别是在GPT-5.6-Luna和Gemini-3.8-Flash等模型上,在多项优化任务上表现优于先前的方法。

  14. RESEARCH · CL_268902 ·

    新研究探讨LLM上下文管理和检索机制 · 跟踪4个来源

    研究人员正在探索大型语言模型(LLM)如何管理上下文信息,新论文提出了不同的方法。一项研究介绍了“上下文语言模型”(CLMs),它们将上下文原生管理为文件,在浏览和多代理系统等任务中表现优于现有方法。另一篇论文研究了LLM中的“序数向量”,认为模型根据提及顺序而非实体名称来回忆事实。第三篇论文考察了LLM的“上下文绑定能力”,量化了模型在失去跟踪之前可以回忆多少次赋值,第四篇论文则探讨了如何使用LLM将任务相关的上下文编译到贝叶斯优化中。

  15. SIGNIFICANT · CL_280914 ·

    Autotrust发布具有快速视觉能力的JEV多模态模型

    Autotrust已发布两款新的多模态模型JEV-27B-VL和JEV-9B,可在Hugging Face上获取。JEV-27B-VL专为图像到文本任务设计,可与Transformers、vLLM和SGLang等库集成。JEV-9B模型是Qwen3.5-9B的演进版本,集成了“系统1”快速决策层和“系统2”推理层,使其能够以惊人的速度和准确性执行机器人手臂操作和计算机界面控制等视觉任务。

  16. RESEARCH · CL_268155 ·

    新研究探索LLM的高级量化技术 · 已追踪10个来源

    多篇研究论文介绍了量化大型语言模型(LLMs)的新技术,以减少其计算和内存占用。这些方法旨在提高效率,同时不显著牺牲性能。方法包括激活量化的优化旋转、面向量化感知训练的最小范数优化,以及用于部署对齐的量化感知蒸馏框架。其他研究侧重于超低复杂度反量化、重新思考优化损失尺度以及量化的联合交替细化,所有这些都有助于使LLMs更易于访问和更高效。

  17. TOOL · CL_260723 ·

    在 Mac 上使用 LoRA 和 MLX 微调 Qwen LLM

    本指南详细介绍了如何使用 LoRA 在配备 Apple Silicon 的 Mac 上微调 Qwen 模型,特别是 Qwen3.8-27B 和 Qwen3.5-9B。它提供了从环境设置到将训练好的适配器与基础模型合并的整个过程的七个脚本。教程强调了实际方面,如管理内存使用、优化训练轮次而非步数,以及适配器合并技术的重要性,以避免数据丢失。

  18. TOOL · CL_260594 ·

    FreedomIntelligence 发布采用新颖 OnePO 训练的 HuatuoGPT-3-9B 医疗大模型

    FreedomIntelligence 发布了 HuatuoGPT-3-9B,这是一款新的医疗领域大语言模型。该模型基于 Qwen3.5-9B 构建,并采用了一种名为 One-stage Policy Optimization (OnePO) 的新颖训练方法。OnePO 允许模型在单一强化学习阶段适应医疗语境,无需进行初始监督微调。

  19. TOOL · CL_260395 ·

    Qwen3.5-9B模型在Mac本地基准测试中表现不一

    对五款无审查的Qwen3.5-9B模型的评测表明,即使经过修改,仍有一款模型拒绝处理其声称能处理的71%的提示。该基准测试在M5 Mac上进行,每个模型使用115个提示,评估其本地性能。

  20. TOOL · CL_252012 ·

    新的地球观测Agent框架性能超越现有方法

    研究人员推出Earth-Agent-Pro,一个专为真实世界地球观测(EO)任务设计的新型框架。与通常从预先提供的数据开始的现有系统不同,Earth-Agent-Pro处理从解释科学问题到执行工作流、获取数据、执行计算和得出结论的整个过程。该系统采用“计划-执行”方法,并结合专家编写的技能和结构化内存来管理和修复工作流执行。评估表明,使用GPT-5作为骨干的Earth-Agent-Pro在准确性和有序性方面显著优于ReAct框架,并且…