Qwen3.5 4B
PulseAugur coverage of Qwen3.5 4B — every cluster mentioning Qwen3.5 4B across labs, papers, and developer communities, ranked by signal.
- 2026-07-07 research_milestone Researchers presented a method for efficient inference of the Qwen3.5-4B model, achieving significant speedups. 来源
17 天有情绪数据
-
PlannerCritic LLM引擎在现场测试中从10个问题改进到零问题
一个名为PlannerCritic的开源引擎,专为LLM驱动的规划和审查而设计,已经过广泛的现场测试。早期对版本0.1.0的测试以0.30美元的成本发现了10个问题,包括设计缺陷和工具链错误。随后的更新,特别是版本0.2.1,显著改进了系统,代码审查在现场测试前捕获了所有已识别的错误,从而在最新的测试中未发现任何问题。
-
微调大型语言模型(LLM)以生成简洁的英文输出
本文探讨了如何让大型语言模型(LLM)的输出更加简洁高效。文章详细介绍了如何微调 Qwen3.5-4B 模型以生成更简单的英文文本。重点在于用更少的词语实现更好的沟通,这是有效应用 LLM 的关键方面。
-
本地 LLM 测量揭示“思考”和自我批评方面存在问题
运行 Qwen3.5 4B 等本地 LLM 需要仔细测量和验证,因为结果可能不一致。在某些模型中启用“思考”功能,如果超出令牌预算,可能会导致空响应,因此需要读取响应和思考字段或禁用“思考”。自我批评功能并不能可靠地提高准确性,甚至可能降低性能,这凸显了外部、可靠的验证方法的必要性。精确的提示工程,指定确切的输出格式和命名约定,比描述性提示在获得准确结果方面更有效。
-
Qwen3.5-4B模型训练以实现更安全的AI代理权限控制
研究人员开发了一种新颖的训练后方法来增强大型语言模型代理的安全性,特别关注减少过度授权错误。该技术教会了一个4B参数模型 Qwen3.5-4B,在可执行终端和MCP环境中行使任务条件权限。所提出的框架通过确定性验证器,根据完成情况、证据、状态、禁止尝试和安全成功来审计每个动作。通过优化任务特定的充分权限包络,该模型实现了98.48%的安全成功率,将过度授权事件从4.56%显著降低到0.79%。研究还表明该模型具有泛化能力并在其他任务上…
-
研究发现AI释义可提高情感分类器准确性
一篇新发表在arXiv上的研究探讨了情感分类器在处理讽刺和AI释义的社交媒体文本时的表现。研究人员发现,分类器在处理讽刺内容时表现出较低的置信度得分,表明其对不确定性的感知。与直觉相反的是,研究表明,与人类原创文本相比,情感分类器在AI释义的评论上达到了更高的准确率,这表明AI释义可以消除使分类器混淆的噪声。该论文还证明,一种简单的弃权机制,通过标记低置信度的输入,可以显著提高整体准确率。
-
腾讯发布EVIE-Preview-4.5B用于视觉文档检索
腾讯发布了EVIE-Preview-4.5B,一个基于Qwen3.5-4B的多语言视觉文档检索(VDR)模型。该模型采用ColBERT风格的晚期交互,并使用紧凑的128维多向量Token嵌入,参数量为4.54B。EVIE在ViDoRe基准测试中取得了最先进的性能,优于更大的模型,并将向量存储和索引成本降低了8倍至32倍。
-
新的基准Edit2TikZ揭示MLLM在科学图形编辑方面存在困难
研究人员推出了Edit2TikZ,一个旨在评估多模态大型语言模型(MLLM)使用TikZ代码编辑科学图形能力的新基准。该基准包含1,548个样本,涵盖真实世界和合成编辑,支持文本和视觉定位请求,并具有带注释的多步编辑功能。对14个主流MLLM的评估显示,当前模型在编译成功率和保留无关内容方面存在困难,专有模型仅达到75%的编译成功率。为了解决这些局限性,研究人员开发了一个名为TikZEditMix的混合训练集和课程学习方法,显著提高了…
-
Liquid AI 发布 LFM2.5-VL-3B,一款兼容智能手机的视觉语言模型
Liquid AI 发布了 LFM2.5-VL-3B,这是一款专为在智能手机上运行而设计的轻量级视觉语言模型。该开源模型拥有 31 亿个参数,内存使用量低于 3.3GB,支持 OCR、UI 识别以及包括日语在内的多种语言。基准测试显示,LFM2.5-VL-3B 在包括移动设备在内的各种处理器上,其性能优于 Gemma-4-E4B-it 和 Qwen3.5-4B 等大型模型,在 Galaxy S26 Ultra 上的解码速度达到 20 …
-
Liquid AI 发布用于设备端的 3B 视觉语言模型
Liquid AI 推出了 LFM2.5-VL-3B,这是一个拥有 31 亿参数的视觉语言模型,专为设备端应用而设计。该模型在读取数字屏幕、识别带坐标的物体以及处理文档和图表方面表现出色。它还支持函数调用,使其能够根据文本或图像输入与工具进行交互。虽然在各种基准测试中取得了强劲的性能,但它被认为是一个非推理模型,优先考虑低延迟。
-
新框架应对长文档和演进式文档理解挑战
研究人员开发了新的框架来应对理解长文档和演进式文档的挑战。InSight-doc 是一个代理式视觉感知框架,能自适应地分配视觉分辨率,以提高文档视觉问答的准确性并降低延迟。另外,TIDE 对大型语言模型在时间演进式文档上的表现进行基准测试,突显了其在版本解析和时间准确性方面的显著弱点。DocAtlas 提出了一种可变状态交互方法,将文档理解视为一个信息检索过程,并提供了搜索、阅读和笔记记录等工具,在基准测试中表现出改进的性能。
-
VLM 从各种文档中提取数据以用于 RAG 管道
一种构建检索增强生成 (RAG) 管道的新方法使用视觉语言模型 (VLM) 从各种文档格式(包括图像和电子表格)中提取信息。此方法将每个文档页面转换为图像,然后由 VLM 处理以生成摘要和关键字。提取的文本被嵌入并存储在带有 pgvector 的 PostgreSQL 数据库中,用于语义搜索。通过将模型从 Qwen3.5:20B 切换到 Qwen3.5:4B 以减少推理延迟,优化了管道。
-
开源模型成本仅为百分之一,搜索性能媲美GPT-5.6 Sol
Neon和Castform开发了一个开源AI模型,据称其搜索性能与OpenAI的GPT-5.6 Sol相当,但成本仅为其百分之一。通过使用强化学习对一个拥有40亿参数的开源模型进行微调,该系统在搜索任务上的准确性优于GPT-5.6 Sol及其他模型。这种方法通过从现有公司文档中自动生成训练数据,凸显了小型专业化模型为企业搜索需求提供经济高效解决方案的潜力。
-
Liquid AI 发布 LFM2.5-2.6B:支持128K上下文的设备端智能体模型
Liquid AI 发布了 LFM2.5-2.6B,这是一款开源权重、专为移动和边缘设备设计的设备端智能体模型。该模型拥有26.9亿参数,128,000个token的上下文窗口,并且无需依赖云API即可执行多步任务,包括规划和工具调用。Liquid AI 报告称,LFM2.5-2.6B 在指令遵循和工具使用基准测试中,与远大于自身的模型相比,表现具有竞争力,同时在各种硬件上保持了低内存使用和快速解码速度。
-
新AI框架TACT通过自适应策略增强英语辅导
研究人员开发了TACT(Taxonomy-Aligned Conversational Tutor),一个用于创建和评估英语作为第二语言的AI导师的新框架。TACT利用两个分类法——一个用于导师策略,一个用于学习者行为——来指导AI的教学方法。该系统在TACTCorpus上进行了后训练,并使用Group Relative Policy Optimization进行了优化,在一个诊断基准TACTBench上,其表现显著优于其基础模型和专…
-
新研究探索使用符号选项和合作进化策略训练的 LLM Agent
研究人员正在探索训练大型语言模型 (LLM) 作为复杂环境中 Agent 的新方法。一种方法,在一篇新的 arXiv 论文中详细介绍,使用“前沿编码模型”为 Agent 生成符号选项,然后使用多 Agent GRPO (PA-MAGRPO) 的变体和 LoRA 适配器进行训练。该方法旨在通过关注行为评估来提高 Agent 的性能,超越简单的奖励最大化,因为单独的奖励可能是真正合作的不可靠指标。另一篇论文介绍了一种用于资源受限的 LLM…
-
新多模态数据集 Theia 使用 Qwen3.5 为灾难响应生成
研究人员开发了一种新的方法来创建和验证一个名为 Theia 的大规模多模态数据集,用于灾难响应。该数据集源自仅视觉的 Incidents1M 数据集,并使用两种 Qwen3.5 模型架构(4B 和 35B MoE)生成了高保真文本描述。采用了一种图像无关的 LLM-as-a-Judge 方法,并使用 Qwen3.5-9B 的自动化验证流程,以确保语义准确性并评估字幕行为,结果显示精度高但召回率低。
-
新的服务器插件为本地 LLM 提供 OpenAI 风格的聊天补全功能
Simon Willison 开发了一个名为 `llm-chat-completions-server` 的新服务器插件,允许用户通过与 OpenAI Chat Completions 兼容的端点访问其本地 LLM 模型。该服务器由 GPT-5.6 "Sol" 编写,支持 OpenAI API 结构,能够进行会话式请求,其中客户端管理会话状态。该插件旨在通过内容可寻址日志(LLM 0.32rc1 中引入的功能)来去重会话消息。
-
新的信用分配方法增强了AI搜索代理的训练 · 跟踪3个来源
研究人员开发了训练长时搜索代理的新方法,这些代理是为执行复杂的多步任务而设计的AI系统。一种方法ABSeeker使用答案回溯信用分配(ABC)来提供更细粒度的监督,通过评估每个搜索步骤与来自地面真实答案的中间线索。另一种方法BiCAA采用双向信用分配,将前向可解性增益与事后成功关键性相结合,以生成密集的进程奖励。这两种技术都旨在提高训练稳定性并减少搜索增强代理中的冗余操作,ABSeeker在使用较小的模型在BrowseComp等基准测…
-
4B开放权重模型在瑞典语医学问答方面接近GPT-4性能
研究人员发现,较小的开放权重语言模型,特别是4B参数模型,在瑞典语医学问答任务上的表现正接近GPT-4等大型模型的性能。例如Qwen3.5-4B和Gemma4-E4B等模型在未经大量后期训练的情况下,在瑞典医学执业考试中展现出显著的准确性,其中Qwen3.5-4B的准确率达到87%。有趣的是,尽管提示是瑞典语,Qwen3.5-4B仍以英语进行推理,这表明对于这些模型而言,语言障碍不像之前认为的那样是主要障碍。
-
AI 系统在法律问答和翻译能力方面取得进展 · 跟踪 4 个来源
研究人员开发了新的 AI 系统来处理复杂的法律任务,包括问答和机器翻译。其中一个系统 AILQA 专为印度法律体系设计,并使用检索增强生成 (RAG) 和大型语言模型来提高准确性,在像全印度律师考试这样的标准化考试中,在某些情况下甚至优于参考答案。另一项研究通过比较小型语言模型和具有推理能力的模型,探讨了增强瑞士法律体系的法律机器翻译,发现强化学习可以显著提高翻译质量。另一篇论文详细介绍了在 COLIEE 2026 竞赛中跨多个任务的…