Qwen3 VL 4B instruct
PulseAugur coverage of Qwen3 VL 4B instruct — every cluster mentioning Qwen3 VL 4B instruct across labs, papers, and developer communities, ranked by signal.
- 2026-07-16 product_launch A modified version of the Qwen3-VL-4B-Instruct model, named Heretic, has been released for use with ComfyUI. 来源
3 天有情绪数据
-
Microsoft Research 推出 CARE-X 用于临床放射学任务
Microsoft Research 推出了 CARE-X,这是一种用于临床放射学任务的新型视觉语言模型,特别侧重于胸部 X 光检查。CARE-X 旨在通过结合自由文本报告生成和结构化诊断预测来统一各种解释需求。该模型采用强化学习来提高临床准确性,并在真实的印度临床数据上进行了验证。
-
CARE-X VLM 通过集成诊断和测量工具增强放射学报告
研究人员开发了 CARE-X,这是一种新颖的视觉语言模型 (VLM),旨在提高放射学报告的临床实用性。CARE-X 将辅助判别和定位头与其生成主干集成,增强了诊断预测和空间准确性。该模型还采用了解耦的 Clip 和动态采样策略优化 (DAPO) 方法,使用特定任务的奖励信号来优化报告生成和视觉问答。此外,CARE-X 集成了 Qwen3-VL-4B-Instruct 模型的工具调用能力,以执行精确的解剖测量,其性能明显优于仅感知基线。
-
新的 LoKr 模型捕捉 McBess 风格用于 Krea2 AI 图像生成
一款旨在模仿独特“McBess”风格的新 LoKr 模型已在 Krea2 上发布。该模型基于近 120 张精心标注的图像进行训练,旨在捕捉与艺术家 McBess 相关的尖锐、另类橡胶管动画美学。另一位用户也在 Krea2 上尝试使用 LoKr,将其性能与传统的 LoRA 模型进行比较,并注意到早期训练步骤的结果相似且效果不错。
-
Qwen3-VL-4B-Instruct 模型为 ComfyUI 修改,旨在无审查使用
Qwen3-VL-4B-Instruct 模型的一个修改版本 Heretic 已发布,可用于 ComfyUI。此版本经过了“abliteration”过程以移除拒绝机制,旨在提高对安全基准的合规性,同时保留模型在 GSM8K 和 MMLU 等任务上的核心智能和性能。发布版本包括针对不同 GPU 功能优化的各种量化格式,并提供了集成到 Krea 2 工作流的详细说明。
-
蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成
蚂蚁集团凌波科技发布了一系列旨在推进具身AI和机器人技术的新模型。LingBot-VA 2.0被呈现为首个具身原生世界动作模型,从根本上为物理世界交互而设计,而非改编数字世界模型。与之相辅的是LingBot-World 2.0,一个能够进行长达一小时生成的实时交互式世界模型,并整合了AI代理机制以实现动态交互。此外,LingBot-Video,一个基于MoE的视频生成模型,针对具身AI任务进行了优化,在机器人基准测试中表现优于现有模型…
-
KREA2 图像模型在 5 秒内生成 1K-2K 分辨率图像
KREA2 是一款新的图像生成模型,可以在 5090 GPU 上以大约 5 秒的时间生成 1K 到 2K 分辨率的图像。该模型使用了 Qwen-Image 自动编码器和 Qwen3-VL-4B-Instruct 文本编码器。为了应对消费级 GPU 的 VRAM 限制,提供了一个 FP8 权重变体模型,该模型在对质量影响极小的情况下显著减小了 Transformer 的内存占用。
-
新AI框架应对伪装目标检测挑战
研究人员开发了新的伪装目标检测(COD)框架,以解决过度检测问题。一种方法CFCamo使用反事实基准来训练智能体,使其能够检测伪装目标并在没有目标时弃权,从而提高了在现有数据集上的性能,并在新的CF-COD基准上实现了高对准确率。另一种方法CamoSAM2通过整合运动和外观线索来优化Segment Anything Model 2(SAM2)的提示,以增强视频中伪装目标的自动检测和分割,在平均交并比(mIoU)和推理速度方面优于当前最先进的方法。
-
新方法解决视频大模型中的幻觉问题
研究人员开发了几种新方法来解决视频大模型(VLMMs)中的幻觉问题。一种方法 MultiToP,通过选择性地用全局补丁标记替换不可靠的视觉标记来在语言生成之前对其进行精炼。另一种方法 ViSSRes,使用轻量级网络增强视频表示,以提高时空和语义一致性。第三种技术侧重于精炼文本嵌入,以鼓励更好地整合视觉信息并减少对语言先验的过度依赖。这些方法在减少幻觉率和提高各种基准测试中的视频理解能力方面显示出显著的改进。
-
新框架和基准测试推动移动 GUI 代理能力发展
研究人员开发了几个新的框架和基准测试,以推进移动 GUI 代理的能力。STAMP 为虚拟环境中的代理引入了显式内存训练,提高了任务的韧性。PhoneWorld 提供了一个可扩展的管道,用于将真实的移动轨迹转换为可控环境,用于训练和评估。MIRAGE 强调了 VLM 驱动的代理中的一个漏洞,展示了如何通过用户生成的内容实现提示注入。MobileExplorer 专注于通过并行探索 UI 元素和使用上下文提示来加速这些代理的设备上推理。M…
-
新的EO-Gym环境训练AI代理进行交互式地球观测分析
研究人员推出了EO-Gym,这是一个专为地球观测(EO)代理设计的交互式框架。该环境支持多模态分析和工具使用,模拟现实世界中经常涉及扩展感兴趣区域和检索不同传感器历史数据的EO任务。创建了一个包含超过9000个轨迹的基准数据集EO-Gym-Data来评估代理性能,结果显示当前的大型视觉语言模型在交互式EO推理方面存在困难。在EO-Gym-Data上微调Qwen模型显著提高了其在这些任务上的性能。