AutoProcessor
PulseAugur coverage of AutoProcessor — every cluster mentioning AutoProcessor across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Hugging Face 托管 huihui-ai 新的多模态 Qwen 模型
Hugging Face 正在托管来自 huihui-ai 的两个新的多模态模型:Huihui-Qwen3.8-27B-abliterated-GGUF 和 Huihui-Qwen3.8-27B-abliterated。这些模型专为图像到文本和文本到图像生成任务而设计。提供了将它们与 Transformers 等流行库以及 vLLM 和 SGLang 等推理提供商以及 llama.cpp、LM Studio 和 Jan 等本地应用程序集成的说明。
-
Hugging Face 托管 Qwen3.8-27B 模型变体并提供集成指南
Hugging Face 正在托管 DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN 模型的多个版本,包括一个 "GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF" 变体。该平台提供了详细的说明和代码片段,用于将这些模型与各种流行的推理工具(如 llama.cpp、vLLM、Ollama 和 LM Studio)集成。用户还可以找到在 Google Colab 和 Kaggle 等开发环境以及…
-
Bad Theory Labs 发布 BTL-4,一款 35B 参数的代理推理模型
Bad Theory Labs 发布了 BTL-4,这是一款基于 Ornith-1.0-35B 微调的 350 亿参数代理推理模型。该模型专门为工具使用、软件工程任务和长时程代理工作而设计。它已在 BFCL 和 LiveCodeBench 等基准测试中进行了评估,展示了其在执行门控推理方面的能力。
-
VLMs 实现开放词汇视频场景图生成
一种新的视频场景图生成(SGG)方法利用视觉语言模型(VLMs)来创建视频内容的结构化、机器可读的描述。与依赖固定词汇的传统 SGG 方法不同,这种方法使用 Qwen2.5-VL 等开放词汇 VLMs 直接从视觉和语言线索生成描述。该过程包括从视频中选择关键帧,然后使用 VLM 识别对象、人物及其关系,形成一个可编程分析的图。