Hugging Face Transformers
PulseAugur coverage of Hugging Face Transformers — every cluster mentioning Hugging Face Transformers across labs, papers, and developer communities, ranked by signal.
- 2026-09-30 product_launch Hugging Face released version 5.18.0 of its Transformers library, introducing new models and updates. 来源
4 天有情绪数据
-
AI/ML技术回顾:Scikit-learn、LangGraph及其他60种评估
对62种AI和ML技术的审查,重点介绍了哪些工具被持续选择重复使用,以及五种被搁置的工具和评估者之间的分歧领域。分析涵盖了广泛的库和平台,包括scikit-learn、Pandas、NumPy、PyTorch、TensorFlow、Keras和Hugging Face Transformers等热门选择。它还涉及了SpaCy和Natural Language Toolkit等自然语言处理工具,以及OpenAI、Anthropic、Go…
-
Mistral AI Python 库包含影响代理开发的隐藏 bug
一位开发者在 Mistral AI 的 Python 库中发现了三个关键 bug,这些 bug 可能在不被察觉的情况下影响基于该平台构建的代理。这些问题包括:可选的工具参数被视为强制参数;由于 schema 覆盖导致一个字典字段无法接受任何键;以及一个换行符绕过了函数名和工具调用 ID 的验证。这些影响 `mistral-common` 和 `client-python` 等库的 bug 已经得到修复并已提交到上游,开发者敦促用户验证…
-
LLM聊天模板错误导致本地模型行为问题
本地LLM部署可能会遇到模型生成超出答案范围、忽略系统提示或因聊天模板实现不正确而丢失指令等问题。当推理过程中使用的提示格式偏离模型训练时的确切结构时,尤其是在标记对话轮次和角色的控制令牌方面,通常会出现这些问题。由于不同的模型系列使用不同的控制令牌,并且各种推理引擎(如Hugging Face Transformers、llama.cpp或NobodyWho)可能以不同的方式实现模板渲染过程,导致输入到模型的最终提示存在差异,从而产生差异。
-
Hugging Face Transformers 5.18.0 新增多模态模型和说话人日志
Hugging Face Transformers 库发布了 5.18.0 版本,引入了几个新模型和重要更新。主要新增功能包括用于说话人识别的 Nemotron 3 Diarization,用于跨文本、图像、视频和声音的多模态推理的 NemotronH Omni,以及来自 Naver 的多模态模型 HyperCLOVAX Vision V2。该版本还整合了新的文本表示模型 GTE,并包含与 ROCm、vLLM 和各种模型集成相关的重大…
-
H公司发布单塔多模态编码器系列NeoMME
H公司推出了NeoMME,这是一个专为提高效率而设计的新型多模态编码器系列。这些模型提供2.6亿和8亿参数两种尺寸,无需独立的视觉塔和因果解码器,通过单一Transformer架构处理文本和图像数据。这种简化的方法旨在降低计算开销,同时保持强大的性能,其中2.6亿参数的NeoMME-Retriever在文档检索基准测试中取得了有竞争力的结果。
-
SGLang 为大语言模型提供结构化生成和高效调度
SGLang 是一个面向大型语言和多模态模型的高性能服务框架,专注于结构化生成和高效调度。它通过提供批处理、内存管理和 OpenAI 兼容的端点,在 vLLM 和 Hugging Face Transformers 等标准解决方案之上具有优势。然而,其性能高度依赖于特定的硬件和工作负载特性,需要仔细的基准测试才能实现最佳部署。
-
Google 发布 Gemma 2,采用高效架构,性能超越更大模型
Google 发布了 Gemma 2,包含新的 9B 和 27B 参数模型,这些模型优先考虑架构效率而非单纯的规模。这些模型采用了经过重新设计的 Transformer 架构,结合了混合注意力机制和分组查询注意力(Grouped-Query Attention),从而降低了计算和内存成本。这种效率使得 27B 模型可以在单个 NVIDIA H100 或 Google TPU 上运行,使其能够与更大的模型竞争,并降低了开发者的部署成本。
-
阿里巴巴预览Qwen4,采用新颖的逐层嵌入和稀疏注意力技术
阿里巴巴的Qwen团队发布了Qwen4-Exp,这是一个预览即将推出的Qwen4系列架构的实验模型。该模型引入了新颖的设计选择,包括逐层嵌入(PLE)和Qwen稀疏注意力(QSA),旨在在计算成本不成比例增加的情况下提高容量。PLE系统利用存储在主机RAM中的大型N-gram嵌入表,以最小的GPU影响提供显著的表示优势,并得到llama.cpp等框架的支持以进行CPU卸载。QSA通过在块级别而非令牌级别操作来提高效率,显著加快了长上下…
-
Hugging Face Transformers 教程更新至 v5,放弃 TensorFlow/Flax 支持
AssemblyAI 已更新其流行的 Hugging Face Transformers 教程,以反映自 2022 年以来该库的重大变化。新教程侧重于 Transformers v5,该版本已放弃对 TensorFlow 和 Flax 的支持,现在仅支持 PyTorch。关键更新包括安装程序的更改、使用 'text-classification' 等规范任务名称而非别名,以及模型加载和保存方法的调整。pipeline 的核心概念——结…
-
新的LMSM框架通过模块化设计增强LLM安全性
研究人员推出了一种名为语言模型安全模块(LMSM)的新型框架,旨在增强大型语言模型(LLM)部署的安全性。LMSM借鉴了Linux安全模块的理念,将证据校准、策略评估和输出门控等过程分离开来。这种模块化方法允许灵活且可解释地执行安全规则,而无需完全重建请求处理系统。在Qwen3-4B模型上的测试表明,LMSM在XSTest上仅略微增加了误拒绝率的情况下,显著降低了HarmBench上的攻击成功率,同时保持了高吞吐量。
-
KV 缓存缺陷破坏语言代理回滚一致性
arXiv 上的一篇新研究论文详细介绍了一个与 KV 缓存保留相关的语言代理中的关键漏洞,该漏洞可能导致回滚不一致。这意味着,即使应用程序认为它已丢弃某些信息,模型仍可能由于残留的 KV 状态而保留并关注这些信息。研究人员在多个开源模型上展示了这个问题,并发现即使使用 Hugging Face Transformers 和 LangGraph 等标准工具也可以重现。他们提出了一种通过事务本地缓存恢复来解决此问题的方案,以弥补此状态完整性漏洞。
-
新流程解决视频-LLM问答中的幻觉引用问题
研究人员开发了一个自验证流程,以解决由视觉语言模型驱动的视频问答系统中出现的幻觉引用问题。这些系统经常自信地提出时间戳声明,但这些声明并未得到所引用帧的支持,从而误导用户。提出的流程包括一个初始的检索增强语言模型,该模型起草带有时间戳引用的答案,然后独立地重新检查每个引用的帧。实验表明,直接要求视觉模型验证声明由于“谄媚”效应而无效,而一个小型自然语言推理模型被证明是一个稳定且可解释的验证器,在对抗性场景中成功识别了79%的虚假声明,…
-
KV 缓存大小挑战 LLM 推理效率
KV 缓存是高效 LLM 推理的关键组成部分,它存储每个 token 的键值向量以避免重新计算。该缓存的体积可能比模型权重本身大得多,尤其是在上下文窗口较长的情况下,这会导致巨大的 GPU 内存需求。优化 KV 缓存的传输和管理对于降低推理延迟和成本至关重要,vLLM 和 DeepSpeed 等工具提供了潜在的改进方案。
-
Nanbeige4.2-3B 模型已修复 Apple Silicon 部署问题
一篇新论文详细介绍了在 Apple Silicon 上部署 Nanbeige4.2-3B 模型(一个拥有 30 亿参数、采用 Looped Transformer 架构的 agentic 模型)所面临的挑战及解决方案。研究人员发现了五个阻止该模型在 Hugging Face Transformers 上运行的关键 bug,包括 RoPE 缓冲区和 API 调用问题。此外,该模型的层重用策略导致了显著的内存开销,限制了其有效上下文宽度。…
-
Meta Muse Glimmer 30B 模型已集成到 Hugging Face Transformers 和 Ollama 中
Meta 的新型 Muse Glimmer 30B 多模态模型已正式集成到 Hugging Face Transformers v5.15.0 和 Ollama v0.32.8 中,使其能够广泛用于本地 AI 应用。该开放权重模型专为代理工作流设计,例如编码助手和个人助手。此次集成使用户能够轻松地在消费级硬件上下载和运行 Muse Glimmer,无需使用云服务。此外,llama.cpp 发布了一个更新,通过多输出后端采样和 toke…
-
Tevatron-Elastic 统一检索系统的模型扩展
研究人员推出了 Tevatron-Elastic,这是一个旨在简化弹性检索系统训练的统一抽象。该框架将减少模型大小的三种方法——更少的层、减少上层 token 处理以及更短的嵌入——整合到一个单一的可配置抽象中。该系统支持检索器和重排器,并且可以通过与 Hugging Face Transformers 兼容的接口应用于编码器和解码器模型。这种方法允许训练单个检查点,该检查点可以服务于多种模型大小,为生产环境提供了灵活性。
-
AI实验室在快速发展中推出新模型和基础设施
多家AI实验室发布了新模型和基础设施更新。Google推出了Gemini 3.7 Flash,强调在价格大幅降低的同时提高了编码和智能体能力。Meta发布了Muse Glimmer,一个专为本地智能体设计的开放权重多模态模型,Anthropic报告了Claude变体在改进数学边界方面的研究突破。此外,DeepSeek开源了其用于智能体工作流的Harness,NVIDIA发布了Nemotron 3.5 Lightning,一个针对智能体…
-
Google 发布 PaliGemma 视觉模型用于微调
Google 发布了 PaliGemma 模型系列,这是一系列开源的视觉语言模型,专为微调而非通用聊天机器人使用而设计。这些模型结合了 Google 的 SigLIP 视觉编码器和 Gemma 语言解码器,有多种尺寸可供选择,参数量高达 270 亿。PaliGemma 针对单轮任务进行了优化,旨在通过微调适应特定应用,如视觉问答或光学字符识别,并可通过 Hugging Face Transformers 库进行集成。
-
Inkling 多模态模型集成到 Hugging Face、vLLM;llama.cpp 添加音频输入
顶级国际象棋引擎 Stockfish 18 的最新版本与开源 AI 领域的重大进展同时发布。Hugging Face Transformers v5.14.0 和 vLLM v0.26.0 集成了新的 Inkling 多模态模型,这是一个来自 Thinking Machines 的 9750 亿参数模型,使开发人员能够轻松地将其用于各种任务。同时,llama.cpp 的 b10155 更新增加了对 MiMo-V2.5 音频输入和基于 …
-
AI供应商锁定隐藏成本明细:迁移、再培训和停机时间
从Amazon Bedrock、Google Vertex AI或Azure OpenAI等AI平台迁移会产生除初始API费用之外的巨额隐藏成本。这包括数据转换和代码重构所需的大量工程工作,据估计,一个4人团队在数月内可能花费数十万美元。模型再培训、数据重新格式化以及多次实验的计算成本也会产生额外费用,可能高达数万美元。此外,迁移过程可能导致暂时性停机、性能下降和收入损失,据估计每周损失的价值可能高达数十万美元。