ModernBERT
PulseAugur coverage of ModernBERT — every cluster mentioning ModernBERT across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
LLM蒸馏:生成式模型在复杂数据上优于判别式模型
一篇新的研究论文探讨了将大型语言模型(LLM)的知识蒸馏到小型学生模型中以进行多标签主题分配的有效性。该研究在各种参数规模下比较了生成式和判别式学生模型架构,发现判别式模型在结构化产品评论方面表现出色,而生成式模型在复杂的对话数据上表现更好。研究还强调了生成式模型在处理大型标签集和长尾分布时具有更优越的鲁棒性,这显著影响了判别式基线。
-
TabiBERT:发布新的土耳其语基础模型和基准
研究人员推出了 TabiBERT,一个基于 ModernBERT 架构的新型大规模土耳其语基础模型。该模型在超过一万亿个 token 的海量数据集上进行了训练,涵盖了网络文本、科学出版物和源代码,并支持 8,192 个 token 的上下文长度。为了评估 TabiBERT,开发了一个名为 TabiBench 的新基准,该基准包含八个任务类别中的 27 个数据集。与之前的土耳其语模型相比,TabiBERT 在问答和代码检索任务上表现出了卓越的性能。
-
微调的 ModernBERT 模型用于 LLM 安全防护检测
一个具有 2048 个 token 上下文窗口的微调 ModernBERT 模型正在生产环境中使用,用于识别 OCR 后医疗文档中的提示注入尝试。这种方法正作为一种零样本探测器,用于评估大型语言模型 (LLM) 的安全防护措施。该微调的小型语言模型 (SLM) 的有效性正与另一个称为 Jevíčko 的系统进行比较。
-
新的蒸馏方法提高了LLM任务路由效率
研究人员开发了一种学生指导教师蒸馏流程,以提高将用户请求路由到专门的大型语言模型(LLM)任务的效率。该方法使用紧凑的ModernBERT分类器作为学生模型,预测类别分布并检索一小组顶级候选。然后,一个更大的DeBERTa-v3分类器仅对这些候选进行重新排序,而不是对所有可能的标签进行排序。教师标签的迭代生成会改进学生模型,增强其为未来请求生成更精确候选的能力。这种方法旨在降低零样本分类器相关的计算成本,这些分类器的成本通常与任务类别…
-
新的开源 System One 模型 Laya、Lev 和 CLM 提供了不同的架构
名为 Laya、Lev 和 CLM 的专有 Jev 模型的新开源替代品已经出现,每种模型都提供了 System One 模型独特架构方法。这些模型基于 Qwen 和 ModernBERT 等基础语言模型构建,在一个通道中处理给定的状态和一组选项,以确定每个选项的概率。关键区别在于它们如何从网络读取决策:Laya 连接状态和选项,Lev 将其视为多项选择题,而 CLM 在比较之前单独对其进行编码。
-
紧凑型 HTML-LM 模型在捷克网络文档方面达到最先进水平
研究人员开发了 HTML-LM,一个拥有 1.54 亿参数的紧凑型基础模型,旨在高效处理捷克 HTML 文档。该模型基于 ModernBERT 架构构建,利用了 HTML 感知训练和多种目标,包括掩码语言建模以及从更大模型进行对比蒸馏。HTML-LM 已投入生产,每秒可处理数千份网页文档,并在捷克互联网领域的分类和回归任务上取得了最先进的性能,优于更大的编码器和更小的 LLM。
-
H公司发布单塔多模态编码器系列NeoMME
H公司推出了NeoMME,这是一个专为提高效率而设计的新型多模态编码器系列。这些模型提供2.6亿和8亿参数两种尺寸,无需独立的视觉塔和因果解码器,通过单一Transformer架构处理文本和图像数据。这种简化的方法旨在降低计算开销,同时保持强大的性能,其中2.6亿参数的NeoMME-Retriever在文档检索基准测试中取得了有竞争力的结果。
-
Hugging Face发布高效多模态编码器NeoMME,研究表明编码器在印度语言NER任务上表现更优
Hugging Face推出了NeoMME,一个旨在提高效率的新型多语言多模态编码器系列。与许多生成式模型不同,NeoMME使用单个双向Transformer处理文本和图像块,并采用掩码离散扩散目标从头开始训练。在针对视觉文档检索进行微调后,NeoMME-Retriever表现出强大的性能,并显著降低了存储需求。此外,一项关于Naamapadam的研究发现,在大多数印度语言的命名实体识别任务中,基于编码器的模型性能远超生成式架构。
-
新研究探索Transformer层中语法的几何结构
一篇新研究论文探讨了Transformer模型中语言表示的几何特性。该研究调查了这些表示的内在维度(ID)如何在不同层之间变化,以及这与词元的语法角色之间的关系。研究人员发现,不同类型的词(开放类词与封闭类词)表现出不同的ID扩展和收缩模式,并且仅凭几何特征就可以预测词元的语法角色。
-
新的GEO-Flag工具可检测搜索结果中的AI优化网络内容
研究人员开发了一种名为GEO-Flag的新方法,用于检测和衡量“生成引擎优化”(GEO),这是一种修改网络内容以在生成式搜索引擎中获得更高排名的技术。这种优化可能导致战略性放置的、潜在的误导性信息获得不当的突出地位。该研究引入了GEOFlagBench(一个基准数据集),并提出了干预配对训练(IPT)以提高检测准确性。还开发了一个GEO-gated Agent系统来审计在Google Search和Gemini-grounded结果中…
-
新的GEO-Flag系统可检测搜索结果中的AI优化网络内容 · 已追踪2个来源
研究人员开发了GEO-Flag系统,用于检测和衡量“生成引擎优化”(GEO)技术。该技术通过修改网络内容以提高其在生成式搜索引擎中的可见性。这种优化可能导致策略性操纵的内容获得不当的突出地位,从而掩盖薄弱或错误的信息。该研究引入了GEOFlagBench基准数据集,并提出了干预配对训练(IPT)以提高检测准确性,将其应用于ModernBERT模型后,F1分数和最差组准确性显著提高。部署的管道用于审计Google搜索和基于Gemini的…
-
AI训练效率:梯度优化方法基准测试
一篇新的研究论文在受限硬件上对五种梯度优化器和三种内存策略进行了AI训练基准测试。研究发现,梯度累积是在不同架构上降低训练损失最有效的策略,而梯度检查点的性能高度依赖于架构。与普遍假设相反,Adam并非普遍优越,在某些情况下Adadelta和SGD的表现优于它。该研究为选择优化器和梯度策略以提高AI模型训练和部署的资源效率提供了实用指导。
-
小型语言模型通过对话式AI简化日常症状追踪
研究人员开发了一种名为“Scale-to-Dialogue”的新方法,该方法利用小型语言模型高效收集每日经前症状评分。该方法将对话式管理视为一个序数标签恢复问题,系统在此过程中引导症状集群并将响应映射到严重程度标签。使用mcPHASES数据集,采用了ModernBERT证据门和Qwen2.5-1.5B-Instruct模型,在显著减少提问数量的同时,实现了与原始严重程度量表的高度一致性。
-
新研究对内存高效的AI训练梯度优化器进行基准测试
一项新研究针对四种Transformer架构,对五种梯度优化器(SGD、Adam、Adagrad、Adadelta和共轭梯度下降)与三种节省内存的策略(标准训练、梯度检查点和梯度累积)进行了基准测试。研究发现,梯度累积是在不增加GPU内存使用量的情况下降低训练损失最有效的策略。研究还显示,Adam并非总是最优的优化器,在某些架构中,Adadelta和SGD的表现优于它,而梯度检查点的有效性高度依赖于具体的模型架构。
-
新模型CheMatE统一化学结构和自然语言
研究人员开发了CheMatE,这是一种新的嵌入模型,旨在统一空间中联合表示化学结构(SMILES)和自然语言。CheMatE基于ModernBERT骨干构建,采用两阶段训练过程:在大量科学文档语料库上继续进行掩码语言建模,随后与算法生成的SMILES-文本对进行对比学习。这种方法旨在防止对化学语法过度拟合,并保留基础语义能力,在分子性质预测和科学语言理解任务中展现出稳健且可迁移的表示。
-
LLM 渴望促进在线讨论,人类则更为谨慎
一篇新发表在arXiv上的研究探讨了人类和大型语言模型(LLM)在促进在线讨论中的倾向。研究人员创建了PEFK语料库来标准化促进数据集,并使用专家参与者和LLM作为裁判模型进行了调查。研究结果表明,LLM过于渴望促进,而人类则更为谨慎,尽管两者在确定无需促进时都更确定。纠正LLM行为和训练ModernBERT分类器的尝试表明,分类器的性能更可靠,但当前的数据集限制了它们的性能上限。
-
AI系统AWARE-FX量化企业报告中的外汇对冲披露
研究人员开发了AWARE-FX,一个旨在分析公司年度报告并量化外汇对冲披露的AI系统。该系统集成了专门的词汇表、否定和会计状态逻辑、财务编码器以及审计账本,以提取和评分与对冲相关的信息。使用FinBERT和ModernBERT模型对香港公司数据进行的评估显示出强大的时间性能,选择性预测通过对不确定观测值进行弃权来提高准确性。虽然像Qwen3-8B这样的通用模型在某些领域显示出潜力,但它并未均匀取代领域特定的约束,这凸显了在财务分析中对…
-
浏览器扩展使用单一模型进行点击诱饵、倾向性和情感分析
作者描述了一个名为“UnBlur”的浏览器扩展,用于分析新闻文章的点击诱饵、政治倾向和情感。该扩展没有使用三个独立的模型,而是采用了一个单一的共享骨干模型ModernBERT,并为每个任务配备了三个轻量级头部。这种方法通过允许任务受益于共享学习来节省内存并提高准确性。
-
LiquidAI 发布 LFM2.5 多语言双向编码器
LiquidAI 发布了两款基于 LFM2 架构的新型多语言双向编码器 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。这些模型专为设备端效率和跨 15 种语言的各种下游任务微调而设计。较小的 230M 模型针对低延迟和内存进行了优化,而较大的 350M 模型则追求最高质量,两者都提供 8k 上下文窗口和具有竞争力的性能。
-
旧版 BERT 模型在稀疏检索任务中表现优于其较新版本
近期研究表明,在稀疏检索任务中,旧版 BERT 模型(特别是 BERT-base)的表现优于 ModernBERT 等较新编码器。这种现象归因于“词汇表差距”,即 ModernBERT 更大、区分大小写的词元集导致词汇匹配效果不如 BERT-base 更小、不区分大小写的词汇表。然而,后续研究提出了解决此词汇表差距的方案,使 ModernBERT 能够在稀疏检索任务中取得最先进的成果。