Bert
PulseAugur coverage of Bert — every cluster mentioning Bert across labs, papers, and developer communities, ranked by signal.
- used by ScienceCast 90%
- used by Gotit.pub 90%
- used by ModernBERT 90%
- instance of ModernBERT 90%
- instance of BERT based Web Mining of Concerns and Reviews for TV Drama Audience 90%
- instance of DagsHub 90%
- used by alphaXiv 70%
- used by CatalyzeX 70%
- used by DagsHub 70%
- instance of Roberta 70%
- used by Roberta 70%
- instance of T5 Text To Text Transfer Transformer 70%
20 天有情绪数据
-
Transformer注意力机制中位置编码技术的映射
本文探讨了Transformer架构中的位置编码技术,重点关注位置信息如何以及在何处被整合到注意力机制中。文章超越了按时间顺序的呈现方式,而是根据方法在注意力公式中的注入点进行分类。作者提出了一个2x2的网格(绝对与相对,固定与学习)来映射这些技术,并将其与原始Transformer在注意力层之前将位置向量添加到token嵌入中的方法进行了对比。
-
使用RoBERTa、LoRA和隐私控制构建的银行意图路由器
使用BANKING77数据集开发了一个银行意图路由器,集成了RoBERTa、LoRA和校准技术。该项目侧重于隐私控制和不确定性测试,最终发现一个非Transformer架构的模型达到了最高的准确率。
-
BERT:基础性双向 Transformer 模型
BERT 于 2018 年推出,被认为是为当前人工智能进步铺平道路的基础性 Transformer 模型。其深度双向架构在 Google 发布时是一项重大创新。尽管到 2026 年 BERT 已被视为较旧的模型,但它仍然是理解 Transformer 技术演变的有价值的学习工具。
-
BERT日志分析框架支持Android上的连续行为认证
研究人员开发了一个基于BERT的框架,通过分析Android系统日志进行连续行为认证。该系统分析logcat流以识别事件模式和动态变量,然后微调专家模型以检测网络/设备身份、电池计时和Wi-Fi拓扑中的偏差。该框架生成一个正常性分数,该分数被输入到策略决策点以进行风险感知访问控制,展示了一种具有低误报率的用户设备上下文保证的实用方法。
-
新方法提高领域迁移下金融NER的可靠性
研究人员开发了在面对领域迁移时提高金融命名实体识别(NER)系统可靠性的方法。他们使用各种置信度估计技术评估了BERT和Qwen2.5模型,发现在输入分布发生变化时,自一致性和实体跨度概率比整个输出概率更能有效地检测错误。研究提出了一种分阶段部署策略,首先检测严重的分布偏移,然后应用预测级置信度门控,以确保安全自动化。
-
研究比较BERT、RoBERTa和BART在文本摘要方面的表现
一项比较研究回顾了现代文本摘要技术,重点关注Transformer模型,如BERT、RoBERTa和BART。该论文探讨了这些模型在抽取式和生成式摘要任务中的架构、预训练策略和有效性。文章强调了自然语言处理和大型语言模型在自动文本摘要方面取得的快速进展。
-
新的FedLNS框架对抗联邦LLM中的对抗性攻击
研究人员开发了FedLNS,一个新设计的服务器端框架,用于保护联邦学习模型免受对抗性操纵。该方法利用客户端更新中归一化层参数变化的签名来识别和筛选恶意贡献。FedLNS不需要客户端进行额外的数据交换,并且可以与标准的联邦学习聚合技术集成。实验表明,即使高达40%的客户端参与目标操纵,该方法也能有效降低GPT风格、BERT风格和LLaMA风格模型的测试困惑度。
-
新方法从嘈杂的临床报告中提取结构化数据
研究人员开发了一种从半结构化 OCR 临床报告中提取结构化信息的新颖方法,解决了数据孤岛和嘈杂文本带来的挑战。该方法将问题表述为关键条件提取式问答,使用迭代式关键挖掘和规范化来构建规范键清单。实验表明,随着关键覆盖率的提高,性能也会提高,基于 BERT 的模型在覆盖前 90 个规范键时取得了很高的 F1 分数,优于 Qwen3 基线。
-
PEFT 将罗马乌尔都语中大型语言模型的仇恨言论检测 F1 分数提升至 93% 以上
一篇新研究论文探讨了参数高效微调 (PEFT) 方法,特别是低秩自适应 (LoRA),在罗马乌尔都语仇恨言论检测中的有效性。研究发现,虽然在 Mistral、LLaMA、Falcon 和 BERT 等模型上进行零样本推理取得了中等结果(F1 分数 0.56),但使用 PEFT 进行微调可将性能显著提高到 0.93 以上的 F1 分数。这种方法展示了强大的计算效率,使其成为处理低资源语言的可行解决方案。
-
新数据集 Strategic 16K 为文档敏感性基准测试 AI 模型
研究人员开发了 Strategic 16K,这是一个包含 16,000 份来自 WikiLeaks 的外交电报的新数据集,旨在防止文档敏感性分类中的标签泄露。该语料库被用于对经典模型和基于 Transformer 的模型进行基准测试,结果显示 BERT 在清理后的数据上取得了最高的准确率 (89.14%) 和 F1 分数 (89.33%)。虽然像 BERT 和 ELECTRA 这样的 Transformer 模型表现最佳,但 TF-I…
-
研究探讨语言模型的优化分词
一篇新的研究论文探讨了联合优化分词与语言模型的影响,将SSLMs和H-Nets等无分词器方法与固定分词器进行了比较。研究表明,联合优化从根本上改变了词元结构,其中SSLMs生成形态对齐且上下文高效的词元,而H-Nets则优先考虑字节级效率。这些无分词器方法持续降低语言模型的困惑度,并在下游任务中取得有竞争力的性能,表明它们针对上下文和计算效率进行了优化。
-
Transformer注意力分析方法分离了sink token的影响
一篇新的研究论文提出了一种方法来更好地分析Transformer模型中的注意力矩阵。该论文强调,标准的比较工具可能会产生矛盾的结果,这取决于是否包含或排除“sink”token。通过将注意力行视为组合数据,并将sink项与内容项分开,研究人员可以获得更准确的见解。这种方法表明,训练过程中观察到的许多熵崩溃是由于sink token的增长,而不是注意力的锐化。
-
新型对话代理利用LLMs和KG-BERT进行学生心理和学习分析
研究人员开发了一种具有心理意识的对话代理,该代理集成了大型语言模型(LLMs)、知识图增强BERT(KG-BERT)和双向LSTM网络。该系统旨在通过分析文本语义、语音特征和行为趋势来同时提高教育环境中的学习表现和情绪健康。一项涉及45名大学生的试点研究表明,与单一模式方法相比,学生的学习动机有所提高,压力有所减轻,学业成绩也有适度提升。研究还包括一项消融分析,以评估知识图组件和各个模式的贡献。
-
Hugging Face 模型选择框架发布,平台模型数量达 200 万
本文提供了一个从 Hugging Face 选择和微调模型的框架,该平台现已托管超过 200 万个模型。它指导用户完成决策过程,提供超越标准文档的见解。该框架旨在帮助用户驾驭海量可用模型,包括 Bert、GPT-2、Roberta、XLM-RoBERTa 和 T5 等流行架构。
-
调查详述了GPT-4o等NLP模型的实际可解释性
一篇新发表在arXiv上的调查论文,考察了可解释自然语言处理(XNLP)在医疗、金融和客户服务等不同领域的实际应用。该论文强调了像GPT-4o、Gemini和BERT这样的NLP模型日益增长的决策制定作用,以及对其透明度的关键需求。论文分析了七个不同应用领域中所需的解释类型、所使用的方法和评估策略,并指出了当前研究在实际应用性和人类判断方面的不足。
-
BGE 嵌入模型需要特定的本地设置以获得最佳性能
由北京人工智能研究院开发的 BGE 嵌入模型系列提供了多个版本,具有不同的维度和序列长度。为获得最佳性能,嵌入应进行归一化,从而可以通过点积计算余弦相似度。用户必须注意 512 个 token 的最大序列长度限制,这需要对较长的文档进行分块处理,并且 BGE 模型不同语言版本不能在单个索引中混合使用。此外,池化策略,特别是使用 [CLS] token 的最后一个隐藏状态,对于准确的向量表示至关重要。
-
架构检索:大语言模型的新范式
架构检索方法将文档查找直接嵌入模型架构中,这与将检索文本粘贴到提示中的标准RAG不同。该方法旨在通过一个专门的机制来处理检索到的内容,而不改变主序列长度,从而降低注意力成本并提高效率。kNN-LM和DeepMind的RETRO等示例通过内插输出分布或使用分块交叉注意力来整合外部知识,而不会不成比例地增加计算复杂度。
-
新 AI 框架 STCAD 分析海事轨迹中的异常
研究人员开发了 STCAD,一个用于分析大规模海事船舶轨迹数据集的可扩展框架。该系统利用定制的 BERT 模型对可变长度轨迹进行编码,并使用 CURE 层次聚类算法在无需预设聚类数量的情况下对它们进行分组。STCAD 还包含一种无监督异常检测方法,通过分析重建损失和聚类噪声来识别异常的导航模式。该框架成功应用于包含数十亿条消息的国家级自动识别系统 (AIS) 数据集,有效区分了正常和异常的船舶行为。
-
BERT基础QA模型可靠性评估;RoBERTa表现最稳定
一项新近发表在arXiv上的研究评估了包括RoBERTa、ALBERT和DistilBERT在内的多个基于BERT的模型在问答任务上的可靠性。研究人员通过在SQuAD和QuAC数据集上引入蒙特卡洛Dropout和输入释义的变化来评估模型稳定性。研究结果表明,RoBERTa是测试模型中最可靠的,而ALBERT和DistilBERT则表现出明显的不一致性。研究还证实,蒙特卡洛Dropout是一种有效的衡量可靠性的指标,且不会干扰推理。
-
新的机器学习模型应对社交媒体上的政治情感分析
研究人员开发了两种机器学习方法,一种使用XGBoost,另一种基于BERT,以应对在社交媒体上识别政治观点的多类别情感分析的挑战。两种模型均在标记的政治社交媒体帖子数据集上进行了训练和评估。XGBoost模型达到了0.2835的F1分数,而基于BERT的模型达到了0.2806的F1分数,这凸显了对复杂政治言论进行分类的难度。