PulseAugur
中
实时 18:16:52
实体 Bert

Bert

PulseAugur coverage of Bert — every cluster mentioning Bert across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
229
90 天内 230
发布 · 30天
0
90 天内 0
论文 · 30天
194
90 天内 194
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_287119 ·

    Mamba模型在法律AI基准测试中表现出竞争力

    一篇新论文对Mamba及其变体SSD-Mamba在法律文本分类和案例检索方面与BERT、DeBERTa和Longformer等成熟的Transformer模型的性能进行了基准测试。该研究涵盖了欧洲人权法院和美国最高法院等多个法律语料库,发现虽然Transformer在某些指标上仍占优势,但SSD-Mamba的表现相当,并且处理文本的速度明显更快。这些初步发现表明,Mamba类模型是处理超出传统编码器模型上下文限制的日益增长的法律文件量…

  2. TOOL · CL_286819 ·

    研究发现:微型中文BERT模型显示MLM优于MacBERT

    一篇新研究论文探讨了不同预训练策略对小型中文BERT模型的有效性。该研究使用870万参数模型,在中文维基百科数据上比较了掩码语言模型(MLM)、全词掩码(WWM)和MacBERT。结果表明,在此微型规模下,MLM的整体表现最佳,而WWM在困惑度和MLM命中率方面有所提高。该论文还指出了一个关键的评估陷阱,即MacBERT的低训练损失与其高困惑度不相关,这表明仅凭训练损失作为混合替换策略的指标并不可靠。

  3. TOOL · CL_286817 ·

    QuanLing框架量化西部罗曼语的语言距离

    研究人员已将QuanLing框架(使用预训练语言模型量化语言距离)扩展到西部罗曼语。该框架结合了句子嵌入距离、分词碎片率和掩码语言模型概率。研究发现,在法语、葡萄牙语、西班牙语和意大利语中,葡萄牙语和西班牙语最为接近,而法语和意大利语最为疏远。结果表明,QuanLing可泛化到不同的语系。

  4. TOOL · CL_286105 ·

    Transformer 架构内部演进,推动大语言模型发展

    Transformer 架构自 2017 年推出以来,其核心结构并未发生根本性改变,但内部进行了大量修改。这些由 Google Brain 和 Google DeepMind 等机构的研究推动的演进,影响了模型内的各种组件。这种演进对于 GPT-3、Bert 和 T5 Text To Text Transfer Transformer 等大语言模型的发展至关重要,并影响了它们的能力和性能。

  5. TOOL · CL_284569 ·

    TabiBERT:发布新的土耳其语基础模型和基准

    研究人员推出了 TabiBERT,一个基于 ModernBERT 架构的新型大规模土耳其语基础模型。该模型在超过一万亿个 token 的海量数据集上进行了训练,涵盖了网络文本、科学出版物和源代码,并支持 8,192 个 token 的上下文长度。为了评估 TabiBERT,开发了一个名为 TabiBench 的新基准,该基准包含八个任务类别中的 27 个数据集。与之前的土耳其语模型相比,TabiBERT 在问答和代码检索任务上表现出了卓越的性能。

  6. TOOL · CL_284524 ·

    离线语音翻译系统可在边缘设备上自我校正

    研究人员开发了一个离线语音到语音的翻译系统,该系统可以在Jetson Nano边缘设备上运行,并在无需重新训练的情况下自行校正翻译。该系统利用了Whisper-tiny ASR模型和OPUS-MT翻译器,并使用多语言BERT模型作为质量评估门控来触发二次校正。在英-西班牙语翻译上的实验表明,最小贝叶斯风险解码显著提高了翻译质量,而质量评估模型作为门控比作为排序器更有效,从而节省了内存。

  7. TOOL · CL_284341 ·

    新的OncoNoteBERT模型增强了肿瘤学笔记处理能力

    研究人员开发了OncoNoteBERT,这是一种专门的BERT风格语言模型,用于处理门诊肿瘤学笔记。该模型使用自定义WordPiece分词器从头开始训练,并与RadBERT和PathologyBERT等现有模型进行了评估。OncoNoteBERT在掩码标记探测方面表现出卓越的分词效率和良好的性能,表明其在捕捉肿瘤学特有的临床术语和治疗相关信息方面的有效性。

  8. TOOL · CL_282452 ·

    BERT架构与数学基础探索

    本文深入探讨了BERT,一个于2018年推出的语言模型。文章详细介绍了BERT的架构、工作流程、代码和数学基础,并将其与现代自回归LLM进行了对比。解释涵盖了BERT的双向注意力机制等关键区别,该机制允许token在两个方向上关注上下文,这与基于解码器的LLM中使用的因果掩码不同。文章还概述了BERT Base和BERT Large模型的规格,包括它们的层数、注意力头和参数数量。

  9. COMMENTARY · CL_281338 ·

    新AI模型使用复杂行话,可能掩盖局限性

    用户观察到OpenAI和Anthropic的最新模型正在使用更复杂、有时甚至晦涩的术语。这种趋势在OpenAI的'sol 5.6'以及Anthropic的'Fable 5.1'和'opus 5.5'等模型中尤为明显,它可能使解释和实现听起来比实际更复杂,从而掩盖了模型的局限性或错误。有用户推测这可能与水印功能有关,该功能会微妙地改变词语选择以适应特定模式。

  10. TOOL · CL_282902 ·

    新的证据图系统增强了可审计的临床时间线重建

    研究人员开发了一个使用具有溯源意识的证据图进行可审计临床时间线重建的系统。该系统跟踪提及、记录事实修订,并在证据不足时避免回答。在合成语料库上的实验表明,具有溯源意识的算子在保留可回答性的同时显著减小了数据大小,并且专用门有效地处理了证据不可用的查询。研究还强调了标准BERT和LLM在处理时间数据和在缺乏证据时避免回答方面的局限性。

  11. TOOL · CL_280582 ·

    大语言模型与特征模型在复合情感识别方面的比较

    研究人员探索了两种用于复合多模态情感识别的方法:基于特征的模型和像BERT和LLaMA这样的大语言模型(LLMs)。该研究使用了C-EXPR-DB数据集进行复合情感分析,并使用MELD数据集进行基本情感分析。结果表明,虽然基于特征的模型在C-EXPR-DB数据集上表现更好,但当视频数据包含丰富的文本记录时,LLMs可以利用文本化的非语言线索达到更高的准确性。

  12. TOOL · CL_280287 ·

    新的MITE方法使用编程语言改进BioNER

    研究人员开发了MITE,一种通过利用多种编程语言进行指令调优来改进生物医学命名实体识别(BioNER)的新颖方法。该方法将BioNER任务重新表述为Python、C++和Java等语言的代码格式表示,提供了多样化的结构化监督,而无需外部知识。在推理过程中,MITE聚合来自不同代码格式的预测,以增强鲁棒性和准确性。在六个BioNER数据集上的实验表明,MITE的性能持续优于现有的基于BERT和基于LLM的方法,并展现出强大的跨数据集泛化能力。

  13. COMMENTARY · CL_279728 ·

    AI“Jev”接口迅速复制,决策模型商品化

    一个新的人工智能接口,被称为“Jev”,迅速成为一种类型,在其宣布后几周内出现了多个开源实现。这种快速复制,如“Jev in 25 Lines of Python”和“Ollaya”等项目所展示的,表明低延迟类型化判断的核心接口已经通用化和商品化。虽然这给主要产品是这种特定无状态转换的企业带来了挑战,但它也使得这种决策能力能够更广泛地集成到各种应用程序中,将判断变成一种广泛可用的商品。

  14. COMMENTARY · CL_278285 ·

    AI领导者通过用专业LLM替换前沿模型来削减成本

    来自Intercom和Superhuman Mail的AI领导者讨论了通过使用更小、更专业的模型来处理高容量代理任务,以优化LLM成本的策略。Intercom的Fergal Reid详细介绍了如何使用一个140亿参数的Qwen模型取代GPT-4.1进行查询摘要,每月节省数十万美元。Superhuman Mail的Loïc Houssier解释了类似的方法,从一个强大的分类模型转向一个微调的BERT分类器进行邮件自动标记。两人都强调,在…

  15. TOOL · CL_277184 ·

    新的FourierQK注意力机制增强了Transformer模型

    研究人员开发了FourierQK,一种用于生成式预训练Transformer的新型注意力机制,它利用带通滤波的内积。在TinyShakespeare上的字符级语言建模实验表明,直流和奈奎斯特分量是有害的,而围绕段落长度(70个token)的优化单尺度带宽会带来显著的收益。研究还发现,像墨西哥帽这样的可容许滤波器优于不可容许的滤波器,并且频谱覆盖直接影响泄漏,这表明FourierQK在BERT等双向注意力设置中是有效的。

  16. TOOL · CL_275541 ·

    掩码自编码器从掩码重采样中获得理论优势

    arXiv上的一篇新论文探讨了掩码自编码器(MAEs)中掩码重采样的理论优势。研究人员发现,掩码预测可以学习到未掩码重建所遗漏的有用表示,尤其是在具有共享潜在结构和噪声的情况下。该研究量化了每个样本使用多个掩码如何降低样本复杂性并提高下游性能,表明随机裁剪和翻转等标准实践可能会掩盖这一优势。

  17. TOOL · CL_268961 ·

    新的自编码器细化方法为Transformer注意力提供高效替代方案

    研究人员开发了一种新颖的掩码语言建模方法,该方法用基于自编码器的混合模块替代了Transformer中的传统注意力机制。这种新架构包含局部邻域、完整序列和注意力头模块,通过瓶颈压缩和重建输入。掩码位置的迭代细化过程包括向邻居拉动的步骤和通过自编码器投影进行的纠正步骤。该方法在参数匹配的BERT基线上取得了可比的性能,但FLOPs显著减少,展示了效率的提升。

  18. RESEARCH · CL_268743 ·

    研究表明AI模型难以检测多模态假新闻 · 追踪6个来源

    新研究探讨了多模态大语言模型(MLLMs)在生成和检测假新闻方面的能力和局限性。研究表明,虽然MLLMs可用于创建跨各种领域的逼真虚假社交媒体帖子,但当前的检测模型在识别图像真实性方面,其准确性常常达不到人类水平。研究人员正在开发新的框架和数据集,通过考虑生成方面和证据关系来改进检测,同时也强调了在人工智能驱动的虚假信息检测工具中,人类判断和透明设计的重要性。

  19. TOOL · CL_268742 ·

    DanLing NestedTensor 通过 PyTorch 抽象提高了深度学习效率

    研究人员推出了 DanLing NestedTensor,这是一种用于 PyTorch 的新型张量抽象,旨在更有效地处理深度学习中可变大小的输入。这种抽象使多不规则结构成为张量本身的固有属性,减少了填充造成的计算浪费并提高了性能。基准测试显示,与传统的填充方法相比,对于包括 BERT 和 FCN 主干在内的各种深度学习模型,速度显著加快,并且在高变化批次中内存分配明显减少。

  20. TOOL · CL_268735 ·

    研究发现BERT中用于AI文本检测的关键神经元

    研究人员对冻结的BERT模型中的AI文本检测神经元进行了机制研究,利用RAID基准和六种不同的文本生成器。该研究采用稀疏探测协议,识别出不到1%的负责AI文本检测的稳定神经元集合,这些神经元保留了大部分检测准确性。激活修复证实了这些已识别神经元的因果相关性,表明它们比随机集合更频繁地翻转预测。进一步分析显示,指令微调的生成器将这些检测神经元集中在BERT的最后一层,暗示了训练后对齐的足迹,并且所选神经元在未见过的生成器家族上保持高准确性。