bidirectional encoder representations from transformers
PulseAugur coverage of bidirectional encoder representations from transformers — every cluster mentioning bidirectional encoder representations from transformers across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的RAG管道解决了环境文件分类中的标签稀疏性问题
研究人员开发了一种新颖的检索增强生成(RAG)管道,用于对水电许可文件中的环境缓解义务进行分类。该方法解决了标签稀疏性的重大挑战,即许多类别缺乏足够的训练数据。该混合系统结合了基于BERT的检测器和RAG分类,在2017份许可文件的数据集上取得了0.524的微F1分数,优于仅使用BERT和仅使用RAG的方法。
-
新框架利用本地证据应对健康虚假信息
研究人员开发了一个检索增强Transformer框架来打击健康虚假信息,特别是在发展中国家。该系统利用世界卫生组织和尼日利亚疾病控制与预防中心(Nigeria Centre for Disease Control and Prevention)的证据来验证健康声明。虽然Bidirectional Encoder Representations from Transformers模型达到了71%的准确率,但由于证据存储库的限制,检索增强…
-
新方法融合图与文本进行专利实体对齐
本文介绍了一种新颖的科技专利知识图谱实体对齐方法。该方法利用图卷积网络结合BERT模型,融合了图的结构信息以及专利名称和描述等文本属性。这种多信息融合旨在提高实体对齐的准确性,在基准数据集上的表现优于现有方法(根据Hits@K评估指标)。
-
LLM标注数据提升电商搜索检索性能
研究人员开发了一种新颖的方法,用于为密集检索模型生成高质量的训练数据,特别适用于电子商务赞助搜索。该方法利用多个检索系统之间的分歧来创建结构化训练信号,包括易正例、难正例和难负例。该系统结合了多通道检索挖掘、用于分级相关性标注的校准三模型级联,以及使用超过2.4亿个示例的渐进式课程训练策略。当在Walmart的赞助搜索上部署时,训练的BERT模型表现出显著的改进,包括NDCG@10提升5.1%,减少了令人尴尬的检索,并在A/B测试中对…
-
新的RePAIR架构通过自监督学习国际象棋概念
研究人员开发了一种名为RePAIR的新型自监督学习架构,它结合了MAE、JEPA和BERT的元素。该架构旨在将序列数据(如国际象棋局面)编码为有意义的表示。在国际象棋中的实验表明,RePAIR可以在没有强化学习的情况下学习概念并推理棋子移动,从而实现对棋局轨迹的直观分析。
-
GNN和基于分数的模型通过改进CSI来增强无线波束成形
研究人员开发了一种新颖的方法,通过利用图神经网络(GNN)和基于分数的生成模型来实现无线通信中的鲁棒混合波束成形。该方法旨在提高信道状态信息(CSI)的准确性,CSI对于波束成形至关重要,但在实际系统中获取起来通常很困难。所提出的框架包括一个用于CSI更新的GNN模型和一个用于CSI生成和去噪的基于BERT的噪声条件分数网络,实验证明其性能和鲁棒性均优于现有方法。