Data Language Models
PulseAugur coverage of Data Language Models — every cluster mentioning Data Language Models across labs, papers, and developer communities, ranked by signal.
-
研究发现:语料库选择显著影响语言依存估计
一项发表在arXiv上的新研究调查了语料库选择如何影响自然语言处理中的依存距离估计。研究人员比较了来自Universal Dependencies v2.18的38个语言树库的估计结果,发现语料库的替换显著改变了结果,近40%的成对语言排序被颠倒。研究表明,依存距离更多地是一个受语法、语域和标注影响的语料库条件因素,而不是一个稳定的语言层面参数,尽管依存长度最小化的普遍原则得到了持续观察。
-
GRAFT 框架通过新的评分和预算分配提升 DLM 预测解码
研究人员推出 GRAFT,一个旨在增强扩散语言模型(DLM)中预测解码的新框架。GRAFT 采用目标蒸馏边评分(TDES)从目标模型轨迹中学习父子兼容性偏好,确保草稿树中更准确的边选择。此外,它利用状态感知预算分配(SABA)根据解码状态动态调整树预算,平衡草稿增益与验证成本。该方法已证明能显著提速,比自回归方法快 2.13 倍至 6.36 倍,且开销极小。
-
量子电路在理论上显示出优于经典大语言模型的优势
研究人员已经证明了量子电路与经典大语言模型(LLMs)之间的理论分离。该研究证明,某些量子计算,特别是涉及低深度量子电路(如QNC^0)的计算,可以执行当前大语言模型架构(如Transformer和扩散语言模型)在计算上不可行的任务。这些分离在分布和功能背景下都得到了证明,表明了未来量子计算在AI方面可能超越经典AI的潜在领域。
-
数据语言模型提供原生表格数据理解,性能超越现有方法
研究人员推出数据语言模型(DLM),这是一类新的基础模型,旨在原生理解表格数据,无需预处理。首个DLM Schema-1,一个拥有1.4亿参数、在超过230万个数据集上训练的模型,在行级预测基准测试中表现优于现有方法。Schema-1在缺失值重建方面也表现出色,并且仅凭原始单元格值就能识别行业领域,表明其对表格数据的结构理解比通用语言模型更深入。