natural language generation
PulseAugur coverage of natural language generation — every cluster mentioning natural language generation across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新框架增强LLM的个性化联邦学习
两篇新的研究论文介绍了用于大型语言模型(LLM)个性化联邦学习的先进技术。第一篇FedRoRA通过将适应性分解为共享的全局方向和个性化的逐秩幅度来解决秩异质性问题,在NLU和NLG基准测试中表现优于现有方法。第二篇FlexP-SFT提供了一个无聚合的个性化拆分联邦微调框架,消除了客户端聚合,以减少通信瓶颈和掉队者问题,同时增强了个性化和泛化能力。
-
新的 MCMC 采样器使用偏好投票进行条件采样
研究人员开发了 Pref-MH,一种新颖的马尔可夫链蒙特卡洛 (MCMC) 采样器,它能够从由语义属性定义的分布中进行精确的条件采样,即使在无法进行精确密度评估的情况下也是如此。该方法利用成对比较,类似于 Bradley-Terry 模型,来推断偏好赔率并计算 Metropolis-Hastings 比率。Pref-MH 被证明在其类别中是最优的,并已成功应用于文本生成、分子设计以及使用大型语言模型和视觉-语言模型作为裁判的图像生成等任务。
-
研究发现任务分解对基于大语言模型的自然语言生成评估无效
一项新的研究论文对使用“大语言模型即评委”框架的任务分解在改进自然语言生成(NLG)评估方面的有效性提出了质疑。研究发现,与不进行分解的基线相比,分解并未带来性能提升。相反,先前观察到的改进被归因于使用人类标签进行训练,而非分解方法本身。研究还表明,“大语言模型即评委”在用人类标签训练后,其性能可与人类标注员相媲美。
-
扩散模型展示出固有的注意力机制和改进的采样技术 · 跟踪了7个来源
近期研究探索了扩散模型(一种主流的图像生成架构)的进展。一篇论文揭示了这些模型固有地利用了类似于Transformer的注意力机制,这表明注意力是一种通用的机器学习原理。另一项研究引入了控制变量分数匹配(CVSI)来提高扩散模型的采样效率并降低方差。此外,一种名为优势加权匹配(AWM)的新方法将强化学习目标与扩散模型的预训练相结合,从而显著加快了生成质量。
-
新数据集和模型提升德语文本生成质量评估
研究人员开发了TextQ-German,这是一个用于评估自然语言生成系统(包括大型语言模型)所生成德语文本质量的新数据集和模型套件。该数据集是通过众包方式从德语使用者那里收集的,旨在捕捉体验质量(QoE)视角,而这通常是传统自动指标所忽略的。结合了基于Transformer和语言特征的混合模型,在预测人类质量评分方面表现优于仅基于Transformer的基线模型,为NLG评估提供了一种更细致的方法。
-
新论文质疑了NLG模型的标准人类评估方法
一篇新发表在arXiv上的论文批评了自然语言生成(NLG)系统的标准人类评估协议。作者认为,常见的做法,特别是使用李克特量表,可能导致对人类偏好的评估不准确,甚至会颠倒真实的偏好方向。他们提出了一种名为系统级概率评估(SPA)的替代方法,用于评估故事生成等开放式任务,并证明了其在正确排序GPT-3模型大小方面的有效性。
-
万亿美元AI竞赛的关键在于可信赖的语言生成,而非仅仅是智能
万亿美元AI估值的竞赛正在升温,OpenAI、Anthropic和Google等主要公司正大力投资于日益强大和自主的AI系统。然而,在这个AI时代的最终成功,将不仅仅取决于原始智能,还取决于这些系统生成的语言的可信赖性。数十年来自然语言生成(NLG)的经验教训对于构建可靠的企业级AI至关重要,确保准确性、治理和可解释性,这些对于决策级语言至关重要。
-
新的TRACE-TS框架将LLM推理与传感器数据相结合,用于活动理解
研究人员开发了TRACE-TS,一个旨在提高语言模型在分析传感器数据以理解人类活动时的推理能力的新框架。该系统通过使用归因来识别相关数据点并构建可追溯的推理路径,将解释 grounding 在底层的传感器信号上。TRACE-TS在多个基准测试中取得了最先进的准确率和F1分数,在生成可验证的解释方面显著优于现有的基于语言模型的方法。
-
指令调优通过任务特定微调提升LLM性能
指令调优是通过在特定任务和指令上微调大型语言模型(LLMs)来增强其能力的关键方法。此过程提高了模型理解和准确响应用户输入的能力,使其更加通用。该技术涉及使用梯度下降等优化算法最小化损失函数来调整模型参数。指令调优在客户服务聊天机器人、语言翻译和文本摘要等领域有实际应用。
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成 · 跟踪 6 个来源
研究人员开发了 SenseNova-Vision,一个统一的多模态模型,它将所有计算机视觉任务视为生成问题。这种方法使用自然语言指令和视觉提示来指定任务,允许模型生成文本、图像或两者的组合。该模型在新创建的 SenseNova-Vision Corpus 上进行了训练,在检测、分割和姿态估计等广泛的视觉任务上的性能与专用系统相当。这项工作表明,统一的多模态生成是一种可扩展的方法,可以将各种计算机视觉能力集成到通用基础模型中,并且该模型…
-
新的ReportQA框架使用LLM评估放射学报告
研究人员推出ReportQA,一个用于评估放射学报告生成系统的新型框架。该框架利用大型语言模型(LLM)从报告中提取结构化信息并生成问答对。源自LLM回答这些问题的准确性的QAScore指标,比现有指标更能与放射科医生的判断保持一致。使用该框架进行的实验表明,当前的视觉语言模型在细粒度临床表示方面存在困难,这表明驱动式推理是报告生成更有效的方法。
-
FedTreeLoRA框架改进了联邦LLM微调
研究人员推出FedTreeLoRA,一个旨在改进大型语言模型(LLM)联邦学习的新框架。该方法通过采用树状聚合层级,解决了客户端之间的统计和功能异质性问题。FedTreeLoRA支持层级对齐,允许客户端在较浅层共享通用知识,而在较深层进行专业化,这在自然语言理解(NLU)和自然语言生成(NLG)基准测试中显示出比现有方法显著的改进。
-
NLG 评估方法从语言学演变为 LLM-即裁判
一篇 arXiv 上的新论文回顾了自然语言生成 (NLG) 评估方法的演变。它追溯了从早期的语言学联系到当前以机器学习为中心的方法的转变,并强调了 LLM-即裁判等技术的出现。该论文预测,随着 NLG 技术的普及,影响、定性方面和安全评估将变得更加重要。
-
分析显示,AI 幻觉源于输入错误,而非仅仅模型缺陷
对一个 24B 模型在 2,700 个问题评估中的表现进行的最新分析显示,其幻觉率为 7%,但大多数情况并非真正的捏造。相反,模型经常由于有缺陷或不完整的数据输入而提供错误信息,作者将这种现象与模型内部错误区分开来。这种区分对于开发工具至关重要,因为源于输入的错误是可以解决的,而源于模型权重的错误则更难修复。