ROUGE L Score
PulseAugur coverage of ROUGE L Score — every cluster mentioning ROUGE L Score across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的 RAGScope 协议旨在降低幻觉分类成本
研究人员开发了 RAGScope,一种旨在有效分类检索增强生成 (RAG) 系统中幻觉的新协议。该协议旨在通过使用仅依赖输入、检索到的上下文和生成答案的泄漏控制、证据门控方法来降低成本。增强版 RAGScope-E 在 RAGTruth 任务上实现了 0.798 的 AUROC 和 0.660 的平均精度,在池化平均精度上优于 ROUGE-L。该系统在 CPU 上运行速度很快,比 DeBERTa-NLI 等更复杂的模型快得多,尽管其有…
-
AI微调以适应真实的放射学报告风格
研究人员开发了一种方法,以提高AI生成的放射学报告与人类放射学家所写报告在风格上的一致性。通过分析CheXpert Plus数据集中的2000份报告,他们识别出五种不同的报告模式。然后,他们采用了逆向宪法AI框架,使用这些风格惯例对MedGemma-4B模型进行微调,从而在BLEU-4和ROUGE-L等文本一致性指标上取得了显著改进。
-
新的NLP任务叙事整合统一多视角叙述
研究人员引入了一项名为叙事整合(Narrative Consolidation)的新自然语言处理任务,该任务专注于将多视角叙述统一成一个单一、连贯且按时间顺序准确的文本。与标准的*/多文档摘要*/不同,此任务优先考虑叙事流程和互补细节的融合。创建了一个名为*/福音书整合语言资源*/的基准数据集,使用了*/圣经*/中的*/福音书*/,包含169个规范事件。实验表明,提供时间骨架能显著提高性能,而简单的长度启发式方法在融合风格参考上优于基于图的方法。
-
手语翻译模型因 the Signer Dependence而被高估
一篇新发表在arXiv上的研究论文强调了手语翻译(SLT)模型评估中存在的显著高估问题。研究发现,当前包含训练和测试数据集中重叠 the Signer 的评估方法会导致性能得分虚高。当使用 the Signer-independent 协议进行评估时,像 GFSLT-VLP、GASLT 和 SignCL 等领先的 SLT 模型的性能急剧下降,在 PHOENIX14T 数据集上的 BLEU-4 分数从超过 21 分降至低至 3.59 分…
-
大型语言模型在从代码提交中提取软件设计决策方面显示出潜力
一项初步研究探讨了四种大型语言模型(LLM)从源代码提交中提取架构设计决策(ADDs)的能力。使用零样本和少样本提示,在30个ADDs上测试了包括Gemini 3-Pro、DeepSeek-R1、Kimi K2和Qwen3在内的模型。虽然所有模型的BERT-F1分数均高于0.81,但生成的决策通常过长、侧重于实现,并且缺乏根本原因,这表明需要更具架构意识的大型语言模型系统。
-
新的LUX架构增强了可解释的内窥镜图像字幕生成
研究人员开发了LUX,一种新颖的图条件视觉-语言架构,用于可解释的内窥镜图像字幕生成。该系统通过构建一个以病变为中心的场景图来表示病变区域及其关系,从而解决了当前深度学习模型的局限性。通过将这些图嵌入集成到T5解码器中,LUX将生成的词语与特定的视觉证据对齐,增强了可解释性并减少了临床发现的幻觉。LUX在医学字幕生成基准测试中的表现优于现有模型。
-
新的去噪感知反演方法揭示了噪声文本嵌入中的隐私风险
研究人员开发了一种名为去噪感知反演(DAEI)的新方法,以解决通过添加高斯噪声保护的文本嵌入中的隐私风险。由于“双重噪声陷阱”,标准的攻击方法在处理这些扰动嵌入时面临困难。DAEI结合了残差去噪自编码器和生成文本反演,对去噪器进行无监督训练,仅凭噪声观测即可重建原始文本。实验表明,DAEI显著提高了重建质量,BLEU分数相对提高了154%,F1和ROUGE-L也取得了显著的提升,挑战了简单加噪足以保护隐私的假设。
-
新框架可在无需重新训练的情况下实现可扩展的LLM指令调优
研究人员开发了SemiAdapt-Instruct,一个用于指令调优大型语言模型(LLM)的新颖框架。这个模块化系统解决了在不完全重新训练的情况下,将微调模型适应不断变化的领域所面临的挑战。它通过发现潜在指令领域,为每个领域训练单独的LoRA适配器,并使用无参数路由通过单适配器更新来整合新领域来实现这一点。SemiAdapt-Instruct在性能上优于完整的模型微调,并提供了单一方法所缺乏的可扩展性。
-
新AI框架CANOE和CoPlan增强护理计划的透明度
研究人员推出了两个新颖的AI框架,CANOE和CoPlan,旨在增强复杂护理计划协调的透明度和安全性。CANOE是一个多智能体神经符号系统,采用一种论证方法,其中专门的智能体生成和争论干预措施,允许人在回路中进行优化。CoPlan提供了一个共智能接口,使人类护理规划者能够检查、质疑和修改AI生成的建议,在决策过程中保留人类的主导权。这两个系统都旨在改进多样化的临床、功能和社会心理信息的综合,以实现更可信赖和负责任的护理计划。
-
研究发现:大型语言模型无法翻译韩语盲文
一项新的研究论文揭示了最先进的大型语言模型(LLMs)在翻译韩语盲文方面存在严重的无障碍性缺陷。尽管人们期望这些模型能够通过文本表示来处理盲文,但研究发现其输出持续表现不佳且不稳定。研究表明,当前的大型语言模型缺乏对盲文的感知分词以及韩语和盲文模式之间的强有力对齐,这凸显了系统性的局限性。
-
新的 RLHF 框架改进了越南语历史手稿翻译
研究人员开发了一种新的多模态人类反馈强化学习 (RLHF) 框架,用于将历史汉喃手稿翻译成现代越南语。该方法利用手稿图像的视觉信息和对齐的汉喃文本来提高翻译质量,解决了页面退化和并行数据有限等挑战。该框架集成了多个语言模型和视觉编码器,实验表明,在 BLEU-4 和 BERTScore 等各项指标上,直接偏好优化 (DPO) 的表现优于近端策略优化 (PPO) 和卡方优化 (KTO),证明了偏好优化在低资源历史翻译中的有效性。
-
AI模型通过提高点击率和质量来改进广告标题生成 · 已追踪2个来源
两篇新研究论文提出了先进的广告标题生成方法。一篇论文介绍了一种名为COBART的受控、优化、双向、自回归Transformer模型,该模型使用前缀控制令牌进行微调,ROUGE-L得分提高了25.82%,估计点击率提高了5.82%。另一篇论文提出了一种使用强化学习策略梯度的自批判掩码语言模型方法,该方法在语法和创意质量审计方面优于现有的Transformer和LSTM+RL方法,甚至优于人类提交的标题。
-
新的ARKD框架通过自适应KL散度增强LLM压缩
研究人员开发了ARKD,一个旨在提高大型语言模型(LLMs)压缩和性能的新型知识蒸馏框架。这种自适应强化学习引导的方法动态地权衡前向和反向KL散度目标,以更好地平衡主要分布拟合与长尾概率建模。实验表明,ARKD持续改进ROUGE L和BERTScore指标,优于现有方法。
-
新研究探索无 GPU 和基于梯度的 LLM 幻觉检测
两篇新研究论文探讨了检测大型语言模型 (LLM) 中幻觉的方法。第一篇论文“没有 GPU 能走多远?”对跨问答、对话和摘要任务的 CPU 可行、轻量级幻觉检测方法进行了基准测试,发现性能因任务而异,摘要任务尤其具有挑战性。第二篇论文“AURORA”引入了一个新颖的框架,该框架分析 LLM 的权重梯度动态以检测幻觉,证明了其跨不同模型家族和数据集的鲁棒性,甚至可以迁移到非领域任务。
-
新基准推动视频AI将答案与时间证据联系起来 · 跟踪4个来源
两篇新的研究论文介绍了视频问答的基准和模型,这些模型侧重于时间推理和证据关联。EG-VQA基准拥有超过11,000个问答对和时间证据注释,突显出当前模型在准确本地化证据方面存在困难,即使答案是正确的。为了解决这个问题,开发了EG-Reasoner模型,在推理密集型任务上表现有所提高。另外,ViTexQA数据集和FrameThinker模型解决了视频文本理解问题,其中语义是从时间分布的线索中产生的,通过提高ROUGE-L分数,其表现优于…
-
PreLort方法增强了LLM的联邦微调
研究人员推出了一种新颖的联邦微调大型语言模型的方法PreLort,该方法解决了异构硬件带来的挑战。PreLort采用前缀嵌套低秩公式来组织适配器维度,确保低秩维度捕获任务相关信息,而高秩维度提供额外容量。该方法包括分段聚合规则和前缀嵌套训练策略,以鼓励跨不同秩容量的一致学习和信息聚合。实验表明,PreLort在准确性和ROUGE-L分数方面优于现有的异构联邦LoRA方法。
-
新AI框架XMedFusion增强医学影像分析
研究人员推出XMedFusion,一个旨在增强自主医疗系统感知和推理能力的新型AI框架。该模块化框架通过将视觉信息分解为功能组件(包括视觉感知代理、知识图谱构建代理和综合代理)来改进放射报告生成。XMedFusion迭代地整合视觉和结构化证据,以产生可靠且可解释的诊断输出,在BLEU-1、ROUGE-L、METEOR、一致性和准确性等指标上比现有视觉-语言模型有显著改进。
-
新型混合AI架构提升风力涡轮机叶片检测效率
研究人员开发了一种新颖的混合架构,用于自动化工业检测,特别是风力涡轮机叶片维护。该系统集成了用于缺陷定位的视觉模型和用于报告生成的语言模型,将这些任务解耦以提高效率和准确性。该架构使用了YOLO26-x-obb检测器、一个自定义编码模块以及一个使用合成数据和检索增强进行微调的4位量化Qwen-2.5-1.5B模型。
-
新的MATCHA指标通过惩罚矛盾来改进LLM文本评估
研究人员开发了MATCHA,这是一种旨在更准确地评估大型语言模型生成文本的语义相似性的新指标。与ROUGE和BERTScore等现有指标不同,后者可能错误地将矛盾文本评为相似,MATCHA同时识别与参考的一致性并惩罚矛盾。在八个基准测试中,MATCHA在包括问答和摘要在内的各种任务上均表现优于人工标注,并且在TruthfulQA数据集上的表现显著优于ROUGE-L和BERTScore。
-
研究人员通过轨迹感知过程监督改进医学视觉问答
研究人员开发了一种新颖的方法,通过结合轨迹感知过程监督来改进医学视觉问答(VQA)系统。该方法采用两阶段训练框架,首先进行监督微调,然后使用独特的基于过程的奖励进行组相对策略优化(GRPO)。新的奖励机制利用动态时间规整(DTW)在句子嵌入上测量生成和真实推理过程之间的相似性,从而显著提高了准确性。