BLEU-4
PulseAugur coverage of BLEU-4 — every cluster mentioning BLEU-4 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI微调以适应真实的放射学报告风格
研究人员开发了一种方法,以提高AI生成的放射学报告与人类放射学家所写报告在风格上的一致性。通过分析CheXpert Plus数据集中的2000份报告,他们识别出五种不同的报告模式。然后,他们采用了逆向宪法AI框架,使用这些风格惯例对MedGemma-4B模型进行微调,从而在BLEU-4和ROUGE-L等文本一致性指标上取得了显著改进。
-
新目标函数改进CT扫描的临床报告生成
研究人员开发了一种新的目标函数,用于从锥束CT扫描生成临床报告,优先考虑事实蕴含而非简单的词汇重叠。该复合目标包括大型语言模型判断和一个较小的词汇组成部分,旨在提高生成报告的准确性和相关性。该系统在2900万参数编码器上进行了微调,在预测特定解剖覆盖范围和识别解剖准确性方面的听写约定方面表现出改进的性能。
-
手语翻译模型因 the Signer Dependence而被高估
一篇新发表在arXiv上的研究论文强调了手语翻译(SLT)模型评估中存在的显著高估问题。研究发现,当前包含训练和测试数据集中重叠 the Signer 的评估方法会导致性能得分虚高。当使用 the Signer-independent 协议进行评估时,像 GFSLT-VLP、GASLT 和 SignCL 等领先的 SLT 模型的性能急剧下降,在 PHOENIX14T 数据集上的 BLEU-4 分数从超过 21 分降至低至 3.59 分…
-
新的基准和模型提高了手语翻译的准确性 · 跟踪3 个来源
研究人员正在开发新的手语翻译 (SLT) 基准和模型,以提高准确性并捕捉传统指标之外的细微差别。一篇论文提出了一种基于 LLM 的 QA 协议,以更好地评估时空理解和内容保留,揭示了除一个词汇监督系统外,当前模型的表现相似。另一篇论文介绍 SignBind-LLM,一个具有专家流的模块化框架,用于连续手语、拼写和唇读,在多个数据集上取得了最先进的结果。第三篇论文提出了 M3T,一个用于手语生成系统,该系统集成了面部表情和头部运动等非手…
-
新的离散扩散模型增强了放射报告生成
研究人员开发了DRRG,一种用于放射报告生成的创新离散扩散框架,超越了传统的自回归模型。这种新方法允许对报告进行迭代优化,模仿放射科医生使用的过程,并解决了诸如逐个标记生成中常见的错误传播问题。DRRG包含一个临床实体感知掩码和一个概念条件模块,以提高生成报告的质量和临床一致性,在MIMIC-CXR和CheXpert Plus数据集上表现强劲。
-
新方法结合LLM和Transformer以改进代码摘要
研究人员开发了一种名为“基于Transformer辅助的大型语言模型源代码摘要”的新方法,以改进源代码的自然语言摘要生成。该方法结合了大型语言模型(LLMs)的语义理解和特定任务Transformer模型的词汇精度。通过在提示中使用Transformer生成的摘要,LLMs可以生成更高质量的代码摘要,更好地满足开发者的期望,并将BLEU-4等指标提高多达7.8%。这项进展旨在增强安全软件开发生命周期(SSDLC)维护阶段的代码理解能力…
-
新的RL框架REVA-PO提高了X射线报告生成的准确性
研究人员开发了REVA-PO,这是一个新颖的强化学习框架,旨在稳定用于从胸部X射线生成报告的模型训练。这种新方法通过根据响应质量动态调整正则化权重并定期将参考策略重置为强大的验证检查点来解决不稳定性问题。该框架还包括一个三阶段训练流程,包括监督微调和RL。在MIMIC-CXR和IU-Xray数据集上的评估显示,在语言质量和临床准确性方面都有显著改进,设定了新的最先进基准。
-
新的 RLHF 框架改进了越南语历史手稿翻译
研究人员开发了一种新的多模态人类反馈强化学习 (RLHF) 框架,用于将历史汉喃手稿翻译成现代越南语。该方法利用手稿图像的视觉信息和对齐的汉喃文本来提高翻译质量,解决了页面退化和并行数据有限等挑战。该框架集成了多个语言模型和视觉编码器,实验表明,在 BLEU-4 和 BERTScore 等各项指标上,直接偏好优化 (DPO) 的表现优于近端策略优化 (PPO) 和卡方优化 (KTO),证明了偏好优化在低资源历史翻译中的有效性。
-
面向交通工程的定制化生成式AI代理已开发完成
研究人员开发了一种为交通工程等专业领域定制生成式AI代理的方法。他们使用精选的美国交通文件数据集,通过低秩适配(LoRA)框架对六个大型语言模型(LLMs)进行了微调。研究发现,Qwen2.5-7B和LLaMA-3.1-8B模型在理解技术内容和领域内推理方面表现最佳,以BLEU-4和ROUGE分数衡量。这种方法为创建特定领域的AI代理提供了一种可复现的方式,可应用于研究、设计、规划和政策。
-
新型混合AI架构提升风力涡轮机叶片检测效率
研究人员开发了一种新颖的混合架构,用于自动化工业检测,特别是风力涡轮机叶片维护。该系统集成了用于缺陷定位的视觉模型和用于报告生成的语言模型,将这些任务解耦以提高效率和准确性。该架构使用了YOLO26-x-obb检测器、一个自定义编码模块以及一个使用合成数据和检索增强进行微调的4位量化Qwen-2.5-1.5B模型。