PulseAugur
中
实时 16:54:38
实体 BERTScore: Evaluating text generation with BERT

BERTScore: Evaluating text generation with BERT

PulseAugur coverage of BERTScore: Evaluating text generation with BERT — every cluster mentioning BERTScore: Evaluating text generation with BERT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
41
90 天内 41
发布 · 30天
0
90 天内 0
论文 · 30天
40
90 天内 40
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_286830 ·

    New BRUGEscore metric proposed for evaluating financial report summarization

    研究人员对使用预训练Transformer对长篇幅金融报告进行摘要的各种方法进行了比较研究。该研究重点关注伦敦证券交易所上市公司(通常约80页长)的年度报告。研究团队评估了多种指标以评估其有效性,并提出了一种新指标BRUGEscore,作为ROUGE-2和BERTScore的调和平均数,并假设现有指标可能无法完全捕捉摘要能力。进行了统计显著性检验和对抗性分析以验证研究结果。

  2. TOOL · CL_286822 ·

    面向SUD患者对话生成的小型语言模型框架

    研究人员开发了一个使用小型语言模型(SLMs)为物质使用障碍(SUD)患者生成对话的框架。该方法解决了大型模型在临床环境中存在的局限性,例如高计算成本和隐私问题。该框架通过一个涉及认知成分检测和对话生成的两阶段过程,专注于将潜在认知成分与患者病史和咨询师问题进行对齐。评估表明,与基线模型相比,这种认知知情的微调显著提高了生成患者回应的真实性和对齐度。

  3. RESEARCH · CL_257005 ·

    为尼泊尔开发AI法律助手以改善司法救济途径 · 跟踪2个来源

    两篇研究论文介绍了为尼泊尔开发的AI法律助手,旨在改善司法救济途径。第一篇NepKANUN利用了检索增强生成(RAG)框架和微调的大型语言模型,在问答任务上取得了很高的F1分数。第二篇NepLEGiT提出了一种基于GPT-2的专门小型语言模型(SLM),该模型在大量的尼泊尔法律文本语料库上进行了预训练,并展示了具有竞争力的困惑度和预测准确性。

  4. TOOL · CL_254168 ·

    LoRA 微调提升 Qwen2.5 模型在控制系统问答中的表现

    研究人员评估了 LoRA 微调在 Qwen2.5 模型上应用于线性控制系统课程问答的有效性。研究发现,LoRA 在不同模型规模和 LoRA 秩下,均能提高与参考答案的文本相似度以及结构化输出格式的稳定性。尽管 LoRA 在文本相似度方面显示出稳定的改进,但评估指标主要捕捉了格式和文本相似性,而非领域特定的推理或数学准确性,这些仍需专家评估。

  5. TOOL · CL_239400 ·

    LexFlip诊断工具评估简化文本中的法律含义保留度

    研究人员开发了LexFlip,一种新的诊断工具,旨在评估文本简化后法律含义保留的程度。目前的度量指标常常无法区分词汇重叠和实际法律效力,导致评估不准确。LexFlip对法律文本(特别是魁北克省的法语句子)进行最小扰动,以逆转法律效力,同时保持高度的词汇相似性。这种新方法旨在为法律文件中的含义保留提供更稳健的评估。

  6. TOOL · CL_239296 ·

    新的PetQA基准评估AI兽医知识

    研究人员开发了PetQA,这是一个旨在评估大型语言模型(LLMs)和大型视觉语言模型(LVLMs)的兽医知识和临床推理能力的新基准。该基准包含超过10,000个问答对,这些问答对源自关于狗和猫的真实查询,并由兽医专家提供答案。使用ROUGE和BERTScore等指标对十八个模型进行的初步评估显示,当前AI系统在兽医护理方面存在局限性,突显了改进适应方法的必要性。

  7. RESEARCH · CL_235450 ·

    大型语言模型在从代码提交中提取软件设计决策方面显示出潜力

    一项初步研究探讨了四种大型语言模型(LLM)从源代码提交中提取架构设计决策(ADDs)的能力。使用零样本和少样本提示,在30个ADDs上测试了包括Gemini 3-Pro、DeepSeek-R1、Kimi K2和Qwen3在内的模型。虽然所有模型的BERT-F1分数均高于0.81,但生成的决策通常过长、侧重于实现,并且缺乏根本原因,这表明需要更具架构意识的大型语言模型系统。

  8. TOOL · CL_228826 ·

    新语料库StageWell增强AI支持对话

    研究人员推出StageWell,一个用于积极心理学支持对话的新中文语料库。该语料库采用HQS协议开发,将支持过程分为六个阶段,包含12,445个监督微调实例和1,849个直接偏好优化(DPO)对。HQS协议通过关注对模型错误输出的本地化修复来指导DPO对的创建,从而提高大型语言模型的过程控制、响应质量和安全性。

  9. TOOL · CL_228643 ·

    PermitGPT 使用生成式 AI 进行建筑治理和安全

    研究人员开发了 PermitGPT,一个旨在简化城市建筑治理的生成式 AI 框架。该系统整合了来自市政和监管部门的零散数据,以识别安全隐患、明确许可证要求并评估社区影响。该框架使用三个开源语言模型进行了微调:Gemma-3-1B 用于高效推理,Llama-3.2-3B 用于监管风格的输出,Mistral-7B-Instruct-v0.3 用于强大的语义对齐。PermitGPT 代表了迈向 AI 辅助建筑治理的一步,但仍需要进一步的评估和验证。

  10. TOOL · CL_227040 ·

    SimpCue提示词适度提升多语言文本简化效果

    研究人员开发了SimpCue,一种使用Qwen3_8B语言模型进行多语言文本简化的新型提示词技术。该方法通过添加关于句子复杂性的明确语言线索来丰富提示词。在加泰罗尼亚语、西班牙语和意大利语中的实验表明,预测提示词在SARI、BLEU、chrF和BERTScore指标上均取得了最佳结果,尽管与基线提示词相比,改进幅度不大且因语言而异。

  11. TOOL · CL_221072 ·

    LLM 评估 ASR 模型:编码器与生成式模型对比

    一项新近发表在 arXiv 上的研究,探讨了基于编码器和解码器的 LLM 在评估自动语音识别(ASR)系统方面的有效性。该研究比较了 BERTScore 和 SemDist 等指标在各种 LLM 和配置下的表现,发现两者在正确设置时都能与人类判断获得高度相关性。研究还强调,生成式 LLM 在 ASR 评估的假设比较和错误分类方面展现出潜力,并提供了更好的可解释性。

  12. TOOL · CL_210590 ·

    基于注视监督的AI提升胸部X光诊断和报告生成能力

    研究人员开发了一种新颖的两阶段多模态框架来解读胸部X光片,整合放射科医生的眼动追踪数据以提高诊断准确性和报告生成能力。第一阶段采用注视-令牌分类器,融合图像块、转录文本和放射科医生的注视点,增加的注视监督将AUC提高了4.4%,F1提高了13.3%。第二阶段将这些预测转化为区域特定的诊断语句,提取置信度加权的关键词,并使用提示式大型语言模型来提高临床术语得分。该方法为可解释的、注视感知的胸部X光分析设定了新基准。

  13. TOOL · CL_208490 ·

    新流程 C-FEX 改进了领域特定 AI 文本生成的事实性评估

    研究人员开发了一个名为 C-FEX 的新评估流程,用于评估生成文本的事实性,特别是在领域特定文档生成任务中。该流程引入了参数化知识精度 (PKP) 来衡量源自模型权重的信息的正确性,并将其与源自增强提示的声明区分开来。研究发现,经过微调的 7B 模型可以媲美甚至超越更大的基线模型,并且 Rouge 和 BertScore 等标准指标可能具有误导性。研究表明,微调主要减少了幻觉,而不是加强了正确的参数化知识。

  14. TOOL · CL_206305 ·

    研究发现:大型语言模型在语言教学方面的教学能力有限

    一篇新的研究论文探讨了大型语言模型(LLMs)在语言教育中的教学能力。该研究评估了几款最先进的LLMs识别、纠正和解释英语学习者常见错误的能力。虽然模型在表面纠正方面表现出熟练度,但它们的解释往往缺乏必要的领域知识和教学适宜性,这表明目前对人工智能在语言学习中的热情可能超出了系统的实际教学能力。

  15. TOOL · CL_204021 ·

    提出新的“信息满意度”指标用于摘要评估

    一篇新的研究论文提出将“信息满意度”作为一种以读者为中心的指标来评估摘要系统。作者认为,像ROUGE和BERTScore这样的现有指标,甚至LLM作为评判的方法,都未能捕捉到摘要对于具有特定背景和需求的个体用户的效用。通过专家人工评估,研究发现传统的和基于LLM的指标都与人类在信息满意度上的判断不符。

  16. TOOL · CL_200024 ·

    新的 40 亿参数视觉语言模型面向 3D MRI 分析

    研究人员开发了 Mr3D-VL,这是一种新的 40 亿参数视觉语言基础模型,专门用于多参数 3D 磁共振成像 (mpMRI)。该模型通过实现对复杂 3D 空间数据的自然语言交互和可解释性,解决了当前 AI 的局限性,这对于脑肿瘤诊断至关重要。Mr3D-VL 通过共享的 3D 编码器和跨模态投影层整合了多种成像模态和特征,在文本生成任务中表现优于现有模型,BERTScore 达到 0.856。

  17. RESEARCH · CL_185152 ·

    AI模型以新颖的多智能体方法赢得双关语翻译竞赛 · 跟踪3个来源

    研究人员开发了一种新颖的方法,将英语双关语翻译成法语,并在CLEF JOKER 2025 Task 2竞赛中获得第一名和第二名。该方法结合了大型语言模型和专业技术,包括对比学习、语音语义嵌入以及多智能体生成器-判别器框架。这种方法优先考虑保留文字游戏的幽默感和创造力,而不是字面翻译,在专家人类评估下,其表现优于BLEU和BERTScore等标准指标。

  18. RESEARCH · CL_184949 ·

    MIDAS框架通过多模型自适应增强企业文本摘要

    研究人员推出了MIDAS(Multi-LLM Iterative Data-Adaptive Summarization),一个旨在增强企业应用文本摘要的新型框架。MIDAS采用多模型方法,结合数据驱动的模式学习和个性化,无需手动提示工程即可自动适应多样化的摘要需求。在企业客户工单摘要的评估中,MIDAS在ROUGE和BERTScore指标上取得了显著改进,表现优于CriSPO和ZERA等现有的基于批评的优化方法。

  19. TOOL · CL_174027 ·

    AI生成的反驳可以个性化以获得更大影响力

    研究人员开发并评估了生成情境化AI反驳策略以对抗在线毒性。与泛化方法不同,这些新方法会适应对话情境和用户历史以增强说服力。一项众包实验表明,整合对话情境和用户历史的轻量级策略提高了感知充分性和说服力,尽管个性化并非普遍有效。研究结果为创建更个性化和负责任的反驳系统提供了指导,以促进在线内容审核中的人机协作。

  20. TOOL · CL_171808 ·

    LLM框架根据方法验证科学论文论点

    研究人员开发了一个新框架,通过使用大型语言模型(LLM)来验证论文内的论点,从而加强科学论文的同行评审过程。该系统称为论文内论点验证,评估论文中描述的方法是否充分支持其声称的新颖性。该框架从引言中提取论点,识别相关的方法学证据,并评估支持程度,借鉴了对ICLR 2025论文的人工评审标准。评估表明,LLM生成的评估与人类评审员的担忧(尤其是在新颖性方面)高度一致,BERTScore进一步验证了该框架捕捉这些类似人类观察的能力。