PulseAugur
中
实时 22:30:08
实体 Bleu

Bleu

PulseAugur coverage of Bleu — every cluster mentioning Bleu across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
49
90 天内 49
发布 · 30天
0
90 天内 0
论文 · 30天
45
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 50 条
  1. TOOL · CL_286822 ·

    面向SUD患者对话生成的小型语言模型框架

    研究人员开发了一个使用小型语言模型(SLMs)为物质使用障碍(SUD)患者生成对话的框架。该方法解决了大型模型在临床环境中存在的局限性,例如高计算成本和隐私问题。该框架通过一个涉及认知成分检测和对话生成的两阶段过程,专注于将潜在认知成分与患者病史和咨询师问题进行对齐。评估表明,与基线模型相比,这种认知知情的微调显著提高了生成患者回应的真实性和对齐度。

  2. TOOL · CL_284524 ·

    离线语音翻译系统可在边缘设备上自我校正

    研究人员开发了一个离线语音到语音的翻译系统,该系统可以在Jetson Nano边缘设备上运行,并在无需重新训练的情况下自行校正翻译。该系统利用了Whisper-tiny ASR模型和OPUS-MT翻译器,并使用多语言BERT模型作为质量评估门控来触发二次校正。在英-西班牙语翻译上的实验表明,最小贝叶斯风险解码显著提高了翻译质量,而质量评估模型作为门控比作为排序器更有效,从而节省了内存。

  3. COMMENTARY · CL_276906 ·

    LLM部署最佳实践:业务需求优先,模型选择其次

    开发和部署成功的LLM解决方案需要一个结构化的方法,优先考虑业务需求而非模型选择。该过程包括五个关键步骤:理解业务问题并定义模型特定和以业务为中心的指标;通过探索非LLM替代方案和在依赖基准之前评估候选模型的事实属性来做好准备;选择最合适的模型;针对特定任务对其进行定制;最后,将其投入生产以供实际使用。这种有条不紊的顺序确保LLM项目与业务目标保持一致,并且易于实施和维护。

  4. TOOL · CL_268671 ·

    新框架使用知识图谱评估大型语言模型上下文理解能力

    研究人员开发了一个新的框架,用于评估大型语言模型(LLMs)在问答任务中的上下文理解能力。该框架利用知识图谱和一种名为知识图谱语义结构相似度(S3KG)的新指标来评估LLMs提取、整合和推理信息的能力。S3KG指标结合了结构和语义信号,在性能上比现有基线高出7.6个F1点。此外,一个诊断分析工具可以对细粒度的推理错误进行分类,从而更深入地了解LLM的失败之处。

  5. RESEARCH · CL_271120 ·

    研究发现大语言模型提示中的隐藏日期会影响评估 · 已追踪2个来源

    一项新的研究论文强调了一个先前被忽视的、影响大语言模型(LLM)评估的重要因素:当前日期被自动注入系统提示中。这个隐藏的日期变量导致在数学推理和代码生成等各种任务上的性能波动高达14%,甚至可能改变排行榜上的模型排名。研究发现,诸如思维链(chain-of-thought)等标准提示技术并不能缓解这种日期敏感性,在某些情况下甚至会加剧它,这凸显了在大语言模型研究中需要更稳健的评估协议。

  6. RESEARCH · CL_259294 ·

    首个使用圣经语料库开发的英叙机器翻译模型

    研究人员开发了首个用于英译叙利亚语的基于短语的统计机器翻译(SMT)模型,解决了翻译一种拼写复杂且濒危语言的挑战。该研究创建了一个包含近40,000对句子的圣经数据集,采用自定义脚本和人工审查进行对齐。所得模型达到了23.54的BLEU分数,人工评估显示性能尚可,为叙利亚语未来的自然语言处理(NLP)工作奠定了基础。

  7. TOOL · CL_257061 ·

    新的EviSI代理改进了同声传译的评估

    研究人员开发了EviSI,一种专为同声语音到语音翻译系统设计的新型评估代理。与BLEU和COMET等传统指标不同,EviSI整合了多维度质量指标(MQM)以及与专业口译员共同制定的标准。它通过共享源证据,在锚点、事件、逻辑和流畅性四个维度上评估翻译,以识别语义错误。在英译中和中译英数据的测试中,EviSI与人类排名表现出高度相关性,优于现有基线。

  8. TOOL · CL_256393 ·

    新的RepoExec基准测试揭示LLM在代码依赖准确性方面存在困难

    来自FPT Software AI Center的一篇论文介绍了一个名为RepoExec的新基准测试,该测试通过考虑正确性和依赖调用率来评估大型语言模型在代码生成方面的能力。基准测试显示,当前模型在准确利用提供的依赖项方面存在困难,许多模型未能调用正确的依赖项或重写现有函数而不是解决问题。研究还发现,仅提供函数签名和文档字符串而不提供函数体,可能导致模型将任务误解为少样本示例,从而生成空代码或错误代码。

  9. TOOL · CL_254485 ·

    新的自适应LLM评估方法使用更少的项目和连续分数

    研究人员开发了一种新的评估大型语言模型(LLM)的方法,该方法将计算机化自适应测试(CAT)的原理应用于连续评分指标。这种方法在最近的一篇arXiv论文中有所详细介绍,它用异方差正态分布取代了传统的伯努利分布,以处理ROUGE、BLEU和LLM-as-a-Judge等分数。所提出的具有自适应停止标准的、考虑不确定性的排名器旨在以显著更少的项目和更低的成本实现可靠的模型排名,在一次校准后,在自信预测上保持99%的准确率,同时在排名相关性…

  10. RESEARCH · CL_252015 ·

    人工智能推动手语翻译和视频生成

    研究人员正在探索用于手语翻译和生成的高级人工智能技术。一项研究调查了不同 T5 模型规模和运动特征对印度手语翻译成文本的影响,在一项共享任务中获得第五名。另一项名为 SignMimic 的项目通过分离刚性运动、非刚性变形和完成来专注于生成高质量的手语视频,并在多个数据集上展示了最先进的结果。

  11. COMMENTARY · CL_249144 ·

    人类评估在大型语言模型质量评估中仍然至关重要

    人类评估对于评估大型语言模型(LLMs)至关重要,因为BLEU分数等自动化指标常常无法捕捉连贯性、创造性和事实准确性等细微的质量。这种方法对于高风险应用至关重要,它使用李克特量表评分和成对比较等方法,通过人类反馈强化学习(RLHF)等技术来引导模型产生期望的行为。人类评估者的一致性通过科恩的Kappa系数等指标进行衡量,确保评估标准清晰且任务定义明确。

  12. TOOL · CL_244973 ·

    新的 AlphaMWE 语料库揭示了大型语言模型在多词表达式翻译中的盲点

    研究人员开发了 AlphaMWE 语料库,用于测试大型语言模型(LLMs)在机器翻译方面的能力,特别关注多词表达式(MWEs)。该研究评估了 31 个不同语言对的机器翻译系统,包括英语到中文、波兰语、德语以及几种阿拉伯语方言。使用 BLEU 和 BERT-score 等指标进行的自动评估,以及后续的人工评估,都揭示了比喻性语言和多词表达式仍然是大型语言模型的挑战,并且汇总分数可能会掩盖特定语言的错误。

  13. RESEARCH · CL_243457 ·

    新的LLM代理评估同声传译,改进了BLEU和COMET指标

    研究人员开发了评估同声传译系统的新方法,解决了现有指标(如BLEU和COMET)的局限性。其中一种方法在arXiv论文中有所介绍,该方法使用LoRA适配的COMET-KIWI编码器来评估意义传递、交付质量和感知延迟,与标准方法相比,与人类评分的相关性有所提高。另一个系统EviSI则借鉴了多维度质量度量(MQM)的原则来评估语义保真度和口语表达,在英语到中文翻译方面与人类排名表现出高度一致性。

  14. RESEARCH · CL_235450 ·

    大型语言模型在从代码提交中提取软件设计决策方面显示出潜力

    一项初步研究探讨了四种大型语言模型(LLM)从源代码提交中提取架构设计决策(ADDs)的能力。使用零样本和少样本提示,在30个ADDs上测试了包括Gemini 3-Pro、DeepSeek-R1、Kimi K2和Qwen3在内的模型。虽然所有模型的BERT-F1分数均高于0.81,但生成的决策通常过长、侧重于实现,并且缺乏根本原因,这表明需要更具架构意识的大型语言模型系统。

  15. TOOL · CL_227040 ·

    SimpCue提示词适度提升多语言文本简化效果

    研究人员开发了SimpCue,一种使用Qwen3_8B语言模型进行多语言文本简化的新型提示词技术。该方法通过添加关于句子复杂性的明确语言线索来丰富提示词。在加泰罗尼亚语、西班牙语和意大利语中的实验表明,预测提示词在SARI、BLEU、chrF和BERTScore指标上均取得了最佳结果,尽管与基线提示词相比,改进幅度不大且因语言而异。

  16. TOOL · CL_219167 ·

    新的LUX架构增强了可解释的内窥镜图像字幕生成

    研究人员开发了LUX,一种新颖的图条件视觉-语言架构,用于可解释的内窥镜图像字幕生成。该系统通过构建一个以病变为中心的场景图来表示病变区域及其关系,从而解决了当前深度学习模型的局限性。通过将这些图嵌入集成到T5解码器中,LUX将生成的词语与特定的视觉证据对齐,增强了可解释性并减少了临床发现的幻觉。LUX在医学字幕生成基准测试中的表现优于现有模型。

  17. TOOL · CL_218945 ·

    大语言模型框架增强大规模评估的相似性分析

    研究人员开发了一个名为AISA的新框架,该框架利用大语言模型(LLMs)来分析大规模评估中的附带内容相似性。这种双维度方法通过结构化分解和语义相关性来实现相似性操作,旨在解决BLEU和余弦相似性等传统指标在捕捉细微冗余方面的局限性。心理测量学验证表明,AISA的大语言模型衍生指标与非构建相关的局部依赖性更吻合,并改善了项目参数分组。该框架在计算机自适应测试(CAT)模拟中的应用表明,与传统方法相比,其估计稳定性得到增强,项目选择偏差减小。

  18. TOOL · CL_218046 ·

    首个英语-Pnar 语言对的机器翻译系统问世

    研究人员为英语和 Pnar 语言对开发了首批机器翻译系统,Pnar 是一种南亚语系语言,约有 40 万人使用。研究人员使用 Wyrta 报纸的文章创建了一个包含 10,234 个句子的平行语料库,用于训练基于短语的统计机器翻译模型。性能最佳的系统在 Pnar 到英语的翻译中获得了 14.97 的 BLEU 分数,在英语到 Pnar 的翻译中获得了 11.16 的 BLEU 分数,为这个低资源语言对建立了一个量化基准。

  19. TOOL · CL_217493 ·

    大语言模型基准测试套件:使用标准化指标衡量进展

    基准测试套件通过提供标准化的测试框架,对于客观衡量大语言模型(LLMs)的进展至关重要。这些套件汇集了各种单独的基准测试,以提供模型能力的整体视图,减少评估偏差并确保可复现的结果。关键指标包括用于理解任务的Exact Match、用于生成任务的BLEU和ROUGE,以及用于语言建模质量的Perplexity,尽管现代方法也采用了LLM即评委(LLM-as-a-Judge)的方法。为确保有效性,基准测试套件必须解决数据污染问题,并采用统…

  20. TOOL · CL_215978 ·

    新的SAraBERT模型通过新颖的相似度指标增强了阿拉伯语文档摘要能力

    研究人员开发了SAraBERT,这是AraBERT模型的改进版本,专门用于阿拉伯语文档的抽取式摘要。该新模型融入了句子间Transformer层以增强其摘要能力。为了评估生成摘要的质量,引入了一种名为语义Siamese相似度的新指标,用于衡量文本间的相似度。使用BLEU、ROUGE和新的语义Siamese相似度指标进行的实验证明了SAraBERT的有效性。