PulseAugur
实时 08:58:54
实体 Prosa

Prosa

PulseAugur coverage of Prosa — every cluster mentioning Prosa across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_199975 ·

    大型语言模型框架PROVE-RT助力为实时系统生成定理证明器脚本

    研究人员开发了PROVE-RT,一个旨在协助大型语言模型(LLMs)生成机械化定理证明器脚本的新框架,特别针对实时系统。该系统解决了当前大型语言模型缺乏PROSA/ROCQ定理证明器所需专业知识的挑战。PROVE-RT采用了一种引导式方法,结合了依赖感知的非正式草图和从已处理文档中检索信息,以提高生成脚本的准确性。在评估中,PROVE-RT在生成有效的PROSA机械化方面取得了44.7%的成功率,显著优于直接提示最先进的大型语言模型。

  2. TOOL · CL_53843 ·

    新框架审计文档解析器中的结构脆弱性

    研究人员开发了 ProSA,一个旨在评估文档布局分析 (DLA) 管道结构鲁棒性的新审计框架。该框架超越了传统的以区域为中心的评估,专注于块级结构丢失率和路径归因。ProSA 的研究结果表明,结构完整性是 DLA 鲁棒性比单纯的区域覆盖更关键的指标,对问答和检索等下游任务有显著影响。

  3. RESEARCH · CL_15870 ·

    新基准‘Prosa’评估巴西葡萄牙语聊天中的LLM

    研究人员推出了Prosa,这是一个新的基准,旨在通过巴西葡萄牙语的真实用户对话来评估大型语言模型(LLM)。该基准使用基于评分标准的评分系统,并结合多裁判过滤来减轻整体LLM作为裁判评估中常见的偏见。Prosa包含1000个WildChat对话,旨在通过增加模型之间的分数差距来提高LLM评估的区分能力。