PulseAugur
实时 07:37:17
实体 PATH

PATH

PulseAugur coverage of PATH — every cluster mentioning PATH across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_223295 ·

    结构化SVM Fisher一致性研究新进展

    本文研究了结构化支持向量机(SVM)的Fisher一致性,这是其准确性的必要条件。作者证明了任务损失度量常用的测地线点要求对于标准argmax解码器来说并不充分。他们使用一个四输出星形图提供了最小反例,并对树度量进行了分类,表明argmax一致性仅对路径图成立。研究还确定了某些度量族和汉明立方体存在反例,突显了在某些多面体设置中,校准链接与规定的argmax链接之间存在差距。

  2. TOOL · CL_196267 ·

    MCP工具易受通过未经验证的LLM输入进行命令注入的攻击

    在模型上下文协议(MCP)工具中发现了一个安全漏洞,允许进行命令注入。当用户提供的输入(如文件名或目标格式)在未经适当清理的情况下用于构造shell命令时,就会发生这种情况。攻击者可以通过精心设计的恶意输入来利用此漏洞,诱使模型在服务器上执行任意命令。文章详细介绍了易受攻击的模式,解释了为什么像引用或黑名单这样的常见修复方法不足以解决问题,并提出了一种通过白名单输入、验证路径以及使用参数向量而不是shell来解决问题的健壮方案。

  3. TOOL · CL_193305 ·

    新的PATH方法改进了表格数据的区间预测

    研究人员开发了PATH,一种利用自回归树层次结构对表格数据进行区间预测的新颖方法。该方法模拟了区间的层次结构几何,学习概率质量如何从较大的区间流向较小的、嵌套的区间。通过将学习与提取对齐,PATH精炼了概率分布,以生成更短、更准确的预测区间。在包含56个OpenML回归数据集的PATHBench数据集上的评估中,PATH显著优于24种基线方法,实现了0.1473的平均归一化长度,同时保持了0.9144的平均覆盖率。

  4. TOOL · CL_176189 ·

    AI代理临时文件泄露通过Guard模式修复

    AI代理的临时文件在后续运行中可能导致问题,如果未正确清理。一个常见问题是,当陈旧文件(如前一次运行的JSON载荷)被新运行错误地处理时,会导致不正确的输出。为防止这种情况,可以实现“Guard”模式。该模式在管道开始前注册所有预期的临时文件,如果遇到任何未注册的文件则停止执行。此外,将运行标识嵌入每个临时文件中,可确保陈旧文件能够自我识别并被未来的运行拒绝。

  5. TOOL · CL_169572 ·

    AI 代理创建个性化产前护理计划,GPT-5.2 在评估中领先

    研究人员开发了 PATHFinder Agent,这是一个会话式人工智能系统,旨在根据美国妇产科学院的 PATH 指南制定个性化的产前护理计划。该代理通过对话收集患者的健康和社会信息,综合护理计划,并识别相关的社区资源。在评估中,GPT-5.2 在测试的大型语言模型中表现最佳,在五个临床维度上得分 77.6%,但它也指出了产前检查建议中的不足之处。未来的工作包括通过人类研究和临床试验进行验证。

  6. RESEARCH · CL_81970 ·

    新基准TRAPS评估AI在癌症治疗预测中的应用

    研究人员开发了TRAPS,一个用于通路引导的癌症治疗反应建模的新基准。该研究评估了三种具有生物学知识的深度学习架构——BINN、GraphPath和PATH——在来自The Cancer Genome Atlas的五个癌症队列中的表现,共计2,622名患者。结果表明,没有单一架构能在所有预测任务中都表现出色,其中PATH在靶向分子治疗方面表现强劲,BINN在生存预测方面表现强劲,而GraphPath在预测前列腺癌靶向分子治疗方面取得了…

  7. RESEARCH · CL_01399 ·

    新的基准和框架出现,用于评估医疗领域的大语言模型

    研究人员开发了新的基准和框架来评估大语言模型(LLMs)在医疗领域的性能,解决了现有数据集的局限性。Google Research 推出了 AfriMed-QA,这是一个用于非洲健康问答的综合数据集,以及一个使用自适应精确布尔评分标准评估健康 LLMs 的可扩展框架。此外,新的研究探索了多模态 LLMs 的以实体为中心的数据工程以及大规模荷兰医疗语言语料库的创建。