PulseAugur
中
实时 10:17:23
实体 Macro F1

Macro F1

PulseAugur coverage of Macro F1 — every cluster mentioning Macro F1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_259327 ·

    新基准TeleAntiFraud 2.0旨在应对不断演变的电信欺诈检测

    研究人员推出了TeleAntiFraud 2.0,一个旨在改进电信欺诈检测的新基准。该基准通过纳入新观察到的欺诈模式而不改变先前的测试集,来应对不断演变的诈骗策略的挑战。它还侧重于区分欺诈电话和合法的、相似领域的对话,而不是依赖于易于区分的负面示例。该数据集使用混合树反欺诈生成管道生成,每月评估集包含900个中文电话,其中600个为欺诈电话,300个为近领域非欺诈案例。

  2. TOOL · CL_259310 ·

    研究发现LLM数据审计不能保证非洲NLP的下游效用

    一篇新发表在arXiv上的研究调查了低资源非洲语言合成数据选择方法的有效性。研究发现,普遍认为由LLM评估器高度评价的数据将提高下游模型性能的代理指标并不成立。在四种语言和两个任务中,基于LLM审计的数据质量排名与实际下游性能存在显著差异。该研究提出了一个反事实审计框架“V2”,它提高了评估标签的正确性,但仍不能保证下游效用,突显了合成数据评估需要在相同的保留集上报告审计和下游指标的必要性。

  3. TOOL · CL_233535 ·

    研究发现高光谱分类评估存在缺陷

    一篇新发表在arXiv上的研究论文强调了高光谱图像分类标准评估方法存在的重大缺陷。研究发现,像Salinas等数据集上常见的随机像素分割做法会导致准确率得分虚高,因为测试像素经常与训练像素相邻。当一种无泄露的评估协议应用于十种不同的架构时,平均Macro-F1得分下降了0.147,模型排名也发生了显著变化。研究还发现,许多架构未能解决数据中固有的光谱歧义,导致不同模型出现相似的错误分类模式。

  4. TOOL · CL_221073 ·

    专家指导技能提示提高了中文隐喻识别的跨数据集稳定性

    研究人员调查了在不同数据集上改进中文隐喻识别的方法。他们比较了四种方法:BERT微调(BERT-FT)、基于QLoRA的大模型微调(LLM-FT)、直接零样本大模型提示(LLM-ZS)以及带有程序性技能的零样本提示(Skill-ZS)。虽然微调方法在其原生数据集上达到了更高的准确率,但Skill-ZS在多个外部数据集上表现出更稳定的性能,表明它是一种用于获得一致的跨数据集结果的补充方法。

  5. TOOL · CL_215899 ·

    研究论文分析了机器学习中物理先验的成本

    一篇新发表在arXiv上的研究论文探讨了将物理先验纳入机器学习模型所产生的成本。研究表明,这种成本主要受自由特征和验证集划分的影响,而不仅仅是先验本身的属性。研究结果表明,受约束的模型不应被其消融版本超越,并且在野火严重性任务上的实证结果说明了坐标如何充当保护罩,显著降低了应用先验的成本。

  6. TOOL · CL_206077 ·

    新框架为量子联邦学习的 ansatz 结构实现个性化

    研究人员推出了一种新颖的个性化量子联邦学习框架 PAS-QFL,旨在解决客户端之间数据异构性问题。与先前假设所有参与者采用统一 ansatz 结构的方法不同,PAS-QFL 允许每个客户端拥有个性化的 ansatz 结构。这种方法旨在通过适应多样化的本地数据分布,特别是在类别不平衡的情况下,来提高训练量子神经网络的稳定性和公平性。

  7. TOOL · CL_167771 ·

    新的CrossSpine框架提升了腰椎间盘退变自动分级的性能

    研究人员开发了一个名为CrossSpine的新框架,以改进腰椎间盘退变的自动分级。这种新颖的架构利用跨序列注意力机制,有效地融合了来自不同MRI序列、跨越多个空间尺度的特征。此外,该框架还采用了一种感知椎间盘(IVD-aware)的分类技术,该技术利用解剖学上的椎间盘水平信息来学习每个水平特有的退变先验。实验表明,CrossSpine显著优于基线模型,在Macro F1分数上提高了125%以上,并在AUPRC和AUROC方面取得了显著的提升。

  8. RESEARCH · CL_167377 ·

    研究发现:事实核查基准存在“污染”缺陷 · 已追踪2个来源

    一篇新的研究论文对评估多模态自动事实核查(MAFC)系统的现有基准的有效性提出了质疑。研究表明,即使是使用在大型语言模型(LLM)知识截止日期之后发布的声明的动态基准,仍然存在污染问题。这种污染,即声明可以通过预先存在的知识进行验证,可以将性能指标最多提高11.34个Macro-F1点,并扭曲系统排名。研究人员提出了更值得信赖的MAFC评估的实用指南。

  9. TOOL · CL_154619 ·

    AI框架利用骨架数据增强从身体运动中识别情感的能力

    研究人员开发了一个新颖的框架,用于利用骨架数据从身体运动中识别情感。该方法结合了多个分支,包括一个基于6D旋转的分支、一个部分感知的动力学多流分支以及一个元数据条件弱标签分布学习分支。在MMAC ACII 2026挑战赛的DIEM-A任务中,该系统通过利用细微的动态和关系运动线索,取得了比基线更高的准确率和Macro-F1分数。

  10. TOOL · CL_141337 ·

    新框架检测大语言模型(LLM)代理技能中的不对齐现象

    研究人员开发了一个名为渐进式加载感知分层对比学习(PL-HCL)的新框架,用于检测大语言模型(LLM)代理技能的描述与其实际行为之间的一致性。该方法模拟了代理技能的分层结构,并学习跨层一致性以识别不对齐。在使用大型开源技能语料库进行的评估中,PL-HCL 显著提高了检测准确率,宏观 F1 分数达到 0.87-0.89,远高于基线分数约 0.45。该框架旨在作为用户和操作员的筛选工具,并为识别分层数字制品中的差异提供设计原则。

  11. TOOL · CL_128704 ·

    法律AI模型利用预测结果的“捷径学习”线索

    一篇新发表在arXiv上的论文,在英国就业法庭的背景下,调查了法律判决预测(LJP)模型中的捷径学习。研究人员发现,当前基于事后司法材料训练的LJP模型,并非通过真正的预测,而是通过利用揭示结果的语言线索来获得高预测性能。研究表明,一个仅在已识别的4%泄露特征上训练的模型就能超越人类专家,这凸显了LJP系统中预测性能指标被夸大的担忧。然而,该论文提出,这种漏洞并非不可克服,因为即使在移除这些揭示结果的伪影后,模型仍然保留了预测能力。

  12. RESEARCH · CL_107833 ·

    新的QC-SMOTE方法提高了不平衡分类的准确性

    研究人员开发了QC-SMOTE,一种新颖的过采样框架,旨在提高不平衡数据集上的分类准确性。该方法通过结合一种质量控制方法来解决生成低质量合成样本的问题,该方法根据局部密度、安全级别以及与多数类的隔离度来评估样本的可靠性。在30个数据集上的实验表明,QC-SMOTE优于现有的过采样技术,在具有中度至严重类别不平衡的情况下,取得了更高的AUC-ROC和Macro F1分数。