实体
McNemar's test
McNemar's test
PulseAugur coverage of McNemar's test — every cluster mentioning McNemar's test across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新框架整合AI用于工业缺陷检测和报告
一篇新研究论文介绍RobustDefect-LLM,一个整合深度学习与决策支持和AI辅助报告的工业表面缺陷分类框架。该系统使用四个卷积神经网络,其中MobileNetV3-Large在NEU-DET数据集上达到了99.26%的最高准确率。虽然在名义条件下鲁棒,但模型在严重图像退化下的准确率显著下降。该框架包含一个针对低置信度预测的人工审查系统,并生成通过确定性一致性检查的报告。
-
为孟加拉国开发了新的基于蛋白质的鱼类鉴定方法
研究人员开发了一种使用蛋白质序列鉴定孟加拉国鱼类物种的新方法。他们创建了一个包含九种孟加拉国本土鱼类蛋白质序列的数据集,并评估了几种机器学习架构。他们提出的混合模型 MotifCNN-Transformer+TA-PE 达到了 79.80% 的准确率,并且比微调后的 ProtBERT 模型速度更快、体积更小,使其在资源受限的环境中更具实用性。
-
LLM 裁判评估需要数百个标签才能获得可靠结果
最近一篇文章强调了在使用 LLM 作为 AI 模型评估裁判时,需要更大的评估数据集。作者解释说,使用小型临时数据集的常见做法不足以实现可靠的校准。为了使具有中等一致性(Cohen's kappa 为 0.4-0.6)的 LLM 裁判达到 0.10 的 95% 置信区间,大约需要 200-400 个配对标签,这远多于许多团队通常使用的 50 个标签。文章提供了计算这些需求和执行裁判之间统计比较的数学推理和代码示例。