McNemar's test
PulseAugur coverage of McNemar's test — every cluster mentioning McNemar's test across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
ShopEase框架使用LLaMA 3.2支持企业客户
一篇新的研究论文介绍了ShopEase,一个专为智能企业客户支持设计的 多智能体框架。该系统集成了六个组件,包括意图识别、CRM交互、内存管理、 混合检索增强生成(RAG)模块、升级能力和主管。ShopEase使用LLaMA 3.2进行响应 生成,通过Ollama在本地运行。检索系统使用各种配置进行了测试,结合了FAISS (密集检索)和BM25(稀疏检索),其中仅使用FAISS的准确率最高,达到85.37%。 研究发现,密集检索效果…
-
研究揭示机器嗅觉描述语料库的局限性
一项新的研究论文探讨了汇集的公共描述语料库在机器嗅觉方面的局限性,发现来源之间在描述语应用和广度上存在显著分歧。研究强调,即使有先进的分子描述符和广泛的标记,衡量某些嗅觉特性(如效价)的能力也受到严重限制。研究表明,效价(衡量愉悦度的指标)必须直接测量,因为它无法从现有的描述符数据中可靠推断出来。
-
新框架整合AI用于工业缺陷检测和报告
一篇新研究论文介绍RobustDefect-LLM,一个整合深度学习与决策支持和AI辅助报告的工业表面缺陷分类框架。该系统使用四个卷积神经网络,其中MobileNetV3-Large在NEU-DET数据集上达到了99.26%的最高准确率。虽然在名义条件下鲁棒,但模型在严重图像退化下的准确率显著下降。该框架包含一个针对低置信度预测的人工审查系统,并生成通过确定性一致性检查的报告。
-
为孟加拉国开发了新的基于蛋白质的鱼类鉴定方法
研究人员开发了一种使用蛋白质序列鉴定孟加拉国鱼类物种的新方法。他们创建了一个包含九种孟加拉国本土鱼类蛋白质序列的数据集,并评估了几种机器学习架构。他们提出的混合模型 MotifCNN-Transformer+TA-PE 达到了 79.80% 的准确率,并且比微调后的 ProtBERT 模型速度更快、体积更小,使其在资源受限的环境中更具实用性。
-
LLM 裁判评估需要数百个标签才能获得可靠结果
最近一篇文章强调了在使用 LLM 作为 AI 模型评估裁判时,需要更大的评估数据集。作者解释说,使用小型临时数据集的常见做法不足以实现可靠的校准。为了使具有中等一致性(Cohen's kappa 为 0.4-0.6)的 LLM 裁判达到 0.10 的 95% 置信区间,大约需要 200-400 个配对标签,这远多于许多团队通常使用的 50 个标签。文章提供了计算这些需求和执行裁判之间统计比较的数学推理和代码示例。