Classification
PulseAugur coverage of Classification — every cluster mentioning Classification across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的“视界损失”方法通过交叉熵提高了分类器精度
一篇新研究论文介绍了一种名为“视界损失”(horizon loss)的新方法,作为训练分类器的交叉熵替代方案,特别是在强化学习和大型语言模型的背景下。该方法旨在通过考虑学习更新的长期影响,而非仅仅是即时收益,来提高准确性。在MNIST和ImageNet数据集上使用ResNet和ViT等各种架构进行的实验表明,与标准的交叉熵相比,其Top-1准确率有所提高,并且在存在噪声标签的情况下,收益会增加。
-
新研究探索自监督学习在公平性、效率和多样化输出方面的应用
多篇研究论文探讨了自监督学习(SSL)的进展,这是一种在无标签数据上训练模型的技术。其中一项研究FairSSL,通过利用数据异质性和主题感知正则化,引入了一个框架来提高多模态SSL的公平性。另一篇论文研究了增加网络宽度如何使贪婪的逐层训练在SSL中能与端到端反向传播相媲美,尤其是在更宽的网络中。进一步的研究深入探讨了哪些下游任务最能从SSL中受益,发现它在异常检测和分类方面有效,但在预测方面效果不佳。此外,一种名为DRY-SFT的新方…
-
多代理AI系统与单代理相比未显示出性能提升
一项将单个AI代理与多代理系统进行客户支持任务比较的实验显示,在安全性、意图准确性和事实依据性等关键指标上,两者性能没有显著差异。尽管将复杂性从一个代理增加到五个,增加了代码量和额外的协调环节,但评估套件对两个版本的评分完全相同。研究得出结论,分割调用者并未改变系统的确定性边界提供的核心功能或保证,这表明对于此特定应用,多代理方法的额外复杂性并未带来切实的益处。
-
新理论详述长程依赖数据的机器学习
一篇新研究论文介绍了一种精确的学习理论,用于在具有长程依赖性的数据上,使用加权经验风险最小化训练的平滑参数模型。该研究关注具有规则变化样本权重的平稳高斯序列,详细说明了学习过程如何收敛以及学习轨迹的几何形状。研究结果通过时间序列预测和分类的示例进行了说明。
-
AgentSelfEdit 工具在泛化超出表面提示编辑方面遇到困难
开源工具 AgentSelfEdit 旨在根据执行反馈重写自己的系统提示,但在各种任务中表现出持续的失败模式。初步测试集中在分类问题上,但对提取、生成和混合领域语料库的进一步评估表明,该工具的弱点并非特定于分类。在这些领域中,AgentSelfEdit 倾向于提出局部措辞调整,这些调整只能带来微小的改进,有时甚至会降低性能,这表明其搜索策略较浅,难以泛化超出表面编辑的范围。
-
Node.js Webhook 使用幂等性栅栏进行 LLM JSON 记录去重
本文详细介绍了一种在 Node.js Webhook 中确保处理 LLM 生成的 JSON 记录(特别是审核报告)的幂等性的方法。它提出了一种涉及接受具有稳定身份密钥的原始报告、使用 LLM 对其进行分类,然后提交分类的三步流程。每个步骤都设计为可独立重试,即使在阶段之间发生故障也能防止重复记录。这种方法关键在于为每个审核报告建立一个持久、不可变的身份,该身份源自租户 ID 和源报告 ID 等稳定字段,而不是依赖于队列消息 ID 等瞬态标识符。
-
新方法用语音令牌增强语言模型以用于分类任务
研究人员开发了一种新颖的方法,将语音令牌集成到预训练语言模型中用于分类任务。该方法通过采用基于套索的特征选择来识别最相关的音频令牌,从而解决了长音频序列与文本融合的挑战。经过自监督目标微调的适应性语言模型,在论证谬误检测和情感计算等任务上表现出改进的性能,优于单一模态模型和其他语音集成技术。
-
新的分析方法通过音素声学识别歌唱音乐中的语言
研究人员开发了一种名为音素条件分析的新方法,用于研究不同语言声乐的声学差异。该技术通过比较同一首歌曲内的音节,控制歌手、旋律和流派等因素,来分离特定音素的影响。研究发现,这些音位结构在歌唱语言中留下了可衡量的痕迹,能够以85.5%的准确率准确分类歌曲的语言。
-
研究人员建议不要在机器学习中使用高斯核
最近的一篇论文认为,在回归和分类等机器学习任务中不应广泛使用高斯核。作者认为,这种核(也称为平方指数核或径向基函数核)会导致条件方差不切实际地小,从而导致预测不确定性过度自信。此外,这种平滑性会导致数值病态,在实际应用中需要引入金块项等变通方法。该论文广泛建议由于这些问题而避免使用解析核。
-
UltraPIPS 库利用领域特定模型增强 B 模式超声图像分析
研究人员开发了 UltraPIPS,这是一个专门为 B 模式超声数据设计的新型感知图像相似性度量库。与在自然图像上训练的模型不同,UltraPIPS 利用了在超声影像上微调的基础模型,这能更好地捕捉该医学成像模态的独特特征。实验表明,UltraPIPS 度量与下游任务(如分类和重建)的性能相关性更强,并在用于损失优化时能提高图像质量和真实感。
-
端侧小型语言模型获得关注,减少对云API的依赖
用于AI驱动的应用程序的大型云端语言模型的默认架构正转向用于特定任务的端侧小型语言模型。这一趋势是由小型模型能力的提高所驱动的,它们现在可以在本地设备上高效地处理分类、提取和摘要等任务。这种方法在降低延迟、降低成本、增强隐私和离线功能方面提供了显著的好处,同时仍然允许在需要复杂推理或广泛知识的任务中升级到更大的云模型。
-
PerFact方法通过事实提示改进3D脑部MRI报告生成
研究人员开发了一种名为PerFact的新方法,用于从3D脑部MRI扫描生成报告。与以往侧重于改进视觉语言模型本身的方法不同,PerFact强调了提示信息的重要性。通过使用上游3D分割和分类提取结构化事实,PerFact调整视觉语言模型以生成更准确有效的报告。这种方法表明,信息基础(而非模型架构或大小)是提高复杂医学影像报告质量的主要因素。
-
LLM 与嵌入模型:新研究发现代价高昂的均等性
一篇题为《嵌入器的困境》的新论文比较了大型语言模型(LLM)与专用嵌入模型在各种任务上的性能和成本。研究发现,虽然像 Gemini 3.1 Pro 这样的 LLM 在平均表现上与顶级嵌入模型相当,但它们的成本却高得多,速度也慢得多。LLM 在推理密集型检索任务上表现出色,而嵌入模型更适合分类任务,两种范式在聚类和语义文本相似性方面的表现相似。
-
新论文为AGI发展定义智能
一篇新论文提出了一个正式的智能定义,称为“\(\varepsilon\)-概念智能”,以指导通用人工智能(AGI)的发展。该定义的核心是“实体保真度”,认为智能是生成能够体现某个概念的实体的能力,这些实体在给定的容差\(\varepsilon\)范围内与原始示例无法区分。该框架旨在提供一个不依赖于物种的评估标准,适用于各种智能行为,包括强化学习、生成模型和目标导向的决策制定,并对AGI安全和泛化能力产生影响。
-
LLM 使用严格的 JSON Schema 进行可靠的支持票证分类
开发人员正在使用带有严格 JSON Schema 的大型语言模型 (LLM) 来分类支持票证,确保输出结构化且可靠。这种方法包括为类别、标签和紧急程度等票证属性定义精确的 Schema,LLM 必须遵守。该过程包括仔细的模型选择、成本估算以及针对标记数据的验证,以保持准确性并防止错误分类。此方法旨在使 LLM 功能专注于分类,而传统的代码处理路由和策略执行,从而确保系统稳定且可预测。
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…
-
新研究探讨大型语言模型跨语言对齐在分类和翻译中的应用
一篇新的arXiv论文研究了跨语言对齐(CLA)分数在多大程度上可以预测大型语言模型(LLMs)在分类和机器翻译任务上的表现。该研究比较了27种CLA分数变体,并引入了一种新的基于PMI的翻译指标来评估不同语言的翻译质量。研究结果表明,与英语的对齐是性能的有力预测指标,这表明大型语言模型可能将英语作为内部枢纽语言。
-
语义分割:计算机视觉中的像素级理解
语义分割是一种计算机视觉技术,它为图像中的每个像素分配一个特定的类别标签。这个过程使模型能够创建详细的地图,在像素级别区分道路、人或缺陷等元素,这对于自动驾驶和医学成像等应用至关重要。与分类或对象检测不同,语义分割通过分析每个单独的像素来提供更精细级别的理解。
-
新基准测试‘Lethe’用于医学影像联邦学习遗忘
研究人员推出了 Lethe,这是一个旨在评估联邦学习遗忘方法在医学影像应用中表现的新基准测试。现有的遗忘技术主要在自然图像上进行测试,可能无法有效迁移到临床数据的独特特征上。Lethe 在八个任务家族中评估了十二种不同的方法,包括分类、分割和视觉-语言问答,并具有不同程度的遗忘粒度。基准测试结果表明,遗忘请求的难度,而不是方法本身,是主要区分因素,只有困难的删除才能显著区分方法的性能。
-
新理论定义并衡量机器学习算法中的“遗忘”
研究人员提出了一个新的理论框架来理解和量化机器学习算法中的“遗忘”。该理论将遗忘定义为学习者预测分布的自我不一致性,导致预测信息的丢失。所提出的度量方法可应用于各种机器学习任务,包括分类、回归、生成模型和强化学习。跨领域实验表明,遗忘是深度学习中普遍存在的问题,影响学习效率。