ImageNet
PulseAugur coverage of ImageNet — every cluster mentioning ImageNet across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
专家警告:AI预算掩盖了数据清理成本
企业级AI项目往往会暴露巨大的潜在数据债务,其中AI模型本身只是一个可见的项目,掩盖了数据清理和修复的真实成本。研究表明,周围的数据基础设施、配置和监控对持续的维护成本贡献巨大。基准测试中被污染的地面真实性、多维度数据质量问题以及语言模型训练语料库中的重复数据等问题,都会导致AI项目失败和性能下降。
-
新的PVD技术提升图像生成速度和质量
研究人员开发了一种名为“分阶段速度蒸馏”(PVD)的新技术,以提高图像生成模型的效率和质量。PVD将生成过程分为两个阶段,每个阶段由一个专门的、半尺寸的专家模型处理,两者共同承担单个全尺寸模型的计算成本。这种方法在保持或提高输出质量的同时,实现了更快的生成速度和更低的VRAM占用,在ImageNet等基准测试以及使用Stable Diffusion 3.5-Medium、FLUX.1-dev和Qwen-Image等模型的文本到图像任务…
-
REViT-v2:新的等变视觉Transformer可扩展至数百万参数
研究人员推出REViT-v2,这是一种新颖的视觉Transformer架构,专为等变特征提取而设计。该模型利用窗口化群卷积自注意力机制和分层特征设计,使其能够有效地扩展到数百万参数和ImageNet等大型数据集。REViT-v2的相应代码和预训练权重已公开提供。
-
新的ATLAS框架可高效发现AI模型的对抗性输入集
研究人员开发了ATLAS(自适应信任区域用于潜在对抗性搜索),一个新颖的基于查询的框架,旨在高效地发现可能导致黑盒学习系统失败的对抗性输入集。ATLAS将攻击生成构建为主动学习的水平集估计问题,结合了校准近似和局部-全局采样架构,以识别包含对抗性示例的输入空间区域。该方法旨在构建代表性的对抗性集合,准确反映目标模型的鲁棒性,在MNIST、CIFAR和ImageNet等标准和对抗性训练模型上优于现有的基于查询的黑盒攻击。
-
新的FID估算方法有望改进生成模型评估
研究人员开发了改进Fréchet Inception Distance (FID)估算的新方法,FID是评估生成模型的常用指标。该研究为经验插件估计量建立了严格的界限,揭示了大约$d^2$的样本复杂度。为解决此问题,他们提出了一种任意阶数的推断方法,并引入了相对泰勒去偏(RTD),这是一种计算效率高且样本复杂度达到最优$O(d / \epsilon^2)$的算法。实验表明,RTD在ImageNet上使用标准样本预算时可实现更低的估算误…
-
新的DDT-RFE方法增强了用于图像任务的扩散模型
研究人员开发了一种名为DDT-RFE的新方法,通过修改解耦扩散Transformer (DDT) 来改进扩散模型。该方法消除了编码器块中的残差连接,实现了更渐进的特征抽象。通过融合输入块嵌入与中间和最终编码器特征,解码器可以访问多深度信息,从而在各种视觉理解任务上提高性能,并在ImageNet上提高图像生成质量。
-
新的优化器KO通过动力学理论增强神经网络精度
研究人员推出了一种新颖的神经网络优化模块KO(Kinetics-inspired Optimizer),该模块从动力学理论和偏微分方程中汲取灵感。这个即插即用的模块通过源自玻尔兹曼输运方程的随机相互作用来增强标准的梯度更新,旨在提高参数多样性并防止权重凝结,从而可能降低泛化能力。在CIFAR-10/100和ImageNet等图像分类基准以及大规模语言模型预训练上的理论分析和实验结果表明,与现有方法相比,KO在计算开销极小的情况下提高了准确性。
-
紧凑型机器人策略通过细粒度的视觉表示实现高性能
研究人员开发了CoRP,这是一种紧凑型机器人策略,其参数数量远少于现有系统,但性能却很高。研究强调,多任务操作策略的有效性在很大程度上取决于视觉表示,而不是参数规模或生成先验。CoRP证明,预训练、任务适应和压缩的表示对于紧凑型策略至关重要,在LIBERO和RoboTwin 2.0等基准测试中表现优于规模大得多的模型。
-
新框架可从数据统计预测机器学习模型性能
研究人员开发了新的理论框架来预测机器学习模型的性能。第一种方法,即 Hermite 特征结构 ansatz (HEA),利用原始数据统计来预测核回归的学习曲线,即使是在 ImageNet 等真实世界图像数据集上也是如此。第二个系统 Seer 采用最大似然回归来模拟分类学习性能,预测达到所需准确率所需的训练示例以及可达到的最大准确率。
-
AI研究探索高效的测试时特征获取和引导式生成
两篇新研究论文探讨了优化AI模型性能和数据利用的新方法。第一篇,ECHO-k,引入了一种自监督学习原则,用于在测试时获取信息性模态,旨在降低成本并提高下游任务未知时的效率。第二篇,REPA-G,提出了一个使用表示对齐特征的扩散模型测试时条件框架,在无需额外训练的情况下提供对图像生成更精确的控制。
-
新的“视界损失”方法通过交叉熵提高了分类器精度
一篇新研究论文介绍了一种名为“视界损失”(horizon loss)的新方法,作为训练分类器的交叉熵替代方案,特别是在强化学习和大型语言模型的背景下。该方法旨在通过考虑学习更新的长期影响,而非仅仅是即时收益,来提高准确性。在MNIST和ImageNet数据集上使用ResNet和ViT等各种架构进行的实验表明,与标准的交叉熵相比,其Top-1准确率有所提高,并且在存在噪声标签的情况下,收益会增加。
-
ResNets 通过改变残差交互专家来隐式路由
一篇新的研究论文探讨了残差网络(ResNets)的内部工作机制,提出它们隐式地执行一种软路由。通过分析在 ImageNet 上训练的 ResNet-18 和 ResNet-34 模型,研究发现虽然所有网络块都会为每个输入执行,但这些块之间的特定交互会根据输入和预测类别而变化。这表明不同的输入利用网络内不同的“专家”交互,即使没有显式的路由机制。
-
新理论解释并缓解了AI架构中的表征坍塌问题
研究人员开发了一个新的理论框架,用于理解和缓解联合嵌入预测架构(JEPAs)中的表征坍塌问题。通过分析早期训练过程中的梯度流,他们识别出影响稳定性的驱动和衰减的竞争效应。该分析促成了ResidualPred的引入,这是一种Transformer预测器,在各种基准测试和I-JEPA预训练中提高了下游准确性。
-
新的谱引导方法提升AI图像生成质量
研究人员开发了一种名为谱校正引导的新方法,以提高扩散模型中图像生成的质量。该技术分析采样过程中中间状态的光谱对齐情况,以确保与预期的前向过程一致。通过校正与解析参考光谱的偏差,该方法在无需重新训练模型的情况下提高了对齐度和视觉保真度。在文本到图像生成和ImageNet数据集上的实验表明,即使使用更少的去噪步骤,其性能也显著优于现有的引导方法。
-
循环流变换器 (LiFT) 引入新颖的生成模型架构
研究人员引入了循环流变换器 (LiFT),这是一类新颖的生成模型。LiFT 通过重复应用共享的扩散变换器 (DiT) 核心并进行最小的架构更改来扩展计算。循环中的每一步都用单个回归目标进行训练,允许模型在不重新训练的情况下循环超出其训练深度。这种方法提高了生成质量,并允许在不增加参数的情况下增加推理计算。在 256x256 分辨率的 ImageNet 上,LiFT-L/2 在参数量和训练/推理 FLOPs 显著减少的情况下,取得了比密…
-
李飞飞将领导AMD的AI芯片开发,直接向首席执行官苏姿丰汇报
李飞飞,一位以ImageNet闻名的知名研究员,已加入AMD。她将直接向AMD首席执行官苏姿丰汇报,并专注于开发物理AI应用的芯片。此举被视为塑造AI硬件未来的重要一步。
-
新的CLEAR方法提高了证据深度学习的鲁棒性
研究人员开发了CLEAR,这是一种旨在增强证据深度学习模型鲁棒性的新型事后方法。该技术通过分析使用校准数据的模型潜在空间来改进不确定性量化。在推理时,CLEAR在潜在空间中生成扰动视图并测量它们的冲突,利用高冲突来降低不受支持输入的证据强度,同时保留一致输入的证据强度。CLEAR在ImageNet到CUB等基准测试中,在分布外准确性和对抗性准确性方面均显示出显著的改进,同时速度也比现有方法快得多。
-
新论文提出机器学习模型基准测试的有效性理论
一篇新论文提出了一种通过改编心理学有效性理论来评估机器学习模型的框架。作者(包括 Timo Freiesleben)引入了明确的有效性条件,以阐明基准分数背后的假设。对 ImageNet 和 Fragile Families Challenge 的案例研究表明,这些条件如何支持对机器学习研究进展和可预测性极限的推断。
-
研究论文质疑AI分布外检测的增益膨胀问题
一篇新发表在arXiv上的研究论文质疑了计算机视觉领域中分布外(OOD)检测方法所报告的膨胀增益的有效性。该研究认为,许多OOD检测器并非真正识别新颖数据,而是识别用于拟合的特定数据集的身份。研究人员通过保留整个OOD数据集而非仅样本,证明了这一点,揭示了大多数报告的增益是由于数据集身份,而非真正的imerick 检测。该论文提出了一个封闭形式的解决方案来计算这种膨胀,并建议仅在指定的验证数据集上进行简单的常数拟合仍然是可靠的。
-
新的NEPA方法增强了扩散Transformer中的图像生成
研究人员开发了一种名为下一嵌入预测自回归(NEPA)的新方法,用于使用扩散Transformer进行图像生成。该方法训练Transformer按顺序预测连续嵌入,从而在去噪过程中动态调整条件信号。在ImageNet上的实验表明,采用该技术的NEPA-DiT-XL模型在训练计算量显著低于先前方法的情况下,取得了具有竞争力的FID分数。