residual neural network
PulseAugur coverage of residual neural network — every cluster mentioning residual neural network across labs, papers, and developer communities, ranked by signal.
- instance of ScienceCast 90%
- instance of alphaXiv 90%
- instance of VideoGameGeek 90%
- instance of Gotit.pub 90%
- instance of Deep Neural Networks 90%
- instance of Vgg Neural Network 70%
- used by alphaXiv 70%
- used by Gotit.pub 70%
- instance of DagsHub 70%
- competes with Vgg Neural Network 70%
- used by EfficientNet 70%
- instance of Data Efficient Image Transformers 70%
17 天有情绪数据
-
ResNet 作者任少卿推出具身智能初创公司,估值达 10 亿美元
知名人工智能科学家、ResNet 作者任少卿已创立一家专注于具身智能和人工智能基础模型的新公司。尽管开启了这项新事业,任少卿将继续担任蔚来(NIO)的沈副总裁兼智能驾驶负责人。蔚来已提供战略投资,并计划与任少卿的新公司合作。该公司据称已获得超过 10 亿美元的估值,表明其在注册时即已达到独角兽地位。此举符合蔚来在人工智能和机器人领域的战略重点,并利用了其在智能驾驶开发中获得的专业技术。
-
BiaPy 框架应对生物图像深度学习挑战
标准的计算机视觉技术不足以应对生物图像深度学习的复杂性,这涉及到处理海量、多维数据集,并具有各向异性分辨率和细胞堆积等独特挑战。BiaPy 框架被提出作为一种解决方案,通过专门的架构来解决这些问题,包括各向异性池化、具有高斯混合的无伪影重叠分块,以及用于分离拥挤细胞的多任务向量表示。这种方法使得在传统工具无法应对的生物图像数据上进行有效的深度学习成为可能。
-
研究探讨样条函数编码在表格深度学习中的应用
一篇新的研究论文探讨了各种基于样条函数的数值编码在表格深度学习任务中的有效性。该研究由Manish Kumar领导,调查了B样条、M样条和I样条的均匀、基于分位数、目标感知和可学习节点放置策略。结果表明,最佳编码取决于具体的任务、数据集和使用的神经网络架构,其中分段线性编码在分类任务中表现稳健,在回归任务中表现各异。
-
新框架允许神经网络通过自我实验进行学习
研究人员引入了自我干预学习(SIL),一个新颖的框架,其中神经网络主动扰动自身结构以学习预测性自我模型。这种方法允许系统观察其内部变化的后果,泛化这些知识,并利用预测来指导未来的结构修改。虽然SIL在合成环境中通过恢复关键网络结构和提高预测准确性方面取得了成功,但其在CIFAR-10与ResNets等现实任务中的应用结果喜忧参半。学习到的自我模型并不总是优于更简单的直接经验策略,这表明尽管SIL为网络内部理解提供了一个有前景的方向,但…
-
新方法揭示视觉模型中的空间捷径模式
研究人员开发了一种新方法,通过将每张图像的贡献图分组为重复的空间模式,来识别和表征视觉模型中的捷径学习。该方法利用 K-means 和非负矩阵分解,揭示了在各种数据集和模型架构(如 ResNet 和 ViT)中,捷径和任务贡献的共享和不同空间模式。发现的捷径组能够针对性地检查错误率较高的图像子集,而抑制捷径贡献的干预措施会显著降低模型性能,这表明结合抑制和放大方法可以减少性能差异。
-
新的 arXiv 论文探讨神经网络计算与学习之间的断开
两篇新的 arXiv 论文探讨了神经计算的动力学,重点关注复杂的前向计算与更简单的学习机制之间的分歧。第一篇论文引入了一个“生成-事实图”来统一训练、学习和推理,并展示了一个使用 nanoGPT 和 ResNet 在保留运行中具有高准确率的预测模型。第二篇论文识别出一种“前向-后向断开”,指出虽然神经网络中的前向计算已高度多样化,但学习方法在很大程度上仍围绕反向传播及其变体。两篇论文都表明需要更好地协调这些方面,以实现更具生物学基础和…
-
新的双流形几何方法增强深度学习表征
研究人员提出了一种新颖的双流形视角用于深度表征学习,重点关注网络参数内的几何结构。该方法提出了一种核引导特征变换(KGFT)模块,它利用卷积滤波器的几何结构来指导特征表征的演变。KGFT通过将几何信息从核流形传递到数据流形,显式地重塑特征关系,从而在不施加过多约束的情况下增强表征学习。在ResNet、ViT和LLaMA-7B等各种架构上的实验表明,在图像分类和算术推理任务上取得了持续的改进,证明了该方法的通用性和有效性。
-
新的ARMDIL系统使用MLLM来提升跨数据集图像分类能力
研究人员推出ARMDIL,一个旨在提高跨不同数据集图像分类能力的新型系统。ARMDIL利用多模态大语言模型(MLLM)智能地将图像路由到异构集合中最合适的视觉骨干网络。该集合包括各种架构,如ResNets、自监督学习模型和视觉语言模型,所有这些模型都在源自具有不同特征的多个数据集的统一标签空间上进行训练。该系统展示了增强的适应性和可解释性,为AI助手和自主机器人等应用的更可靠的通用视觉系统提供了途径。
-
软注意力机制提升了深度神经网络中皮肤癌的分类能力
研究人员已经证明,将软注意力机制纳入深度神经网络架构可以显著提高其在皮肤病变分类方面的性能。通过使网络能够专注于关键图像特征并抑制噪声,这种方法在VGG、ResNet、InceptionResNetv2和DenseNet等各种既有模型上都带来了性能提升。具体而言,在HAM10000数据集上,改进后的模型实现了显著的精度提升;在ISIC-2017数据集上,则获得了更好的敏感度得分。
-
VGG16在十种CNN中引领MRI扫描阿尔茨海默病检测
研究人员对十种不同的卷积神经网络(CNN)架构进行了基准测试,用于从单视图MRI扫描中检测阿尔茨海默病。该研究在OASIS数据集的一个子集上使用了迁移学习和微调流程,该子集包含来自86,437次扫描的3,900张图像。VGG16取得了最高的验证准确率0.9637和测试准确率0.9533。所有测试架构都面临一个持续的挑战,即区分非痴呆和非常轻度痴呆阶段。
-
新的高斯增强方法提高了胰腺癌风险分层
研究人员开发了一种名为cUPMI的新技术,该技术使用高斯增强来改进导管内乳头状黏液瘤(IPMNs,胰腺癌的前兆)的风险分层。该方法提高了集成堆叠组合器的性能,特别是对于XGBoost等更高容量的模型,从而提高了预测发育不良风险的准确性。研究发现,虽然cUPMI对简单的逻辑回归模型带来的收益有限,但它持续改进了基于树的组合器,并在融合放射组学和2.5D CNN流时取得了最强的整体性能。
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
ZeroPur 方法提供无训练对抗性净化
研究人员推出了一种新颖的对抗性净化方法 ZeroPur,该方法无需额外训练。该技术将对抗性图像视为自然图像流形中的异常值,并通过将其投影回该流形来净化它们。ZeroPur 分为两个步骤:引导偏移以找到偏移的嵌入,以及自适应投影以创建用于投影的方向向量。在 CIFAR-10、CIFAR-100 和 ImageNet-1K 数据集上使用各种分类器架构进行的实验证明了其最先进的鲁棒性能。
-
大脑核磁共振基础模型主要编码采集位点,而非解剖结构
研究人员发现,当冷冻基础模型用于表示大脑核磁共振数据时,它们主要编码核磁共振采集的位点,而不是解剖或临床信息。这种效应在不同的队列、编码器和网络深度中都有观察到,即使是从随机初始化的模型或原始图像中,位点信息也高度可解码。虽然 ComBat 等方法可以去除这种位点指纹,但代价是会在共享子空间中将位点和解剖信息纠缠在一起。该研究建议对基础模型进行位点归因审计,并为此提供了一个开放的工具包。
-
深度学习模型用于乳腺癌检测的性能和排放基准测试
一篇新论文对七种用于乳腺癌检测的深度学习模型进行了基准测试,评估了它们的性能和环境影响。研究发现,虽然EfficientNet和ResNet提供了高准确率,但它们也产生了更高的二氧化碳排放。DeiT-Tiny、ViT和Swin Transformer等Transformer模型取得了有竞争力的结果,其中DeiT-Tiny在一个数据集上提供了准确率和能源效率的良好平衡,而ViT和Swin在另一个数据集上表现出色。研究强调,在选择医学应用…
-
现代骨干网络提升AI在乳腺摄影分类和病灶定位方面的能力
研究人员探索在多任务DETR框架中使用现代神经网络骨干网络,以增强乳腺摄影分类和病灶定位。研究发现,像ConvNeXtV2和DINOv3这样的先进骨干网络,其性能显著优于旧的残差神经网络架构。ConvNeXtV2在OPTIMAM数据集上表现出特别强的性能,而DINOv3在SGM1k队列上取得了最佳结果,这表明骨干网络质量在多任务乳腺摄影应用中的关键作用。
-
字节跳动发布SeedRealtime,统一的视听大模型
字节跳动推出了SeedRealtime,这是一款新颖的视听全双工大语言模型,将音频、视频和文本处理整合到一个统一的架构中。该模型旨在通过并行处理感知、理解和表达,而不是依赖顺序模块,来实现更自然、实时的多模态交互。虽然SeedRealtime目前已集成到字节跳动的豆包应用中,但没有公开的技术报告、参数数量或开放权重,限制了第三方直接集成。
-
新的元学习方法优化AI模型训练计划
研究人员开发了一种新颖的元学习方法,将优化过程视为一个动力学系统来生成最优学习率计划。该方法利用超参数搜索的训练运行来学习训练动力学的潜在表示,使其能够预测产生最佳长期验证性能的未来学习率计划。所提出的调度器展示了超越观察到的训练动力学的泛化能力,创建了在各种图像分类和下一个词预测任务中优于标准参数函数和基线的专用计划。使用此方法训练的模型由于位于损失景观的更平坦区域而表现出更好的泛化能力。
-
新的APQF框架通过LLM引导自动化AI模型压缩
研究人员开发了APQF,这是一个旨在优化深度神经网络在边缘设备上效率的自动化框架。该系统采用一种代理方法,由LLM规划器和剖析数据引导,以逐层确定最佳的结构化剪枝和混合精度量化策略。APQF旨在显著降低计算成本,同时保持高精度,在多个数据集上的各种视觉模型上展示了位运算的大幅减少。
-
新的IPPRO框架提供尺度不变的神经网络剪枝
研究人员推出了一种新颖的神经网络压缩框架IPPRO,该框架解决了基于幅度的剪枝的局限性。通过利用投影几何,IPPRO定义了一个尺度不变的“PROscore”,能够准确地捕捉滤波器重要性。该方法在包括CNN、Vision Transformers和LLaMA等LLM在内的各种架构上都展现出卓越的性能,尤其是在高压缩率下且无需微调的情况下。