multilayer perceptron
PulseAugur coverage of multilayer perceptron — every cluster mentioning multilayer perceptron across labs, papers, and developer communities, ranked by signal.
- used by Gotit.pub 70%
- instance of Gotit.pub 70%
- used by Influence Flower 70%
- instance of IArxiv Recommender 70%
- used by magnetic resonance imaging 70%
- used by IArxiv 70%
- instance of CatalyzeX Code Finder for Papers 70%
- instance of IArxiv 70%
- instance of grokking 70%
- competes with Diffusion Transformer 70%
- used by AlphaEarth 70%
- instance of PatchTST 70%
17 天有情绪数据
-
基于空间重叠的高光谱图像分类易受数据泄露影响
一篇新的研究论文强调了高光谱图像分类中的一个关键问题:由基于块的采样中的空间重叠引起的数据泄露。当训练和测试数据来自同一图像,而未考虑空间邻近性时,性能指标可能会显著膨胀。在Pavia University数据集上使用包括3D-CNN和ViT在内的各种模型进行的实验表明,当正确处理空间采样时,这种泄露会导致准确率下降超过40个百分点。研究还发现,增加块大小会加剧重叠问题,这凸显了在高光谱图像分析中采用严谨评估方法的必要性。
-
研究发现:分子编码器在药物发现中未能预测表型活性
一篇新发表在arXiv上的研究论文质疑了像CLOOME和CellCLIP这样的分子编码器在药物发现中作为表型预测替代品的有效性。该研究控制了数据泄露和细胞毒性相关性等潜在混淆因素,发现这些预训练编码器与更简单的理化描述符相比没有显著优势。事实上,研究表明,在各种表示中,预测细胞毒性通常比预测表型活性更容易。
-
新的X-OPM系统提供可解释的片上功耗建模
研究人员开发了X-OPM,一种用于可解释自动片上数字功耗建模的新型系统。该框架使用以人为中心的(human-in-the-loop)工作流程,并将基于树的模型用于特征交互与线性模型用于预测相结合,旨在提高在未见过的工作负载上的泛化能力。在C906向量处理器上进行评估,X-OPM在面积开销极小的情况下达到了0.93以上的R^2分数,性能优于APOLLO、COBIT和标准MLP等现有方法。
-
新的CLARER模型提高了推荐的准确性和可解释性
研究人员开发了CLARER,一种新的推荐模型,它结合了用户评分和从文本评论中提取的方面特征。该模型使用多层感知器处理基于评分的特征,并使用带有对比学习的Transformer编码器处理基于方面特征。然后,使用Transformer解码器为推荐生成解释。在基准数据集上的实验表明,CLARER在推荐准确性和解释质量方面均优于现有方法。
-
新AI模拟器探测器在混沌系统上测试响应保真度
一篇新的研究论文介绍了一种“响应理论探测器”,用于评估混沌和随机系统AI模拟器的准确性。该方法在Lorenz-63模型上进行了测试,评估了这些模拟器对外部强迫的响应程度,这是预测和归因研究的一个关键方面。研究发现,虽然SINDy等模型表现良好,但水库计算机和神经ODE/SDE等模型在准确表示系统动力学和弛豫模式方面表现各异,凸显了训练公式对性能的影响。
-
新的逆向渲染方法结合了静态和闪光灯光照
研究人员开发了一种新的逆向渲染方法,该方法结合了从随意室内拍摄的静态和闪光灯光照,以恢复几何、材质和光照。该方法使用 GS 锚定的漫射场,一个在光栅化 2DGS 深度查询的哈希编码 MLP,以改进材质分解。该方法在合成和真实室内场景上优于六个近期基线,在漫射颜色、反照率、粗糙度和重新光照方面显示出显著的改进。
-
MLP 模型使用固定边缘检测进行手写字符识别
研究人员开发了一种用于手写字符识别的基线模型,该模型结合了简单的多层感知器 (MLP) 和固定的 Sobel-Feldman 算子。该方法将边缘提取过程与学习到的分类分开,在将图像输入 MLP 之前,将其转换为水平和垂直导数图。该模型在 MNIST 数据集上达到了 98.54% 的准确率,在 EMNIST Letters 数据集上达到了 92.50% 的准确率,证明了一阶梯度在保留判别性结构方面的有效性,同时也突显了仅依赖边缘几何形状…
-
机器学习模型显示出使用跨队列临床数据进行结核病筛查的潜力
研究人员使用来自乌干达和南非的临床和人口统计数据,评估了用于结核病(TB)筛查的机器学习模型。该研究将逻辑回归、多层感知器和卷积神经网络应用于CAGE-TB数据集,并结合特征选择来提高模型性能。虽然特征选择将所有模型的接收者操作特征曲线下面积(AUROC)提高了2-7%,但逻辑回归模型在保留数据上表现出一致的性能,在南非的AUROC为0.84,在乌干达为0.8。更深的神经网络在未见过的数据上显示出不太一致的结果,尽管开发用于结核病筛查…
-
新的RAOA架构使用无线电传播进行神经网络计算
研究人员介绍了一种新颖的循环计算架构——无线电交替算子 Ansatz (RAOA),该架构利用可编程无线电传播来实现计算深度。这种方法在持久的潜在状态上交替进行能量驱动的问题更新和混合更新,即使在使用重复学习的控制时也能实现组合式传递。RAOA 在精确离散优化任务中显示出潜力,可以在不增加学习控制数量的情况下提高解决方案质量,并且可以通过模拟中的可编程传播来近似。当应用于预训练语言模型时,RAOA 在 WikiText 上取得了有竞争…
-
分类后缀可提升 LLM Agent 检测恶意输入的能力
研究人员调查了使用分类后缀来提高 LLM Agent 检测恶意输入有效性。他们的研究测试了 13 个安全基准和三个开源模型家族的各种后缀,发现附加分类指令比不加后缀更能持续地提高分布外检测能力。后缀的措辞很重要,分类提示比不相关或仅仅是关注提示更有效。这种好处源于分类格式本身,具体标准仅在更严格的阈值下增加精度。研究结果表明,通过 KV 缓存分叉提供的这些分类后缀可以成为激活探测监控器的经济高效的补充,尽管其有效性取决于特定模型和读出方法。
-
新的幻象状态攻击利用 IIoT 入侵检测中的时间同步
研究人员引入了一种名为幻象状态攻击(PSA)的新型攻击,该攻击针对工业物联网(IIoT)环境中的入侵检测系统(IDS)。与以往修改数据或查询模型的对抗性方法不同,PSA 利用 IDS 中数据聚合窗口的时间同步性。通过引入细微的时间漂移,该攻击会导致 IDS 重构一个错误的运行状态,从而降低检测能力。该方法在 ToN-IoT 和 CIC IIoT 2025 数据集上针对随机森林、MLP 和 XGBoost 等常见机器学习模型进行了评估,…
-
强化学习优化核物理实验
研究人员开发了一个新颖的数据驱动控制框架,该框架利用强化学习和代理模型来优化核物理散射实验中的目标极化。该系统使用APOLLO低温靶系统的运行数据来训练模型,这些模型根据微波频率、束流和辐射剂量预测极化。通过平衡性能和不确定性的奖励公式进行训练的强化学习代理,其性能比人工操作员提高了近一倍。
-
人工智能集体智能 映射 人类层级制度
研究人员开发了一个框架,用于理解多层投票群体中集体智能的演化方式,超越了简单的平均化,以解决复杂、非线性的决策任务。他们确定了一种“边际反馈”支付结构,该结构仅在个人意见在其所在层级及以上层级起关键作用时给予奖励,以此激励持续的集体准确性。这种涌现的集体行为等同于机器学习中的多层感知器,表明人工智能中的层级制度和信用分配规则不仅是工程解决方案,也可能是自然的进化结果。
-
量子核方法在低资源音频深度伪造检测中表现好坏参半
一篇新的研究论文探讨了量子核方法(特别是量子支持向量机,QSVM)在低资源、跨语料库场景下,与经典模型(如支持向量机,SVM 和多层感知机,MLP)相比,在检测音频深度伪造方面的有效性。研究发现,尽管 MLP 在严重领域转移下性能显著下降,但 QSVM 仍保持了显著的区分能力。然而,这种优势并非在所有转移方向上都一致,QSVM 有时表现低于随机水平。研究人员将这些发现解释为在分布转移下量子核归纳偏差的经验表征,而不是明确的量子优势,因…
-
新理论通过平衡物解释语言模型的自我修复
研究人员提出了一个理解语言模型自我修复的新框架,认为对模型组件的干预可以被视为代表反事实对比的坐标轴上的点。这种观点认为,一个固定的系数 $\gamma_r$ 控制着细粒度单元的因果修复响应,决定它们是抵消还是增强被移除的信号。在 Gemma、Qwen、LLaMA 和 Mistral 四个不同的模型家族上进行的实验,识别出许多组件,包括 MLP 和 OV 神经元,它们遵循这种仿射定律,并且 $\gamma_r$ 的大小可以从固定权重中预测。
-
新研究优化剩余使用寿命预测以实现预测性维护
一篇新研究论文探讨了在预测性维护中优化剩余使用寿命(RUL)预测的超参数选择。该研究引入了一种多目标优化方法,该方法平衡了早期和晚期预测误差,这两种误差通常具有不对称的后果。通过联合优化准确性和预测及时性,该方法在 NASA C-MAPSS 数据集上显著减少了方向性不平衡,提高了预测的校准度。研究还发现,更简单的模型架构在此任务上的表现通常与更复杂的时间模型相当或更好。
-
研究人员使用双曲几何来解释深度网络训练动态
一篇新的研究论文介绍了一种通过在双曲几何中表示深度神经网络的训练动态来理解其训练动态的新方法。该方法构建了时态参数图,这是网络权重随时间的快照,并将这些图嵌入到庞加莱模型中。这种几何表示旨在捕捉网络在训练过程中不断演变的结构和自组织,从而提供超越单一检查点分析的内在可解释性。在回归和分类任务上的实验证明了这种双曲时态表示框架的有效性。
-
Kolmogorov-Arnold网络在扩展性、偏微分方程和可解释性方面展现出潜力 · 跟踪3个来源
研究人员正在探索Kolmogorov-Arnold网络(KANs)的能力和理论基础,这是一种替代传统多层感知器(MLPs)的方法。一项研究调查了KANs的神经扩展定律以及它们的可学习激活函数如何随着数据集的扩展而演变,发现图像分类和科学回归任务具有不同的扩展行为。另一篇论文将KANs应用于求解自由边界偏微分方程,证明了与物理信息神经网络相比,它们在准确解析复杂区域和界面方面的有效性。第三篇论文通过检查Fisher Simplicity…
-
深度学习框架提升巴西大豆产量预测能力
研究人员开发了一种新的深度学习框架用于预测作物产量,该框架已在巴西大豆产量上进行了测试。该框架仅使用常规天气数据和两个静态输入(作物年份和农业环境标签),使其具有输入节俭和可迁移性。包括 Transformer 和 Mamba 在内的各种深度学习模型与传统方法进行了基准测试,其中 Transformer 模型取得了最高的准确性。该研究还使用 SHAP 诊断分析了特征重要性,揭示了作物年份影响长期趋势,而天气和农业环境因素驱动年度变化。
-
新方法GALA将3D头像动画速度提升1000倍
研究人员开发了GALA,一种新颖的蒸馏方法,旨在显著加速3D高斯头像的实时动画。该技术通过身份无关的混合形状的线性组合来近似复杂的神经推理,从而大大降低了计算成本。GALA通过学习一个浅层MLP网络来预测混合形状系数,从而在移动设备上实现高达60fps的动画速度,同时保持高质量的渲染。该方法已在各种头像模型上得到验证,证明了其在动画面部表情和具有服装动态的全身方面的有效性。