information entropy
PulseAugur coverage of information entropy — every cluster mentioning information entropy across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
GATTA框架通过测试时增强提升主动学习能力
研究人员推出GATTA,一个利用测试时增强(TTA)来改进图结构数据上主动学习的新型框架。GATTA聚合来自多个增强视图的预测,以增强不确定性估计,这是主动学习中的一个关键因素。该框架包含一个过滤不可靠增强视图的机制,以确保标签的保留。GATTA已在各种图数据集和GNN架构上证明了其有效性,表明简单的基于不确定性的方法与TTA结合后,可以实现与更复杂方法相媲美的性能,同时降低计算开销。
-
新证明确立了镜像下降在非凸问题上的收敛性
研究人员为镜像下降在非凸优化问题上的收敛性提供了证明,特别解决了不排除边界限制的情况。该证明依赖于一种新颖的度量展平重参数化方法,该方法允许定义边界扩展。当应用于涉及香农熵、费米-狄拉克熵和幂核的目标时,该框架证明了收敛到 KKT 点。未来的工作旨在将此方法扩展到更广泛的 Bregman 型算法和更复杂的约束几何。
-
LLM校准研究提出新方法以提高基准可比性和域外泛化能力
两篇新研究论文提出了改进大型语言模型(LLM)校准的方法。第一篇论文介绍了一个基于项目反应理论(IRT)的框架,该框架使用锚点项目来校准新基准,即使模型在不同数据集上随时间进行评估,也能实现可比的分数。第二篇论文提出了一种双层优化方法,在训练过程中修改模型参数以最大化预测分布的熵,直接针对过度自信问题并提高域外泛化能力。
-
新框架使用信息论解释自闭症的坚持相同性 · 跟踪 2 个来源
研究人员提出了一个使用信息论来解释自闭症患者中观察到的坚持相同性行为的新框架。这种方法将此类行为视为减少惊讶和不确定性的普遍模式,将自闭症定义为认知功能仅限于环境辨别、记忆和预测的障碍。基于条件熵的拟议指标表明,最小化惊讶可以通过学习新刺激或限制对已知信息的接触来实现,而坚持相同性则与后者一致。该框架旨在量化焦虑和舒适区等概念,并可能通过类似图灵测试的方法为学习疗法和机器人护理的开发提供信息。
-
基于熵的秘密检测保护LLM上下文窗口
提出了一种使用香农熵的新方法,以防止API密钥和令牌等敏感信息泄露到LLM上下文窗口中。工具输出熵净化器(Tool Output Entropy Sanitizer),一个MCP服务器,通过计算其不可预测性来识别高熵字符串。这种方法比传统的基于正则表达式的 redaction 更健壮,因为后者在秘密格式发生变化时可能会失效。净化器将敏感段替换为类似'[REDACTED_HIGH_ENTROPY:length]'的占位符,在防止实际数据…
-
Renyi熵和最小熵估计新界限确立
研究人员为估计Renyi熵和最小熵(信息论和属性测试中的基本概念)建立了新的样本复杂度界限。该研究为估计k符号字母表的这些熵度量所需的样本数量提供了精确的刻画。值得注意的是,最小熵估计比香农熵需要更多的样本,样本复杂度为\Theta(k \log k),纠正了先前的假设。
-
基于熵的特征提升网络异常检测性能
研究人员探索了使用基于熵的特征来增强网络异常检测,由于流量模式多样,这正变得越来越困难。通过将熵计算集成到标准的机器学习流程中,他们在公开入侵检测数据集上发现了分类性能的一致性提升。这种方法补充了传统的统计特征,并为提高异常检测提供了轻量级、可解释的方法,尤其是在高变异流量场景中。
-
新理论连接牛顿-拉夫逊方法与正则化策略迭代
研究人员在正则化马尔可夫决策过程(RMDPs)的应用中,正式建立了牛顿-拉夫逊方法与正则化策略迭代(RPI)之间的等价性。这种联系,尤其是在正则化项为香农熵时,使得对RPI进行统一的理论分析并开发加速算法成为可能。研究表明,RPI表现出局部二次收敛性,并提出了一种实现三阶局部收敛的新算法,该算法得到了数值实验的支持。
-
新理论统一计算硬度和随机性
研究人员开发了一种统一的伪熵表征,加强了计算硬度和随机性之间的关系。这种新表征适用于均匀和非均匀计算模型,并涵盖了香农熵和最小熵等各种熵概念。一项关键的技术进展涉及使用权重受限校准和计算不可区分性,与以前的方法相比,这在字母表大小依赖性方面带来了指数级的改进。
-
信息论可视化指南发布,助力AI发展
Omar Sanseviero 分享了一份信息论的可视化入门指南,强调了其在AI背景下的美妙之处和强大功能。该指南旨在提供熵和互信息等概念的直观理解,仅需基本的概率知识。它旨在解释数据压缩和传输的基本极限。
-
新的LP-SFT方法保留语言模型熵结构
研究人员推出了一种新颖的监督微调方法LP-SFT,旨在保留预训练语言模型固有的多模态熵结构。标准的微调方法可能仅关注目标token而忽略模型对其他可能选项的广泛理解,从而损害现有能力。LP-SFT通过分析和维护模型代表丰富分布知识的熵峰来解决这个问题。实验表明,LP-SFT通过缓解能力退化并保留采样多样性,提高了性能并平衡了准确性指标。
-
新的LP-SFT方法在微调过程中保留语言模型能力
研究人员推出了一种新颖的监督微调方法LP-SFT,旨在保留预训练语言模型固有的熵结构。标准的微调会因过度关注目标标签词元而损害现有能力。LP-SFT通过维持替代合理词元之间的相对结构来解决这个问题,从而在不牺牲采样多样性的情况下缓解能力退化。实验表明,LP-SFT在平衡准确性和更广泛的性能指标方面优于普通SFT和其他增强基线。
-
通过熵控制增强大型语言模型的创意写作能力
研究人员开发了一种新颖的方法,通过操纵大型语言模型(LLM)的输出熵来增强其创意写作能力。该技术涉及在文本生成过程中调整温度参数,该参数会影响输出的随机性和创造力。通过仔细控制熵,LLM可以生成更多样化和富有想象力的内容,超越可预测或重复的文本。
-
新理论将熵与深度学习极限联系起来,并提出了EGD算法
研究人员引入了一个新的理论框架,该框架将信息论、拓扑学和统计力学联系起来,以理解深度神经网络中可学性的极限。该框架定义了一个“熵可学性视界”(Entropic Learnability Horizon, ELH),这是一个基本定律,规定只有当数据的流形香农熵超过函数决策边界的拓扑熵(由网络权重空间的熵调节)时,网络才能学习目标函数。当目标边界的复杂性超过这个信息视界时,系统就会进入“信息性挫败”(Informational Frust…
-
信息格学习被构建为概率图模型结构学习
一篇新论文将信息格学习(ILL)引入作为概率图模型(PGM)结构学习的一种方法。ILL通过将信号投影到抽象层次结构上,来学习可解释的规则。当应用于概率质量函数时,ILL学习到的规则可以被解释为因子图中的约束,这与最大熵模型密切相关。该框架为推理和混合符号-概率学习提供了新的途径。
-
MC Dropout在脑肿瘤分割中的可靠性受到质疑
研究人员调查了蒙特卡洛Dropout(MC Dropout)在MRI扫描中分割脑肿瘤的可靠性,发现虽然它可以将不确定性与错误对齐,但可能并不总是保证临床安全。在一项针对126名BraTS21患者的研究中,MC Dropout表现出强大的不确定性-错误对齐能力,正确地将错误体素排名更高,并识别出分割性能显著较低的亚组。然而,该研究还揭示,全局对齐指标可能会掩盖关键区域特定的校准失败,例如其中一个模型尽管整体AUROC得分很高,但在临床上…
-
新论文区分了人工智能中的描述性不确定性与监管性不确定性
一篇新论文区分了描述性不确定性(仅描述输出分布)和监管性不确定性(主动影响系统策略并驱动适应)。研究表明,当前的 Transformer 架构在推理过程中仅限于描述性不确定性。这一限制通过 Landauer 原理得到解释,该原理表明不确定性要具有监管性,认知误差必须产生实际的能量成本,而在解耦系统中并非如此。对不同规模语言模型的实证测试表明,在不同任务中,token 级别的熵在统计上保持不变,这表明其与任务准确性解耦,并且存在一种尺度不变的限制。
-
新的PIDL框架以高数据效率预测熵
研究人员开发了一种新颖的物理信息深度学习(PIDL)框架,用于预测复杂系统中的熵。这种统一的方法同时强制执行微分方程残差和信息论边界,从而实现域不变的熵表示。PIDL框架表现出高数据效率,仅用30%的训练数据即可达到90%以上的准确率,并严格遵守热力学原理,显示出零第二定律违规。
-
大型语言模型量化天体物理学方法的可复现性
研究人员开发了一个新的信息论框架,使用大型语言模型(LLMs)作为诊断工具来评估文本描述的科学方法的重现性。通过将LLM生成的实现视为概率分布,并用香农熵和Jensen-Shannon散度测量其方差,该研究量化了书面描述在多大程度上约束了算法实现。一项关于天体物理学光谱重构的案例研究表明,虽然LLMs可以恢复核心方法,但它们难以推断精确科学校准所需的默会专家知识,这凸显了限制严格重现性的“熵底线”。
-
新的熵等价性测试提供了高效的分布分析
研究人员引入了一个名为熵等价性测试的新问题,用于概率分布分析。该方法通过关注区分相同分布与香农熵存在显著差异的分布,放宽了标准的接近性测试。该团队为此任务开发了一种高效算法,证明其所需的样本数量少于传统的接近性测试。