PulseAugur
中
实时 19:38:36
实体 model collapse

model collapse

PulseAugur coverage of model collapse — every cluster mentioning model collapse across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 16
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_259380 ·

    新研究使用费舍尔-罗(Fisher-Rao)度量来防止大型语言模型(LLM)模型坍塌

    一篇新论文提出使用费舍尔-罗(Fisher-Rao)度量来分析使用合成数据训练大型语言模型(LLM)的动力学。该研究解决了“模型坍塌”问题,即当LLM递归地在合成数据上进行训练时,会遗忘真实的数据分布。作者们为防止这种坍塌所需的最少人类数据比例建立了理论保证,并证明该比例与使用欧几里得度量(Euclidean metric)得出的先前估计值不同。

  2. TOOL · CL_247711 ·

    研究发现,AI模型崩溃速度不受市场集中度影响

    arXiv上的一篇新论文探讨了大型语言模型中“模型崩溃”的现象,即AI生成文本的递归训练会导致模型性能在几代后下降。该研究调查了市场集中度,特别是少数主导模型控制大部分训练数据的寡头垄断,是否会加剧这种崩溃。与预期相反,研究发现,在测试范围内,市场不平等的增加对模型崩溃的速度或目的地影响甚微。影响崩溃速度的主要因素是构成训练池的模型本身的脆弱性,而不是市场份额的分布。

  3. TOOL · CL_217834 ·

    AI模型坍塌:研究人员回顾风险与对策

    arXiv上的一篇新论文回顾了生成式AI中的模型坍塌现象,即使用AI合成数据来训练后续模型可能导致性能和可信度下降。该论文整合了关于各种应用场景下模型坍塌的现有研究,并探讨了缓解其影响的对策。它还指出了该关键领域当前的挑战和未来的研究方向。

  4. TOOL · CL_216836 ·

    AI中的模型崩溃已确认,关键条件被忽视

    最近发表在《自然》杂志上的一篇论文证实了AI中的模型崩溃现象,即AI生成数据的质量在连续的训练迭代中会下降。然而,文章指出,在流行讨论中常常被忽视的一个关键崩溃条件是,一个注定失败的管道和一个功能正常的管道之间的区别。这一区别对于理解如何预防或减轻模型崩溃至关重要。

  5. COMMENTARY · CL_198936 ·

    AI模型因数据退化引发的“模型崩溃”担忧加剧

    一篇近期文章讨论了AI中的“模型崩溃”概念,即由先前模型生成的数据训练的模型,其质量可能随时间推移而下降。作者强调,这可能会影响AI系统的长期可靠性和实用性,尤其是在生物多样性保险价值等领域。

  6. COMMENTARY · CL_155913 ·

    AI公司转向旧书获取训练数据以避免模型崩溃

    一家名为ISBNdb的公司正将旧的印刷书籍定位为AI模型训练数据的优质来源。他们认为,书籍提供了网络爬取无法复制的、经过策展和同行评审的人类知识,并且重要的是,它们不受可能导致模型崩溃的AI生成文本的“AI垃圾”的影响。ISBNdb还指出,作者可以通过故意产生有缺陷的内容来积极破坏AI模型。

  7. TOOL · CL_154264 ·

    生成式AI被视为历史艺术过程,而非断裂

    本文将生成式人工智能视为艺术创作历史进程的大规模体现,而非新的技术飞跃。它提出了生成系统的分类法,并识别出模型崩溃等系统性风险,建议通过环境丰富化作为对策。艺术家的角色从工匠重新定义为系统设计师和策展人,创造性代理权存在于分布在AI管道中的人类身上。

  8. TOOL · CL_141362 ·

    论文探讨AI模型坍塌作为一种递归现象

    一篇新论文探讨了“模型坍塌”现象,即AI生成的内容污染了训练数据集,导致模型性能下降和意义丧失。该研究将这种坍塌不仅视为一种失败,而是一种递归过程,类似于模拟视频反馈,揭示了AI生成数据的依赖性。论文认为,这种递归训练挑战了超人类主义的理想,并邀请了一种美学视角,强调噪声和递归是理解艺术创作和更广泛的AI生态系统的关键概念。

  9. COMMENTARY · CL_135511 ·

    AI模型坍塌:AI生成内容是否正在毒化未来的训练数据?

    “模型坍塌”的概念表明,AI生成内容的泛滥正在降低互联网数据的质量,这反过来可能会对未来AI模型的训练产生负面影响。Reddit社区r/LocalLLaMA的一位用户正在质疑这个问题的真实性,以及大型AI公司是否正在积极清理其训练数据集。人们担心这种数据退化可能导致LLM改进的放缓。

  10. COMMENTARY · CL_91998 ·

    人工智能面临“模型崩溃”,人类数据日益减少

    专家们正在警告一种被称为“模型崩溃”的现象,当人工智能模型在其他人工智能模型生成的数据上进行训练时,就会发生这种情况。这个过程可能导致人工智能性能的显著下降。人们担心,到2026年,用于训练高质量人工智能至关重要的人类生成数据可能就会枯竭。

  11. TOOL · CL_91339 ·

    AI模型崩溃:样本选择偏差加速孤立数据中的崩溃

    一篇新发表在arXiv上的研究论文探讨了AI中“模型崩溃”的现象,当在合成数据上进行递归训练导致模型输出同质化和分布尾部侵蚀时,就会发生这种情况。该论文表明,通常用作补救措施的样本选择,在数据孤立且参考分布存在偏差时,会适得其反地加速模型崩溃。这个问题在医疗或金融等无法汇集数据的低资源环境中尤为重要。研究人员提出使用来自多个孤立数据的协作代理参考作为初步缓解策略,以减少多样性退化。

  12. TOOL · CL_72630 ·

    新模型追踪AI模型因合成数据污染而崩溃

    研究人员开发了一种新的流行病学模型,以理解合成数据污染如何降级AI模型。他们的双层SIR/SIRS框架将AI模型和数据语料库视为相互作用的种群,识别关键的传播动力学。该模型表明,当前AI文本的普遍存在可能导致超临界污染,强调了基于检测的过滤和群体免疫策略的重要性。

  13. RESEARCH · CL_65990 ·

    新方法对抗医学影像AI中的预测偏差

    研究人员发现了一种测试时自适应方法中的关键失效模式,称为模型坍塌,在这种模式下,类别簇会合并并导致预测偏差。他们提出了一种新的目标函数——分布偏移偏差减少(DSBR),通过确保损失函数中各类别贡献的平衡来抵消这一问题。在医学影像数据集和ImageNet-C上的实验表明,DSBR能有效稳定自适应过程,防止模型坍塌,并取得具有竞争力或更优的性能。

  14. COMMENTARY · CL_60713 ·

    AI模型崩溃的阴影笼罩,因未经核实的内容充斥网络

    互联网上未经核实的AI生成内容日益泛滥,引发了人们对AI实验室“模型崩溃”的担忧。这种现象发生在AI模型训练的数据受到其他AI模型严重影响或由其创造时,可能导致性能和理解能力的下降。据报道,中等规模的AI实验室正在采取策略来过滤其预训练数据,但这些方法在应对日益增长的合成内容洪流方面的有效性受到质疑。有人猜测,只有先进的专有验证系统才能阻止这个问题。

  15. RESEARCH · CL_48735 ·

    文化演化理论解释模型崩溃

    研究人员将模型崩溃(大型语言模型在训练自身输出来进行训练时会退化)这一现象重新解读为一种文化演化过程。通过应用迭代学习理论,他们使用LLaMA-2-7B和Mistral-7B模型在多种语言上推导并测试了五个预测。一个关键发现是,在未经筛选的自训练过程中,组合性最初会增加然后减少,这种模式即使在正则化数据下也持续存在,并且只有通过任务基础的筛选才能缓解。

  16. TOOL · CL_40859 ·

    交互式人工智能学习环境中的模型坍塌得到分析

    研究人员开发了一个新框架来理解结构化交互式学习环境中的模型坍塌。他们的工作解决了生成式人工智能模型在由其他模型生成的合成数据上进行训练所带来的挑战,这种情况是先前研究未涵盖的。该研究使用有向图来形式化这些交互,并确定了影响模型坍塌的特定图拓扑,为模型坍塌的发生提供了充分必要条件。

  17. RESEARCH · CL_37690 ·

    机器学习系统在生产环境中失败是由于基础设施而非模型

    一篇近期文章强调了在隔离环境中测试机器学习模型与测试整个生产系统之间的关键区别。文章详细描述了一个场景:一个推荐模型在离线评估中表现良好,但在实际流量下由于特征检索管道中的基础设施崩溃而失败。文章提倡在部署前使用合成数据对包括数据检索、特征计算和服务基础设施在内的整个机器学习系统进行压力测试,以识别和解决离线评估可能遗漏的潜在瓶颈。

  18. COMMENTARY · CL_33777 ·

    人工智能模型因合成训练产生的“数据内卷”而退化

    模型坍塌,也称为“数据内卷”,描述了人工智能模型性能的下降。当模型反复使用由其他人工智能系统生成的合成数据进行训练,而不是使用新颖的人类创建的数据进行训练时,就会发生这种情况。人工智能生成数据的持续反馈循环会导致准确性下降和产生无意义的输出。

  19. TOOL · CL_20394 ·

    模型坍塌威胁人工智能民主化,不成比例地损害低资源社区

    一份新的立场文件认为,模型坍塌(即基于先前模型输出来训练的生成模型性能下降)对低资源社区构成了重大威胁。这种现象加剧了数据退化,加剧了偏见,并导致资源利用效率低下,对边缘化群体造成了不成比例的影响。该文件呼吁采取行动来减轻这些影响,并概述了解决方案的初步方向。

  20. RESEARCH · CL_04356 ·

    研究人员从数学上证明 AI 无法自我改进达到超智能

    研究人员已从数学上证明,人工智能无法通过递归自我改进来实现超智能。预计 AI 模型不会朝着通用人工智能(AGI)发展,而是会经历“模型崩溃”,即它们逐渐失去对现实的认知。这一数学证明表明,这种自我改进不仅困难,而且根本上是不可能的。