training set
PulseAugur coverage of training set — every cluster mentioning training set across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
AI模型记忆:一个统一的bug,而非四个独立问题
最近的一项分析表明,基准测试污染、训练数据提取、版权侵犯和成员推断这四个不同的研究领域并非独立问题,而是单一根本问题——模型记忆——的不同表现。这一观点挑战了将这些现象孤立研究的传统方法。文章认为,将模型记忆视为一个统一的概念,可能有助于制定更有效的策略来应对人工智能开发中的这些复杂挑战。
-
AI发展在智能体技能、语音识别和数据噪声方面面临挑战
该集群讨论了AI发展中的挑战和细微之处。其中一项指出,AI智能体可能比额外的提示更能从技能中受益,这表明需要更好的训练或架构。另一项指出,文本转语音系统中的词错误率可能具有误导性,一项研究表明,相当一部分错误是由于识别器而不是音频质量造成的。最后,第三项探讨了AI模型如何从训练数据中的噪声中学习并可能隐藏噪声,正如一个打乱标签的数据集所展示的那样,该数据集仍然显示出显著的损失降低。
-
研究发现AI生成的艺术作品通常无法追溯到训练数据
一项最新研究表明,人工智能生成的图像,特别是来自Stable Diffusion等模型的图像,通常无法明确追溯到其原始训练数据。这种缺乏可追溯性引发了关于作者身份的问题,以及AI生成的艺术作品是否可以被视为原创作品的讨论。研究结果暗示了AI模型、其训练集以及由此产生的创意输出之间存在复杂的关系。
-
Google Health 更新允许用户隐藏 AI 教练,修复地图和训练数据错误
Google Health 发布了一项更新,允许用户隐藏 AI 教练功能。该更新还解决了影响应用程序内地图和训练数据的若干错误。
-
人工智能训练使用书籍引发关于虚假信息的辩论
人工智能公司正在使用旧书籍来训练其模型,引发了关于伦理影响和虚假信息传播的辩论。这种做法凸显了数字信息,包括书籍中可能存在偏见或过时的内容,如何通过人工智能系统得到放大。
-
为AI模型训练提议确定性的数据门禁
有人提出了一项新建议,在AI模型训练流程中增加一个控制层,该控制层侧重于数据本身,而不仅仅是代码或模型性能。该系统将基于明确的证据,如泄露、矛盾、冗余和来源,提供可复现的“通过”、“警告”、“失败”或“安全失败”的判定。目标是在数据准备和训练之间创建一个确定性的门禁,确保相同的数据和配置产生相同的结果,并防止关键故障被聚合分数所掩盖。虽然该系统旨在提高透明度并可能提供修复计划,但一个关键的反对意见是,数据质量是情境化的,如果系统不够透…
-
中国考虑对模型权重和芯片设计实施人工智能出口管制
中国正在考虑对包括模型权重、训练数据和芯片设计在内的关键人工智能组件实施出口管制。此举目前正与国内人工智能和芯片公司协商,可能会显著改变全球对中国人工智能技术的获取,并影响到台积电等国际芯片制造商。这些潜在法规的确切范围和最终细节仍未确定。
-
医疗AI训练数据易泄露敏感信息
《自然》杂志最近发表的一项研究强调了医疗AI系统存在重大的隐私漏洞。研究人员发现,可以从这些AI模型使用的训练数据集中提取敏感信息,包括患者的医疗记录和遗传数据。鉴于医疗领域日益依赖AI进行诊断和治疗规划等任务,这对患者隐私构成了相当大的风险。
-
新框架使用傅里叶分析进行高效数据增强
研究人员开发了一个新的框架,利用傅里叶分析和有限群表示论来研究数据增强策略。他们的工作表明,对于许多学习问题,使用随机抽样的群元素子集进行的局部数据增强可以达到与完全增强相同的统计效益。这种方法为具有对称性的学习提供了一种计算上可扩展的方法,解决了完全增强在大群上的不可行性。该研究还包括一个不可能结果,表明精确的不变性强制执行需要对整个群进行平均。
-
音乐数据库分析揭示AI训练数据秘密
对一个音乐数据库的分析揭示了AI训练数据的复杂性,并引发了关于数据所有权的重要问题。此次探索深入研究了训练、验证和测试数据集中隐藏的秘密,强调了人工智能中数据来源和使用方式的含义。
-
AI解读:理解核心概念的21个必备术语
本文旨在通过定义21个构成理解AI概念基础的关键术语来揭开人工智能的神秘面纱。它涵盖了从机器学习、深度学习到自然语言处理和计算机视觉等广泛的AI子领域。文章还涉及了生成式AI、大型语言模型等关键方面,以及理解过拟合、偏见和AI开发中使用的不同类型数据集等术语的重要性。
-
生成式AI输出疑似存在投毒训练数据
研究人员正在观察到投毒训练数据可能影响生成式AI输出的实例。这个问题可能导致AI模型产生不可靠或有偏见的结果。其影响重大,因为AI生成内容的完整性受到了质疑。
-
新方法审计生成音乐模型训练数据
研究人员开发了一种新颖的黑盒成员推理技术,用于审计生成音乐模型的训练数据。该方法通过分析特定音频样本与其在给定字幕条件下模型生成输出之间的对齐情况,来确定该样本是否在训练过程中被使用。该方法在各种最先进的音乐生成器上均取得了高精度,证明了即使在无法访问模型参数或元数据的情况下,审计训练数据的可行性。
-
大型语言模型的事实回忆能力随模型大小和训练数据频率而扩展
研究人员发现,大型语言模型的事实回忆能力与其大小以及训练数据中主题的频率之间存在可预测的关系。通过对 38 个模型和 8,900 多篇学术参考文献进行评估,他们发现回忆质量遵循基于模型参数和主题表示组合的 S 形曲线。仅这些因素就解释了不同模型家族回忆性能差异的很大一部分。