training set
PulseAugur coverage of training set — every cluster mentioning training set across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
中国考虑对模型权重和芯片设计实施人工智能出口管制
中国正在考虑对包括模型权重、训练数据和芯片设计在内的关键人工智能组件实施出口管制。此举目前正与国内人工智能和芯片公司协商,可能会显著改变全球对中国人工智能技术的获取,并影响到台积电等国际芯片制造商。这些潜在法规的确切范围和最终细节仍未确定。
-
医疗AI训练数据易泄露敏感信息
《自然》杂志最近发表的一项研究强调了医疗AI系统存在重大的隐私漏洞。研究人员发现,可以从这些AI模型使用的训练数据集中提取敏感信息,包括患者的医疗记录和遗传数据。鉴于医疗领域日益依赖AI进行诊断和治疗规划等任务,这对患者隐私构成了相当大的风险。
-
新框架使用傅里叶分析进行高效数据增强
研究人员开发了一个新的框架,利用傅里叶分析和有限群表示论来研究数据增强策略。他们的工作表明,对于许多学习问题,使用随机抽样的群元素子集进行的局部数据增强可以达到与完全增强相同的统计效益。这种方法为具有对称性的学习提供了一种计算上可扩展的方法,解决了完全增强在大群上的不可行性。该研究还包括一个不可能结果,表明精确的不变性强制执行需要对整个群进行平均。
-
音乐数据库分析揭示AI训练数据秘密
对一个音乐数据库的分析揭示了AI训练数据的复杂性,并引发了关于数据所有权的重要问题。此次探索深入研究了训练、验证和测试数据集中隐藏的秘密,强调了人工智能中数据来源和使用方式的含义。
-
AI解读:理解核心概念的21个必备术语
本文旨在通过定义21个构成理解AI概念基础的关键术语来揭开人工智能的神秘面纱。它涵盖了从机器学习、深度学习到自然语言处理和计算机视觉等广泛的AI子领域。文章还涉及了生成式AI、大型语言模型等关键方面,以及理解过拟合、偏见和AI开发中使用的不同类型数据集等术语的重要性。
-
生成式AI输出疑似存在投毒训练数据
研究人员正在观察到投毒训练数据可能影响生成式AI输出的实例。这个问题可能导致AI模型产生不可靠或有偏见的结果。其影响重大,因为AI生成内容的完整性受到了质疑。
-
新方法审计生成音乐模型训练数据
研究人员开发了一种新颖的黑盒成员推理技术,用于审计生成音乐模型的训练数据。该方法通过分析特定音频样本与其在给定字幕条件下模型生成输出之间的对齐情况,来确定该样本是否在训练过程中被使用。该方法在各种最先进的音乐生成器上均取得了高精度,证明了即使在无法访问模型参数或元数据的情况下,审计训练数据的可行性。
-
大型语言模型的事实回忆能力随模型大小和训练数据频率而扩展
研究人员发现,大型语言模型的事实回忆能力与其大小以及训练数据中主题的频率之间存在可预测的关系。通过对 38 个模型和 8,900 多篇学术参考文献进行评估,他们发现回忆质量遵循基于模型参数和主题表示组合的 S 形曲线。仅这些因素就解释了不同模型家族回忆性能差异的很大一部分。