{\dataset}
PulseAugur coverage of {\dataset} — every cluster mentioning {\dataset} across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新基准 {\dataset} 挑战 LLM 图推理能力
研究人员开发了一个名为 {\dataset} 的新颖框架,为评估大型语言模型 (LLM) 的图推理能力创建了一个更全面的基准。该框架通过扩展图大小、任务复杂性、任务描述、图加载和任务来源五个维度的覆盖范围,并利用基于 LLM 的生成器进行任务创建和人工验证,从而解决了现有基准的局限性。使用此基准进行的初步实验显示,当前微调模型在泛化方面存在困难,而检索增强方法在不同推理模式下表现各异。
-
从生产日志构建 LLM 微调数据集
本文讨论了为大型语言模型从生产日志构建有效微调数据集的关键过程。文章强调原始日志并非数据集,并着重指出了选择高信号示例的重要性,例如用户编辑、验证器失败或路由到更昂贵模型的请求。作者还提供了数据清理技术的建议,推荐使用代理进行 redaction、使用 MinHash 进行去重、限制每个来源的贡献,以及过滤截断的输出。最后,文章警告了训练集和测试集之间的时间和近乎重复的泄露问题,建议在拆分前进行去重,并使用基于时间的拆分来确保准确评估。
-
OpenAI 推出 ChatGPT 小型企业计划,用户报告准确性问题
OpenAI 推出了名为 ChatGPT for Small Businesses 的新计划,旨在帮助企业家培养人工智能技能和自动化任务。同时,该公司正通过限时积分奖励新用户来推广其 ChatGPT Enterprise 产品。尽管取得了这些进展,用户仍报告 ChatGPT 存在准确性问题,一些人指出即使查询成功,它也可能提供错误信息,另一些人则观察到其在崩溃后性能有所下降。
-
WeightCLIP 方法将神经网络权重与数据集对齐
研究人员推出了一种新颖的方法 WeightCLIP,用于学习神经网络权重及其对应数据集的对齐潜在空间。该方法使用神经网络权重的自编码器和单独的数据集编码器,通过对比目标对其表示进行对齐。由此产生的与数据集对齐的权重空间表示可用于各种下游任务,包括将数据集信息映射到生成强大模型,并通过潜在细化过程改进标准微调。研究结果表明,明确纳入数据集信息可以增强权重空间表示在检索、生成和细化等任务中的能力。
-
AI模型生成与真实样本高度相似的PowerShell恶意软件
研究人员开发了一个实验性框架,用于评估大型语言模型(LLMs)生成PowerShell恶意软件的能力。该框架包括一种新颖的沙箱方法进行动态分析,以及一个真实PowerShell恶意软件的精选数据集。研究发现,允许自由使用的、开源的LLMs可以生成与人类编写的样本高度相似的恶意软件,其中位Jaccard指数为84.5%,近一半的生成实例与真实恶意软件完全重叠。
-
新框架推进地球和行星表面的跨视图地理定位 · 已追踪 2 个来源
研究人员开发了用于跨视图物体地理定位的新框架,这项任务涉及从一个图像视角(例如地面视图)识别物体在另一个视角(例如卫星)的参考图像中的位置。第一种方法引入了一个名为 \dataset 的大规模数据集,包含超过 220,000 个地面-卫星和无人机-卫星对,以及一个利用 3D 基础模型的单阶段框架 GAGeo。第二篇论文侧重于行星表面的地理定位,创建了一个来自月球地形模型的基准数据集,并展示了基于 Transformer 的方法在视觉导…
-
新数据集旨在促进6G移动性AI发展
研究人员发布了一个新的真实世界数据集,旨在改进6G移动网络的AI和机器学习模型。该数据集捕获了各种移动场景,包括行人、车辆和火车出行,重点关注切换事件和定时提前测量。该数据旨在克服模拟数据集的局限性,为开发AI原生移动程序和减少服务中断提供更准确的基础。
-
新研究揭示个性化内容可欺骗AI文本检测器
研究人员引入了一个新的基准数据集和方法,用于评估机器生成文本检测器在面对个性化内容时的鲁棒性。他们发现了一个“特征反演陷阱”,即用于一般检测的特征在个性化环境中会产生误导,导致现有模型性能显著下降。所提出的\method方法通过识别反演特征的潜在方向,准确预测这些性能变化,旨在促进个性化文本检测的进一步研究。