PulseAugur
实时 04:59:19
实体 Few-shot learning

Few-shot learning

PulseAugur coverage of Few-shot learning — every cluster mentioning Few-shot learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
21
90 天内 89
发布 · 30天
0
90 天内 0
论文 · 30天
17
90 天内 81
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.70

New theoretical frameworks will emerge to unify in-context learning with probabilistic and meta-learning concepts.

One cluster explicitly links in-context learning (ICL) to Bayesian inference and meta-learning, proposing a statistical theory to explain its mechanisms. This indicates a growing research effort to provide a more rigorous mathematical understanding of ICL, moving beyond empirical observations.

hypothesis expired 置信度 0.75

Few-shot learning frameworks will increasingly leverage LLM-generated synthetic data for training and evaluation.

Multiple recent clusters highlight the use of LLMs and in-context learning (ICL) to generate synthetic ground truth data for tasks like emotion classification and to improve grammatical error correction. This suggests a trend towards using LLMs not just for inference but also for data augmentation in few-shot learning scenarios, reducing reliance on expensive human labeling.

observation expired 置信度 0.65

In-context learning is being adapted for complex model migration and cross-framework adaptation tasks.

A recent cluster details an agentic framework using ICL to automate the migration of deep learning models from PyTorch to JAX, achieving high numerical equivalence. This demonstrates that ICL is being applied to more complex engineering challenges beyond simple task adaptation, such as cross-framework compatibility.

查看全部假设 →

最近 · 第 1/5 页 · 共 89 条
  1. SIGNIFICANT · CL_212512 ·

    机器人通过类似GPT-3的单次学习在几秒钟内学会新任务

    Generalist AI发布了其新的机器人基础模型GEN-1.5,该模型支持单次学习。该模型可以通过观察简短的演示来学习新任务,这与GPT-3从文本示例中学习的方式类似。GEN-1.5甚至可以组合不同的演示来执行复杂任务,并且可以在真实世界和模拟环境中学习,而无需梯度更新或微调。虽然目前单次学习的成功率约为59%,但研究人员对机器人仅通过观察就能学会复杂动作的潜力感到兴奋。

  2. COMMENTARY · CL_210725 ·

    6 种架构转变以优化 LLM 管道的成本和延迟

    文章提出了六种架构转变,通过降低 Token 成本和延迟来优化大型语言模型 (LLM) 管道。它提倡实施严格的检索增强生成 (RAG) 和向量数据库,以仅获取相关上下文,并利用静态提示元素的上下文缓存来改善首次 Token 的时间。作者还建议将提示的复杂性与工作负载相匹配,将单体提示分解为可组合的模块,并将非生成任务卸载到更高效的系统。

  3. TOOL · CL_208386 ·

    ARASH 方法提升表格预测的 TFM 效率

    研究人员开发了 ARASH,一种旨在提高 TabPFN 等表格基础模型 (TFM) 效率的新颖方法。ARASH 通过使用局部邻域分析来解决表格数据选择最佳少样本示例的挑战。该方法将提示长度和内存使用量分别显著降低了高达 1261.5 倍和 2.56 倍,同时保持了与传统方法相当的准确性。

  4. TOOL · CL_206263 ·

    LLM高精度自动化检测需求依赖性

    研究人员开发了LEREDD,一种利用大型语言模型(LLM)自动化软件开发中需求依赖性检测的新方法。该方法采用检索增强生成(RAG)和上下文学习(ICL)来识别自然语言需求中的关键相互联系,这项任务由于其复杂性和手动工作量而常常被忽视。LEREDD在识别细粒度依赖类型方面取得了显著进展,准确率达到0.93,F1分数达到0.84,显著优于现有方法。

  5. TOOL · CL_206186 ·

    研究揭示自然语言解释如何影响LLM的上下文学习

    一项新近发表在arXiv上的研究,调查了自然语言解释(NLEs)在改进大型语言模型(LLMs)上下文学习(ICL)方面的有效性。该研究在六个基准测试和四种指令微调模型上,比较了不同类型的NLEs,包括人类编写的、模型自生成的以及外部生成的解释。研究结果表明,NLEs通常能提高分类任务的准确性,其中外部生成的解释通常与人类编写的解释表现相当。然而,对数学推理任务的影响则更为多样,并且取决于具体的模型和解释来源。

  6. TOOL · CL_204046 ·

    新理论探索了部分序上的上下文学习极限

    研究人员开发了一个新的理论框架来理解上下文学习,特别是在应用于部分序时。该框架区分了逻辑可识别性、提示教学成本以及底层结构的复杂性。它引入了版本空间语义来显式处理背景知识以及开放世界与封闭世界假设。该研究证明了有限开放世界提示的完成三歧性,根据正负比较确定查询是明确为真、明确为假还是模糊。此外,它还表征了开放世界提示的教学数,并建立了与坐标解码器的维度和宽度相关的精确表示边界。

  7. TOOL · CL_203814 ·

    新方法实现跨 LLM 会话的上下文学习状态迁移

    研究人员开发了一种新的方法,用于在不同会话之间迁移大型语言模型(LLM)的上下文学习(ICL)状态。这对于可能被另一个代理中断或继续的任务的应用至关重要,要求新会话保留前一个会话的相关信息。所提出的方法被表述为任务相关 ICL 状态的迁移,区分了对过去信息的精确恢复和目标分布的保留。它量化了在下游查询已知之前存储信息的成本,并提出了一个包含决策、任务证明统计数据和原始观察的三部分记录。

  8. COMMENTARY · CL_201885 ·

    LLM 的有效提示工程技术

    提示工程通常被认为不可靠,但通过关注基于大型语言模型(LLM)工作原理的具体技术,可以使其变得有效。关键策略包括:明确指定期望的输出格式、提供少量示例以展示模式,以及采用思维链提示以鼓励复杂任务的逐步推理。此外,为 LLM 分配一个有目的的角色并将其分解为更小的、顺序性的提示可以显著提高性能,而礼貌、模糊的最高级和提示填充通常是无效的。

  9. TOOL · CL_196100 ·

    新的LiFT框架提升了LLM在纵向NLP任务中的上下文学习能力

    研究人员开发了LiFT,一个旨在增强大型语言模型(LLM)在纵向自然语言处理(NLP)任务中上下文学习(ICL)能力的新框架。这些任务涉及分析按时间顺序排列的文本,应用于心理健康监测或立场演变追踪等领域,但常常面临数据稀缺的问题。LiFT是一种模型无关的方法,通过共享指令模式统一了各种纵向任务,并结合了序列依赖、课程学习和时间条件。在五个纵向数据集上的评估表明,LiFT在相同的ICL条件下,显著优于标准的指令微调(IFT)模型,尤其有…

  10. TOOL · CL_187459 ·

    新方法提高了AI在医学图像分割中的可靠性

    研究人员开发了提高医学图像分割中上下文学习可靠性的方法。他们发现,基于与查询图像的视觉相似性而不是随机抽样来选择支持集示例,可以持续提高分割性能,尤其是在支持集较小的情况下。此外,他们训练了一个分类器来预测部署前可能发生的分割失败,从而提高了临床应用的安全性。

  11. TOOL · CL_183228 ·

    新研究揭示面向任务的信息移除是上下文学习的关键

    一篇新研究论文探讨了大语言模型中上下文学习(ICL)的内部工作原理,提出ICL通过选择性地移除模型内部表示中与任务无关的信息来发挥作用。研究表明,在零样本场景下,模型会产生任意输出,因为它们的表示包含了所有任务的信息。然而,少样本演示能够有效地引导模型丢弃冗余信息,从而专注于预期任务。研究人员在模型的注意力机制中识别出特定的“去噪头”,这对信息移除过程至关重要,并证明禁用这些头会显著降低ICL的准确性。

  12. TOOL · CL_183227 ·

    大型语言模型在上下文学习中自发发展物理表征

    研究人员发现,大型语言模型(LLMs)在上下文学习过程中会自发地发展出诸如能量之类的物理概念的内部表征。通过分析模型在预测物理动力学时的激活情况,他们发现这些表征会随着上下文长度的增加而增强。进一步的分析表明,这些与能量相关的信号对于模型的预测准确性至关重要,这暗示了一种机制性理解,即LLMs如何在没有明确的物理学训练的情况下组织物理结构。

  13. TOOL · CL_183148 ·

    LLM numerical inference analyzed via graph signal processing

    一篇新的研究论文提出了一种图信号处理方法来理解大型语言模型(LLM)在上下文学习过程中如何处理数值信息。通过将注意力机制分析为加权图,并将 token 状态分析为信号,该研究揭示了随着上下文长度的增长,LLM 会为数值推理发展出更清晰的表示。研究表明,更简单的输入会导致更全局连接的 token 图和更平滑的信号,而复杂的输入则会导致更局部化的图和隐藏状态中更广泛的光谱能量,这表明在不同模型家族中存在数值 ICL 的系统内部签名。

  14. TOOL · CL_181047 ·

    PromptPath框架为上下文学习实现动态计算路径

    研究人员推出PromptPath,一个旨在通过使提示能够动态调节模型计算路径来增强上下文学习(ICL)的新型框架。与主要将提示用作上下文线索的现有方法不同,PromptPath采用提示驱动的路由机制来选择性地激活和组合轻量级专家,从而形成特定任务的计算路径。这种方法旨在提高任务专业化和推理可解释性。在3D点云和2D视觉识别基准上的实验表明,PromptPath的表现优于当前的最新ICL基线,并在不同领域和任务上展现出强大的泛化能力。

  15. TOOL · CL_178417 ·

    新框架衡量协作讨论中的认知参与度

    一项新研究引入了一个扩展的ICAP框架,用于衡量协作讨论中的认知参与度,并将人类标注与基于LLM的标注进行比较。研究发现,虽然人类标注者实现了稳健的评分者间一致性,但像上下文学习这样的LLM方法仅显示出中等程度的一致性。该研究表明,基于代理的方法在分析协作对话方面具有潜力,并强调了人类标注与LLM开发之间持续互动的重要性。

  16. TOOL · CL_178337 ·

    新框架统一了边缘设备的设备端学习

    研究人员开发了一个名为嵌入式中心学习(ECL)的新框架,该框架统一了四种不同的设备端学习场景:少样本学习(FSL)、持续学习(CL)、零样本学习(ZSL)和上下文内学习(ICL)。该框架允许资源受限的边缘设备在不依赖云端处理的情况下适应和个性化预测,解决了能耗、延迟和隐私问题。在硅片上的演示表明,ECL在FSL字符识别方面取得了最先进的性能,并为关键词识别中的CL建立了硬件基线,同时在微瓦到毫瓦功耗预算内完成了ZSL和ICL的硬件演示。

  17. RESEARCH · CL_180486 ·

    新研究探索了在数据有限的情况下进行命名实体识别的无监督方法

    本文研究了在处理多个领域中小型或无标签数据集时的命名实体识别(NER)的无监督方法。它提出使用无监督预训练来识别实体而无需标注,然后在有限的数据集上进行迁移学习。该研究通过探索数据增强、少样本学习和域对抗训练等技术来解决域变化和数据稀疏性等挑战,以提高NER系统的性能和适应性。

  18. TOOL · CL_176838 ·

    LLM系统提示词:将行为与内容分离,实现一致的AI响应

    LLM中的系统提示词充当一个持久通道,用于设置模型行为,这与包含实际查询的用户回合是分开的。这个系统提示词可以由五个关键块构成:角色、规则、输出格式、少量示例和护栏。通过将这些指令与用户输入分开,开发人员可以确保在多次交互中获得一致的、符合品牌调性的以及安全的响应。这种方法允许更方便地缓存、版本控制和A/B测试模型行为,将提示词构建视为代码审查过程而非训练运行。

  19. TOOL · CL_169673 ·

    AI毒性检测未能惠及边缘群体,需要社区特定方法

    一篇新的研究论文认为,当前用于AI生成图像的毒性检测器不足,尤其对边缘化社区而言。研究强调,一种通用的方法未能识别出针对侏儒症或视力障碍等群体的有害内容,在某些情况下,检测器的表现甚至不如随机猜测。该论文提出了社区特定毒性检测(CTD),并证明像上下文学习(ICL)和参数高效微调(PEFT)这样的方法可以显著提高检测准确性,尽管仍需要持续的研究。

  20. TOOL · CL_169613 ·

    新研究揭示表格上下文学习器中存在虚假路由缺陷

    研究人员发现表格上下文学习模型存在一个关键缺陷,即它们可能会被数据中的虚假相关性“纠缠”住。这意味着模型可能会学会依赖不相关的信号,例如特定医院的设备伪影,而不是用于预测的真正因果因素。这种虚假路由在线性模型中是不可避免的,并且会随着上下文大小的增加而加剧,导致模型在部署到新环境中时性能显著下降。该研究提出了两种缓解策略:环境分层上下文构建和S-swap增强,它们能有效地重新路由模型以关注因果信号并提高其鲁棒性。