PulseAugur
实时 06:58:34
实体 DSPy

DSPy

PulseAugur coverage of DSPy — every cluster mentioning DSPy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 11
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_207701 ·

    六种提示优化框架的有效性对比

    最近的一项分析比较了六种提示优化框架:DSPy、GEPA、TextGrad、agent-opt、Arize Prompt Learning 和 MLflow 的优化器。研究发现,这些框架不能互换使用,因为它们代表了从完整编程模型到单一算法和平台功能的各种不同方法。有效性的关键区别在于能否针对用户自己的数据集上的特定指标进行优化,而易于更换搜索算法是一个重要因素。

  2. TOOL · CL_196941 ·

    DSPy 框架为 AI 系统提供结构化签名

    DSPy 是一个 Python 框架,旨在通过使用结构化签名而非直接提示来构建 AI 系统。该框架旨在为开发 AI 应用程序提供一种更有条理的方法。然而,关于增加的抽象层是否会损害发送给 AI 模型的提示的透明度,仍存在疑问。

  3. TOOL · CL_185097 ·

    DSPy框架将面向对象原则应用于LLM提示词工程

    由斯坦福大学开发的DSPy框架为大型语言模型的提示词工程引入了面向对象的方法。它将稳定的接口(或称“签名”)与实现细节分离开来,允许开发人员定义输入-输出契约,而无需指定提示词措辞。这使得模型切换更加容易,因为签名保持不变,而DSPy会为新模型重新编译提示词。该框架使用优化器,根据标记数据和定义的指标,类似于编译器,搜索最佳的提示词措辞和少量示例。

  4. TOOL · CL_180284 ·

    GEPA方法使用AI评论优化LLM提示,无需GPU

    一种名为GEPA(Genetic-Pareto Evolutionary Prompt Adaptation)的新方法已被推出,旨在优化LLM管道,而无需为微调投入大量GPU资源。GEPA由加州大学伯克利分校Sky Computing Lab的研究人员开发,并在ICLR 2026的口头论文中进行了详细介绍。GEPA利用LLM生成的评论来演进提示,其性能优于GRPO和PPO等现有方法。这种方法适用于任何黑盒LLM,包括GPT-4o、Cl…

  5. RESEARCH · CL_178388 ·

    LLM通过编译代码生成企业工作流,以提高可靠性

    两篇研究论文探讨了从大型语言模型生成可执行代码以自动化企业工作流的方法,重点关注可靠性和效率。第一篇论文详细介绍了在评估六个LLM用于工作流生成过程中吸取的经验教训,强调了一个分段式管道显著提高了成功率,并使Mistral Small等较小模型也变得可行。第二篇论文介绍了“编译型AI”范式,在该范式中,LLM在编译阶段生成代码,从而实现确定性执行,无需进一步的模型调用,并展示了其在医疗保健领域执行函数调用和文档智能等任务的有效性。

  6. TOOL · CL_172757 ·

    DSPy 的新 RLM 模块解决了 LLM 上下文遗忘问题

    DSPy 框架引入了一个新模块 dspy.RLM,旨在解决大型语言模型(LLM)中的“上下文遗忘”(context rot)问题。这一现象由麻省理工学院(MIT)的研究人员发现,指的是模型在需要跨越整个上下文窗口进行推理的任务上性能下降,即使上下文窗口很大。DSPy 的递归语言模型(RLM)通过使模型能够以编程方式探索超大提示(oversized prompts),而不是一次性处理它们,来提供解决方案。

  7. TOOL · CL_169800 ·

    Prompt engineering 提升小型语言模型在查询路由中的表现

    一篇新的 arXiv 论文探讨了 Prompt Engineering 技术在小型语言模型(SLMs)执行受保护查询路由方面的有效性。该研究在 GQR-Bench 数据集上评估了 22 个 SLMs,重点关注它们路由分布内查询和拒绝分布外查询的能力。结果表明,Prompt 优化显著提高了紧凑型模型的性能,其中 Mistral 7B 和 Qwen3.5 9B 取得了显著的提升。研究表明,Prompt 优化是 SLMs 在此任务中的一个有…

  8. TOOL · CL_130800 ·

    Anthropic 的 Fable 模型在揭示隐藏的任务假设方面表现出色

    来自 Anthropic 的 AI 模型 Fable 因其揭示复杂任务中隐藏决策和假设的能力而受到关注。与擅长执行预定义计划的模型不同,Fable 特别擅长识别“未知数”——即提示与现实世界约束之间的差距。当任务的复杂性并非源于规模,而是源于未经审视的目标或标准时,这种能力就很有价值,它允许用户在执行之前或执行过程中完善他们的目标。

  9. TOOL · CL_126902 ·

    DSPy 框架被重新定义为 LLM 的编程工具

    DSPy 框架不仅被呈现为一种改进提示词编写的工具,更被视为一种用于编程语言模型的系统。其核心价值在于将任务契约(输入、输出、可衡量示例)与提示词本身分离开来,允许优化器在不改变基本业务逻辑的情况下改进提示词。成功采用的关键在于三个关键分离:任务契约与提示词的分离,编译正确性与运行时行为的分离,以及检索质量与最终答案质量的分离。没有这些分离,DSPy 可能不适合特定任务的抽象。

  10. TOOL · CL_122472 ·

    DSPy 框架增强 Datasette Agent 的 SQL 提示生成

    Simon Willison 探讨了使用 DSPy 框架来增强 Datasette Agent 的系统提示,Datasette Agent 是一个用于回答数据相关问题的 SQL 查询生成工具。他要求 Claude Code 评估和改进这些提示,特别是关注代理如何列出表模式以及提供关于使用 `describe_table` 的建议。使用 GPT-4.1 mini 和 nano 进行的测试表明,在模式列表中包含列名或调整关于 `descr…

  11. TOOL · CL_116442 ·

    新基准测试表明,提示优化可能会削弱大型语言模型的对抗性鲁棒性

    开发了一个新的基准测试,以研究大型语言模型(LLMs)的提示优化技术是否会削弱它们对抗恶意攻击(特别是提示注入)的鲁棒性。初步研究结果表明,虽然提示优化可以提高在干净数据集上的准确性,但可能会导致对抗提示注入攻击的安全性下降。该基准测试旨在弥合提示优化和提示注入研究社区之间的差距,这两个社区历史上一直独立运作。

  12. TOOL · CL_98011 ·

    新模拟器利用自适应语音模型自动化空中交通管制员培训

    研究人员开发了ASTRA,一个旨在通过自动化人类模拟飞行员角色来培训空中交通管制员(ATCOs)的新模拟器。该系统通过微调自动语音识别(ASR)模型,解决了现有以西方为中心、在新加坡口音的航空语音方面表现不佳的语音模型的局限性。ASTRA显著将词错误率(WER)降低至23.45%,并包含一个人工智能辅助的学员沟通绩效评估框架。

  13. COMMENTARY · CL_58468 ·

    开发者评测10款AI Agent框架,包括LangGraph、CrewAI

    本文对十个AI Agent框架进行了实际评测,重点关注其对开发者的实际应用。作者测试了LangGraph、CrewAI、AutoGen和OpenAI的Agents SDK等工具,深入分析了它们的优缺点。该指南旨在帮助开发者根据实际实验选择适合自己需求的框架。

  14. RESEARCH · CL_53488 ·

    新研究深入探讨提示词优化的有效性和可解释性

    两篇新研究论文探讨了提示词优化对于大型语言模型(LLMs)的有效性和可解释性。第一篇论文 iPOE 介绍了一种使用自动生成的标注决策指南来使提示词优化透明化并提高性能高达 39% 的方法。第二篇论文分析了提示词优化有时为何会失败,发现某些类型的编辑会负面影响推理任务,而另一些则会改善它们,这表明需要进行面向任务的优化器设计。

  15. TOOL · CL_50817 ·

    新框架量化复合 AI 系统中的扰动传播

    研究人员推出 QUIVER,这是一个新的正式框架,旨在衡量扰动如何在链接多个大型语言模型调用的复合 AI 系统中传播。该框架通过将边分类为放大器或吸收器来量化敏感性,并将变化分解为值漂移、结构路径发散和迭代次数发散。QUIVER 还识别分叉阈值(导致结构执行路径改变的最小扰动)并评估分布忠实度。在企业和公共管道上的验证表明,QUIVER 能够揭示不同的敏感性特征并预测易发生轨迹分叉的节点。

  16. COMMENTARY · CL_43793 ·

    AI应用开发需要专门的技木栈而非传统技木栈

    开发AI应用需要专门的技木栈,这与传统的Web开发不同,因为LLM的非确定性。Python和JavaScript/TypeScript被推荐用于AI工作流,因为它们更符合模型的训练方式,从而带来更可预测的结果。基于Flutter或Swift等不太常见的生态系统构建的技木栈可能会带来摩擦和错误,因为模型难以理解它们的项目结构和构建系统。

  17. TOOL · CL_28309 ·

    Neural1.5方法在临床问答任务中排名第二

    研究人员开发了Neural1.5,一种用于ArchEHR-QA 2026临床问答任务的方法,该任务包括四个子任务:问题解释、证据识别、答案生成和证据对齐。他们的方法使用DSPy的MIPROv2优化器为每个阶段自动发现有效的提示和少样本演示。通过采用自一致性投票和特定阶段的验证机制,该方法在所有四个子任务中均在参与者中获得第二名的总排名。

  18. TOOL · CL_26764 ·

    Nous Research 发布 Hermes AI 代理以实现快速数据分析

    Nous Research 推出了 Hermes,一个用于快速数据收集和分析的进化式 AI 代理框架。与需要为特定任务进行大量编程和微调的 DSPy 不同,Hermes 为初始数据收集和趋势分析提供了一种更简化的方法。该框架设想用于内容工具、情报分析和个性化内容生成等应用。

  19. RESEARCH · CL_45546 ·

    详细介绍LLM输出验证和效率策略

    多篇文章讨论了在生产环境中处理大型语言模型(LLM)输出的稳健方法,强调需要超越简单的JSON格式进行结构化验证。文章重点介绍了Pydantic和JSON Schema等技术,用于在LLM生成的数据集成到下游系统之前强制执行数据完整性,确保其符合预定义的结构。讨论还涵盖了提高LLM效率和可靠性的策略,包括使用缓存层来降低API成本,以及使用DSPy等框架进行声明式提示编程以自动化提示优化。

  20. RESEARCH · CL_25333 ·

    提示工程通过自动化优化和结构化技术取得进展

    提示工程正演变为一门系统性学科,超越简单的指令,发展出用于优化大型语言模型(LLM)输出的高级技术。DSPy 等工具可自动进行提示结构和示例选择,将提示编写转变为一个程序化过程。建议开发者像对待代码一样对待提示,专注于结构化格式,如 XML 标签、精选的少样本示例以及明确的推理步骤(如思维链),以在 LLM 性能方面实现可靠、可衡量的改进。