PulseAugur
中
实时 12:41:28
实体 DSPy

DSPy

PulseAugur coverage of DSPy — every cluster mentioning DSPy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_276066 ·

    2026年 RAG框架:LlamaIndex、LangChain、Haystack、DSPy、RAGFlow 对比

    截至2026年,检索增强生成(RAG)框架已成为LLM应用的标配,有多种主流选择。LlamaIndex在文档RAG方面表现出色,拥有先进的解析和工作流;LangChain和LangGraph提供强大的代理式管道和广泛的集成;Haystack提供明确、可测试的管道;DSPy优化提示;RAGFlow提供可自托管的RAG引擎。对于简单需求,OpenAI和Anthropic等提供商的SDK可能就足够了,同时混合架构也在兴起。

  2. COMMENTARY · CL_274397 ·

    提示词优化陷阱:准确率 vs. AUROC 以获得更好的 LLM 性能

    一种仅依赖准确率的提示词优化技术可能导致模型无效,尤其是在数据集不平衡的情况下。作者解释说,提示词优化器(如 DSPy)本质上是爬山算法,它们针对给定的标量指标进行优化,如果优先考虑准确率而不是排名行为等其他因素,这可能会产生误导。一篇论文被重点介绍,该论文提出了一种通过在评估中使用正负样本对将优化目标从准确率更改为 AUROC(接收者操作特征曲线下面积)的方法,这更好地反映了排名很重要的实际部署场景。

  3. TOOL · CL_268703 ·

    新的 MoMHa 系统优化 LLM Harness,平衡准确性、安全性和 Token 成本

    研究人员开发了 MoMHa,一个用于优化大型语言模型 (LLM) Harness 的新系统。与以往只关注准确性的方法不同,MoMHa 将准确性、行为安全性和 Token 成本视为多目标标准。该系统利用一个具有代理功能的提案者 Claude Code,该提案者可以广泛访问先前的 Harness 设计和执行数据,以搜索最优的 Harness 配置。在合成和真实世界基准测试中,使用 12 种不同模型的评估表明,MoMHa 在联合奖励、行为安…

  4. TOOL · CL_269226 ·

    DSPy 编程框架移植到 Elixir 以实现 BEAM 并发

    Imp 是一个新框架,将 DSPy 编程范式引入 Elixir 语言和 BEAM 虚拟机。这使得开发人员能够利用 Elixir 的 OTP 的可靠性和并发特性来构建自改进的、声明式的语言模型应用程序。Imp 负责提示生成、响应解析和优化,从而无需手动进行提示工程即可创建复杂的代理和使用工具的系统。

  5. TOOL · CL_256159 ·

    TypeSafe 发布 Jev AI 以实现结构化工作流决策

    TypeSafe 推出了 Jev,一个新的人工智能模型,旨在用于后台工作流中的结构化决策,而非对话式响应。Jev 为预定义的类别提供概率,使软件能够自动化诸如路由客户服务请求或分类交易等流程。这种方法使用为校准决策而设计的强化学习(RLCD)进行训练,旨在实现速度和成本效益,TypeSafe 将 Jev 定价为每十亿个 token 42 美元,并提供免费的输出 token。

  6. TOOL · CL_207701 ·

    六种提示优化框架的有效性对比

    最近的一项分析比较了六种提示优化框架:DSPy、GEPA、TextGrad、agent-opt、Arize Prompt Learning 和 MLflow 的优化器。研究发现,这些框架不能互换使用,因为它们代表了从完整编程模型到单一算法和平台功能的各种不同方法。有效性的关键区别在于能否针对用户自己的数据集上的特定指标进行优化,而易于更换搜索算法是一个重要因素。

  7. TOOL · CL_196941 ·

    DSPy 框架为 AI 系统提供结构化签名

    DSPy 是一个 Python 框架,旨在通过使用结构化签名而非直接提示来构建 AI 系统。该框架旨在为开发 AI 应用程序提供一种更有条理的方法。然而,关于增加的抽象层是否会损害发送给 AI 模型的提示的透明度,仍存在疑问。

  8. TOOL · CL_185097 ·

    DSPy框架将面向对象原则应用于LLM提示词工程

    由斯坦福大学开发的DSPy框架为大型语言模型的提示词工程引入了面向对象的方法。它将稳定的接口(或称“签名”)与实现细节分离开来,允许开发人员定义输入-输出契约,而无需指定提示词措辞。这使得模型切换更加容易,因为签名保持不变,而DSPy会为新模型重新编译提示词。该框架使用优化器,根据标记数据和定义的指标,类似于编译器,搜索最佳的提示词措辞和少量示例。

  9. TOOL · CL_180284 ·

    GEPA方法使用AI评论优化LLM提示,无需GPU

    一种名为GEPA(Genetic-Pareto Evolutionary Prompt Adaptation)的新方法已被推出,旨在优化LLM管道,而无需为微调投入大量GPU资源。GEPA由加州大学伯克利分校Sky Computing Lab的研究人员开发,并在ICLR 2026的口头论文中进行了详细介绍。GEPA利用LLM生成的评论来演进提示,其性能优于GRPO和PPO等现有方法。这种方法适用于任何黑盒LLM,包括GPT-4o、Cl…

  10. RESEARCH · CL_178388 ·

    LLM通过编译代码生成企业工作流,以提高可靠性

    两篇研究论文探讨了从大型语言模型生成可执行代码以自动化企业工作流的方法,重点关注可靠性和效率。第一篇论文详细介绍了在评估六个LLM用于工作流生成过程中吸取的经验教训,强调了一个分段式管道显著提高了成功率,并使Mistral Small等较小模型也变得可行。第二篇论文介绍了“编译型AI”范式,在该范式中,LLM在编译阶段生成代码,从而实现确定性执行,无需进一步的模型调用,并展示了其在医疗保健领域执行函数调用和文档智能等任务的有效性。

  11. TOOL · CL_172757 ·

    DSPy 的新 RLM 模块解决了 LLM 上下文遗忘问题

    DSPy 框架引入了一个新模块 dspy.RLM,旨在解决大型语言模型(LLM)中的“上下文遗忘”(context rot)问题。这一现象由麻省理工学院(MIT)的研究人员发现,指的是模型在需要跨越整个上下文窗口进行推理的任务上性能下降,即使上下文窗口很大。DSPy 的递归语言模型(RLM)通过使模型能够以编程方式探索超大提示(oversized prompts),而不是一次性处理它们,来提供解决方案。

  12. TOOL · CL_169800 ·

    Prompt engineering 提升小型语言模型在查询路由中的表现

    一篇新的 arXiv 论文探讨了 Prompt Engineering 技术在小型语言模型(SLMs)执行受保护查询路由方面的有效性。该研究在 GQR-Bench 数据集上评估了 22 个 SLMs,重点关注它们路由分布内查询和拒绝分布外查询的能力。结果表明,Prompt 优化显著提高了紧凑型模型的性能,其中 Mistral 7B 和 Qwen3.5 9B 取得了显著的提升。研究表明,Prompt 优化是 SLMs 在此任务中的一个有…

  13. TOOL · CL_130800 ·

    Anthropic 的 Fable 模型在揭示隐藏的任务假设方面表现出色

    来自 Anthropic 的 AI 模型 Fable 因其揭示复杂任务中隐藏决策和假设的能力而受到关注。与擅长执行预定义计划的模型不同,Fable 特别擅长识别“未知数”——即提示与现实世界约束之间的差距。当任务的复杂性并非源于规模,而是源于未经审视的目标或标准时,这种能力就很有价值,它允许用户在执行之前或执行过程中完善他们的目标。

  14. TOOL · CL_126902 ·

    DSPy 框架被重新定义为 LLM 的编程工具

    DSPy 框架不仅被呈现为一种改进提示词编写的工具,更被视为一种用于编程语言模型的系统。其核心价值在于将任务契约(输入、输出、可衡量示例)与提示词本身分离开来,允许优化器在不改变基本业务逻辑的情况下改进提示词。成功采用的关键在于三个关键分离:任务契约与提示词的分离,编译正确性与运行时行为的分离,以及检索质量与最终答案质量的分离。没有这些分离,DSPy 可能不适合特定任务的抽象。

  15. TOOL · CL_122472 ·

    DSPy 框架增强 Datasette Agent 的 SQL 提示生成

    Simon Willison 探讨了使用 DSPy 框架来增强 Datasette Agent 的系统提示,Datasette Agent 是一个用于回答数据相关问题的 SQL 查询生成工具。他要求 Claude Code 评估和改进这些提示,特别是关注代理如何列出表模式以及提供关于使用 `describe_table` 的建议。使用 GPT-4.1 mini 和 nano 进行的测试表明,在模式列表中包含列名或调整关于 `descr…

  16. TOOL · CL_116442 ·

    新基准测试表明,提示优化可能会削弱大型语言模型的对抗性鲁棒性

    开发了一个新的基准测试,以研究大型语言模型(LLMs)的提示优化技术是否会削弱它们对抗恶意攻击(特别是提示注入)的鲁棒性。初步研究结果表明,虽然提示优化可以提高在干净数据集上的准确性,但可能会导致对抗提示注入攻击的安全性下降。该基准测试旨在弥合提示优化和提示注入研究社区之间的差距,这两个社区历史上一直独立运作。

  17. TOOL · CL_98011 ·

    新模拟器利用自适应语音模型自动化空中交通管制员培训

    研究人员开发了ASTRA,一个旨在通过自动化人类模拟飞行员角色来培训空中交通管制员(ATCOs)的新模拟器。该系统通过微调自动语音识别(ASR)模型,解决了现有以西方为中心、在新加坡口音的航空语音方面表现不佳的语音模型的局限性。ASTRA显著将词错误率(WER)降低至23.45%,并包含一个人工智能辅助的学员沟通绩效评估框架。

  18. COMMENTARY · CL_58468 ·

    开发者评测10款AI Agent框架,包括LangGraph、CrewAI

    本文对十个AI Agent框架进行了实际评测,重点关注其对开发者的实际应用。作者测试了LangGraph、CrewAI、AutoGen和OpenAI的Agents SDK等工具,深入分析了它们的优缺点。该指南旨在帮助开发者根据实际实验选择适合自己需求的框架。

  19. RESEARCH · CL_53488 ·

    新研究深入探讨提示词优化的有效性和可解释性

    两篇新研究论文探讨了提示词优化对于大型语言模型(LLMs)的有效性和可解释性。第一篇论文 iPOE 介绍了一种使用自动生成的标注决策指南来使提示词优化透明化并提高性能高达 39% 的方法。第二篇论文分析了提示词优化有时为何会失败,发现某些类型的编辑会负面影响推理任务,而另一些则会改善它们,这表明需要进行面向任务的优化器设计。

  20. TOOL · CL_50817 ·

    新框架量化复合 AI 系统中的扰动传播

    研究人员推出 QUIVER,这是一个新的正式框架,旨在衡量扰动如何在链接多个大型语言模型调用的复合 AI 系统中传播。该框架通过将边分类为放大器或吸收器来量化敏感性,并将变化分解为值漂移、结构路径发散和迭代次数发散。QUIVER 还识别分叉阈值(导致结构执行路径改变的最小扰动)并评估分布忠实度。在企业和公共管道上的验证表明,QUIVER 能够揭示不同的敏感性特征并预测易发生轨迹分叉的节点。