Promptfoo
PulseAugur coverage of Promptfoo — every cluster mentioning Promptfoo across labs, papers, and developer communities, ranked by signal.
- 2026-05-20 product_launch Promptfoo integrates its attack plugins with the OWASP LLM Top 10 2025 security categories. 来源
5 天有情绪数据
-
新的LLM-RedKit工具针对具身提示注入漏洞
一款名为LLM-RedKit的新型开源工具已被开发出来,以应对针对AI代理的提示注入攻击不断演变的威胁。与之前专注于静态提示的工具不同,LLM-RedKit专门测试具身提示,这些提示可以通过将恶意命令伪装成常规任务来欺骗模型执行意外操作,例如发送电子邮件或删除用户。该工具支持各种代理框架,并提供详细报告,将发现与OWASP LLM Top 10和MITRE ATLAS等既定安全框架进行映射。
-
LLM聊天机器人测试清单强调基于属性的断言和OWASP安全
测试LLM聊天机器人和RAG应用需要从传统的确定性检查转向基于属性的断言,重点关注所需事实、拒绝范围外查询以及遵守格式。开发人员应单独测试检索和生成步骤,使用Ragas等工具进行上下文召回和忠实度指标。安全测试应纳入LLM应用OWASP Top 10,解决提示注入、敏感数据泄露和系统提示泄露问题,同时验证是否符合AI Act的透明度要求。
-
Langfuse、Phoenix、Promptfoo 和 Iris:AI 代理评估工具对比
四款不同的工具——Langfuse、Arize Phoenix、Promptfoo 和 Iris——提供了评估 AI 代理性能的不同方法。Langfuse 和 Arize Phoenix 是已集成评估功能的观测平台,其中 Langfuse 使用 SDK,Arize Phoenix 利用 OpenTelemetry。Promptfoo 作为 LLM 应用的命令行测试运行器,而 Iris 是一个旨在通过确定性规则评估代理跟踪的评估服务器。…
-
Promptfoo 为 LLM 提示词启用测试驱动开发
Promptfoo 是一款开源命令行工具,旨在为大型语言模型提示词启用测试驱动开发。它允许用户在 YAML 配置中定义提示词、提供者和测试用例,比较不同提示词版本,并断言其输出质量。这种方法旨在防止出现发布未经测试的提示词等问题,这些问题可能导致退款机器人故障等意外行为。该工具支持离线测试的确定性断言,并可集成到 CI/CD 管道中。
-
新工具 muteval 通过降级系统来查找缺失的 LLM 测试
一个名为 muteval 的新工具旨在通过识别缺失的测试(而不是仅仅报告现有失败的测试)来解决 LLM 测试中的一个关键盲点。与传统的测试运行器不同,muteval 会通过移除规则或削弱参数来故意降级系统,然后重新运行现有的测试套件。如果输出发生变化但所有断言仍然通过,它就会将此标记为“幸存者”,表明测试覆盖范围存在需要关注的差距。这种方法有助于开发人员发现当前测试套件未涵盖的行为,从而提供对评估完整性的不同视角。
-
TypeScript实验比较Agent轨迹检查工具
本文是一篇简短的技术笔记,讨论了一个小的TypeScript实验。它比较了两种工具AgentInspect和Promptfoo,用于在本地执行Agent轨迹检查。该实验侧重于AI Agent的编码和软件开发方面。
-
Promptfoo 升级至 GPT-5.6+,TRL 训练超越 100 万 token
Promptfoo 已将其默认模型更新为 GPT-5.6+,这表明 AI 工具正朝着更先进的语言模型发展。同时,Transformer Reinforcement Learning (TRL) 已展示出超越 100 万 token 的训练能力,预示着在处理更长上下文长度方面取得了重大进展。
-
生成式AI测试确保AI输出的准确性、安全性和公平性
生成式AI测试对于确保AI输出的准确性、安全性和公平性至关重要,因为这些模型可能产生错误或有害内容。该过程包括定义测试用例、运行AI模型并将结果与既定标准进行比较,重点关注准确性、安全性、偏见和性能等关键领域。采用提示测试和人工审查等各种技术,并辅以DeepEval、TruLens和Promptfoo等工具,以在部署前识别和纠正问题。
-
发布工程领域排名前五的LLM评估框架排名
最近的一项分析强调,Promptfoo是发布工程领域领先的LLM评估框架,尤其因其能够阻止构建失败测试的CI/CD集成而备受关注。DeepEval推荐用于基于Python的测试套件,并提供与pytest的无缝集成。LangSmith因其强大的托管可追溯性和实验历史而受到关注,适合优先考虑详细记录的团队。OpenAI Evals因其可重用的评估规范而受到认可,而Ragas则被确定为评估检索增强生成(RAG)质量的专业工具。评估标准侧重于…
-
Microsoft 存档 PyRIT LLM 红队测试工具;替代方案出现
Microsoft 已于 2026 年 3 月 27 日在 GitHub 上存档了其开源 LLM 红队测试框架 PyRIT。这意味着该工具不再接收更新、提交或问题分类,使其成为构建自定义攻击序列的不可靠基础。对于寻求替代方案的用户,推荐使用 promptfoo 进行应用层扫描,garak 进行模型层测试,Giskard 进行付费连续扫描,以及 sentinel-scan-cli 进行快速、无依赖的烟雾测试。
-
用于LLM提示注入测试的开源工具对比
存在一些开源工具可用于测试LLM应用程序是否存在提示注入漏洞,但它们不能互换使用,并且满足不同的测试需求。Promptfoo、Giskard和sentinel-scan-cli专注于应用层测试,评估应用程序的提示和逻辑,其中Promptfoo被广泛采用,并被OpenAI和Anthropic等公司使用。Garak由NVIDIA维护,是一个模型层工具,独立于应用程序测试底层模型的攻击易感性。Microsoft的PyRIT已归档,曾提供多轮…
-
新工具evalmut通过故意损坏的模型测试LLM评估套件
一个名为evalmut的新工具被开发出来,通过引入变异测试来解决LLM评估套件的局限性。该工具包含一个由六个确定性模型组成的“参考舰队”,每个模型都以特定、有据可查的方式故意损坏。这种方法旨在提供一种更严格、可验证的测试LLM评估套件的方法,类似于计量学中使用的认证参考物质。初步测试表明,基本的评估套件会遗漏相当一部分缺陷类别,这凸显了对更健壮的测试方法的需求。
-
Z.ai 的 GLM-5.3 为 dev.to 的内容管道提供支持,指令遵循能力得到提升
Z.ai 发布了其最新模型 GLM-5.3,该模型现已为 dev.to 的日常内容管道提供支持。据早期观察,通过与 OpenAI 兼容的 API 即可访问的新模型在指令遵循和代码推理方面表现出更强的能力。集成过程无缝,仅需更改模型 ID 字符串,没有其他迁移障碍。
-
Promptfoo 提供评估驱动的提示词开发
Promptfoo 是一款旨在通过取代主观判断来改进 AI 提示词开发的工具。
-
研究发现代理系统提示可能会损害 LLM 性能
一项衡量代理系统提示有效性的实验发现,大多数提示实际上会降低模型性能。Anthropic 的 Boris Cherny 指出,在删除了 Claude Code 80% 的系统提示后,其智能水平有所提高。作者使用 Charlie Hills 的协议进行了自己的审计,测试了 19 种代理配置,将它们的系统提示替换为基本的助手提示,结果发现其中 15 种得分较低,表明这些提示阻碍了性能而非增强了性能。
-
Bonsai 27B 2位模型在本地使用方面显示出潜力,但在复杂任务上表现滞后
最近的一项比较在MacBook M1上评估了Bonsai 27B 2位模型与Qwen3 14B、GPT OSS 20B和Gemma 4-12B等其他本地LLM。Bonsai 27B在较短的任务上表现良好,成功完成了包括数学、代码生成和工具调用在内的十项基本技能测试中的九项,展示了其在内存有限设备上的能力。然而,它在复杂的、多步计算任务上遇到了困难,返回了一个空列表,而Qwen3 14B尽管存在轻微的计算错误,但对于此类要求更高的任务来…
-
EvalPort 推出 11 种评分器类型,实现灵活的 LLM 评估
EvalPort 开发了一个灵活的评分器系统,旨在适应各种 LLM 评估框架。该系统具有 11 种不同的评分器类型,每种类型都有特定的参数和评估方法,旨在广泛应用于实际场景。这种设计使得评估套件能够自描述,并允许不同的框架使用标准化的评分器 ID 来实现和比较结果。
-
本地分类器取代昂贵的 LLM 作为评判者,用于 AI 评估
一种替代使用大型语言模型(LLM)进行评估的方法已被开发出来,解决了基于 API 的评判所带来的高成本和延迟问题。这种新方法采用本地二元分类器,使用句子转换器和逻辑回归进行训练,以区分好与坏的响应。该系统在编码问答数据集上实现了约 75% 的准确率,并且成本显著降低、速度更快,使其适用于持续集成管道和 API 访问受限的环境。
-
OpenAI收购Promptfoo引发对LLM评估独立性的辩论
OpenAI对Promptfoo的收购促使人们重新评估LLM评估工具,突显了对供应商依赖和成本的担忧。作者提出了一种替代方法,使用自定义训练的分类器,结合Sentence Transformers和逻辑回归,该方法提供离线执行、供应商独立性以及比基于LLM的评分方法更快的评估速度。这种方法需要标记的训练数据,但为CI/CD管道提供了一种经济高效且可控的解决方案。
-
大型语言模型提示词修改绕过测试,导致准确率显著下降
在对系统提示词进行了一个微小的单词修改后,大型语言模型提取准确率从0.87显著下降到0.78。这暴露了当前大型语言模型应用开发中的一个关键漏洞:提示词的更改通常会绕过代码所经历的严格测试和验证。作者提倡在持续集成(CI)管道中实施一个“提示词回归门”,其中包括一个固定的评估数据集、一个一致的评分指标和一个增量阈值,以防止有害的提示词修改。