PulseAugur
实时 07:12:42
Français(FR) Un system prompt se reconstitue à partir d'une seule réponse

新方法仅凭输出来重建大型语言模型提示

来自印度理工学院孟买分校和 Adobe Research 的研究人员开发了一种名为“前向标记预测”(PTP)的方法,该方法仅凭生成的文本即可从模型中重建其原始提示。该技术训练一个逆向模型来预测前一个标记而不是下一个标记。在一个像 Qwen-3-0.6B 这样的小型开源模型上训练的 PTP 模型,即使不知道是哪个模型生成了输出,也能准确推断出发送给 GPT-4o 等大型专有模型的提示的意图和含义。虽然目前的演示仅限于短提示,但它引发了对公司使用的专有系统提示安全性的担忧。 AI

影响 引发了对专有系统提示安全性的担忧,并可能影响公司保护其 AI 指令的方式。

排序理由 研究论文,详细介绍了提示重建的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法仅凭输出来重建大型语言模型提示

报道来源 [1]

  1. dev.to — LLM tag TIER_1 Français(FR) · Thibault Monteiro ·

    系统提示可从单个响应中重建

    <p>L'essentiel</p> <ul> <li> Des chercheurs de l'IIT Bombay et d'Adobe Research reconstituent le prompt d'origine à partir du seul texte produit par un modèle, sans accès à ses poids.</li> <li> Leur méthode, baptisée « Previous-Token Prediction », entraîne un modèle inverse qui p…