研究人员开发了一个名为定向反事实指纹技术(TCF)的新框架,用于在只能通过黑盒API访问大型语言模型(LLM)时验证其所有权。TCF将开放式生成比较转化为受限答案的定向反事实迁移,减少了验证分数中的歧义。该方法优化了提示扰动以实现反事实目标,并使用一种仅受保护模型可获取的数量,称为源模型反事实边际(SCM),来认证目标的可能性。在四个大语言模型家族中,TCF的平均AUC为0.9861,优于TRAP、ProFLingo和ZeroPrint等现有方法。 AI
影响 这项研究为在黑盒场景下验证大语言模型所有权提供了一种更稳健的方法,可能影响知识产权保护和模型安全。
排序理由 该集群包含一篇详细介绍大语言模型所有权验证新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- LLMs
- ProFLingo
- source-model counterfactual margin
- Targeted Counterfactual Fingerprinting
- ZeroPrint
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →