研究人员推出了SLAPBench,这是首个旨在评估多模态大语言模型(MLLM)在四指SLAP指纹验证方面的基准测试。该基准测试使用NIST SD302b数据构建,用于测试MLLM从SLAP图像(四指的平面活体扫描印记)中验证身份的能力。初步评估表明,提示策略对模型性能有显著影响,某些提示会导致多个开源模型出现近100%的错误接受率。Claude Opus 4.8在应对这些提示问题方面表现出卓越的韧性,取得了最佳的二元验证结果,而其他模型在区分能力方面表现各异,其中一个模型取得了完美的得分,这需要进一步调查是否存在潜在的捷径。 AI
影响 为评估MLLM在生物识别验证方面建立了一个新的基准,强调了提示对模型性能和潜在捷径的影响。
排序理由 该项目描述了一个新的基准测试和研究论文,评估现有模型在新型任务上的表现。 [lever_c_demoted from research: ic=1 ai=1.0]
- Claude Opus 4.8
- Four-finger SLAP fingerprints
- Gemma-3-12B
- InternVL3-8B
- multimodal large language models
- NIST SD302b
- Qwen2.5-VL-7B
- Qwen3-VL-8B
- SLAPBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →