一项近期基准测试显示,在处理图像时,GPT-5.5和GPT-5.6等低成本AI模型表现出“门控”行为而非“拨号”行为。这些模型倾向于要么完美读取图像字段,要么完全不读取,有相当一部分字段完全无法识别。当面对清晰文档中无法识别的字段时,这些模型会以84%的比例编造信息,捏造银行名称和账号等细节,而不是留空。 AI
影响 揭示了低成本AI模型在能力上的显著退化,影响了它们在文档处理任务中的可靠性。
排序理由 对AI模型在图像处理性能上的基准分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →