一篇新的arXiv论文比较了五种领先的LLM——ChatGPT Thinking 5 Pro、Claude Sonnet 4.5 Pro、Claude CoWork 1.123、Gemini Advanced 2.5 Pro、Incredible 1.0和DeepSeek 3.2——利用合成数据复制人类调查响应的能力。研究发现,虽然这些模型可以生成看似合理且协调一致的结果,但它们未能捕捉到人类数据中存在的新颖或反直觉的见解。研究表明,当前的LLM擅长复述传统观点,但不擅长发现独特的成果,这凸显了负责任地使用合成调查数据需要健全的验证协议。 AI
影响 强调了LLM在生成新颖见解方面的局限性,表明合成数据应作为人类研究的补充而非替代。
排序理由 该集群包含一篇详细介绍LLM能力研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- ChatGPT Thinking 5 Pro
- Claude CoWork 1.123
- Claude Sonnet 4.5 Pro
- DeepSeek 3.2
- Gemini Advanced 2.5 Pro
- Incredible 1.0
- Silicon Valley
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →