一位德州房地产经纪人开发了一个名为DeskBench-RE的基准测试,以评估前沿AI模型在执行真实世界案头任务方面的能力。该基准测试显示,包括GPT-6-ASTRA、Claude-Opus-5-5和Gemini-3.8-flash在内的AI模型在包裹数学和外联草稿等任务上表现良好,每个模型的成本不到二十分。然而,评估因基准测试自身预期答案中的错误和不一致而受到严重阻碍,导致模型被错误地评分过低。 AI
影响 证明了当前前沿模型能够经济高效地处理复杂、特定领域的任务,但突显了对准确可靠的评估基准的迫切需求。
排序理由 该项目描述了一个为评估AI模型在特定真实世界任务上的表现而创建的自定义基准测试,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- Anthropic
- claude-opus-5-5-default
- DeepSeek
- DeepSeek R1-0528
- DeskBench-RE
- eXp Realty
- Kaggle
- OpenAI
- Texas
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →