PulseAugur
实时 17:54:00
English(EN) Can You Beat an LLM? Building Humans vs. Humanity's Last Exam

开发者构建测试人类 vs. AI 在专家级考试中的表现

一位开发者创建了一个名为“人类 vs. 人类最后的考试”的网页测验,让玩家与先进的 AI 模型在具有挑战性的学术问题上进行较量。该测验使用了“人类最后的考试”数据集,并在 Cloudflare Workers 上运行,采用加密和服务器端验证来防止作弊。玩家分数使用 Cloudflare Durable Objects 在排行榜上进行跟踪,开发过程本身使用一种名为 Entire 的工具进行了记录。 AI

影响 该项目突显了 AI 模型在复杂学术任务上的能力日益增强,并提供了一个比较人类和 AI 表现的平台。

排序理由 该项目描述了一个由开发者创建的应用程序,该应用程序使用了现有的 AI 模型和基础设施,而不是来自前沿实验室的新发布或重大的行业事件。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

开发者构建测试人类 vs. AI 在专家级考试中的表现

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Lizzie Siegle ·

    你能打败大型语言模型吗?构建人类 vs. 人类最后的考试

    <p>Frontier models are crushing benchmark after benchmark...so I built a quiz to ask this simple yet humbling question: can a human still beat them?</p> <p><strong>Humans vs. HLE</strong> is a web-based quiz that pits you against frontier AI models on <a href="https://agi.safe.ai…