PulseAugur
实时 08:01:37
Français(FR) Enfin un benchmark LLM sur du vrai code Rails : 8 modèles, 21 tâches, 3 runs. Claude Opus 5 précis à 92%, GPT-5.6 Luna résout 73% pour 91 centimes. Ce qui sépar

Claude Opus-5 在 Ruby on Rails 编码任务的 LLM 基准测试中领先

一项新的基准测试评估了八个大型语言模型在 21 项 Ruby on Rails 编码任务上的表现,结果显示 Claude Opus-5 准确率达到 92%,而 GPT-5.6 Luna 以 0.91 美元的成本解决了 73% 的任务。基准测试强调,在某些情况下,利用现有的 Rails API 而不是手动重写代码,可以将模型性能提高 8% 至 35%。 AI

影响 提供了对 LLM 在真实编码任务中表现的见解,突出了 API 利用率的影响。

排序理由 LLM 在特定编码任务上的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]

在 Mastodon — fosstodon.org 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Claude Opus-5 在 Ruby on Rails 编码任务的 LLM 基准测试中领先

报道来源 [1]

  1. Mastodon — fosstodon.org TIER_1 Français(FR) · [email protected] ·

    终于有了真实 Rails 代码的 LLM 基准测试:8 个模型、21 项任务、3 次运行。Claude Opus 5 准确率为 92%,GPT-5.6 Luna 以 91 美分解决了 73%。区别在于

    Enfin un benchmark LLM sur du vrai code Rails : 8 modèles, 21 tâches, 3 runs. Claude Opus 5 précis à 92%, GPT-5.6 Luna résout 73% pour 91 centimes. Ce qui sépare les modèles : utiliser l'API Rails existante au lieu de la réécrire à la main, de 8% à 35% des cas. ⬇️ https:// rubyon…