一位开发者在实际编码任务中测试了 Anthropic 的 Opus 4.6 和 Google 的 Gemma 4 两款大型语言模型。Opus 4.6 在八分钟内成功实现了一个网站的复杂搜索功能,创建了 Command-K 对话框和专用搜索页面。相比之下,Gemma 4 尽管最近的基准测试声称性能很高,但未能完成任务。 AI
影响 凸显了大型语言模型在基准测试性能与实际编码能力之间的差距。
排序理由 这是对两款大型语言模型在编码任务上的比较,并非新模型发布或重大行业事件。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →