PulseAugur
中
实时 16:49:41
Polski(PL) Local LLM Arena #5 Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekonieczn

GPT-OSS-20B在基准测试成功后,在实际编码任务中遇到困难

一位用户测试了GPT-OSS-20B本地LLM的编码任务,发现尽管基准测试结果强劲,但在实际的多步项目中表现不佳。该模型未能完成五个编码任务,表明其在基准测试上的表现与其处理实际开发工作的能力之间存在显著差距。用户还遇到了测试环境的问题,包括Antigravity消耗了过多的内存,导致系统重启。最终,用户决定不再为日常编程需求进一步测试GPT-OSS,而是选择继续使用Codex和Antigravity。 AI

影响 凸显了LLM基准测试表现与编码任务实际应用之间的差距。

排序理由 用户对特定LLM表现的测试和意见。

在 Mastodon — mastodon.social 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

GPT-OSS-20B在基准测试成功后,在实际编码任务中遇到困难

本文如何被排名

Signal score
0 / 100
Composite score across the factors below. Higher = stronger signal that this story matters right now.
Newsworthiness bucket
Commentary
用户对特定LLM表现的测试和意见。
Source corroboration
2 independent sources
Multiple independent publishers reporting the same story raises confidence that it's real and newsworthy.
Topics
model release, product
Editorial topic classification. Feeds into how the story surfaces on /topic/<slug> hub pages and into the per-entity coverage mix.
AI-industry relevance
High
Clearly on-topic for AI-industry coverage.
Story freshness
37 days old
Aged out of breaking-news scoring windows; ranking reflects the durable signal from the full source set.

完整方法见我们的编辑标准。

报道来源 [2]

  1. Mastodon — mastodon.social TIER_1 Polski(PL) · [email protected] ·

    本地大模型竞技场 #7:初期,GPT-OSS-20B给我留下了非常好的印象。在编码基准测试中,它与Qwen打平,同时速度快了约5倍

    Local LLM Arena #7 Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem. Przygoto…

  2. Mastodon — mastodon.social TIER_1 Polski(PL) · [email protected] ·

    本地大模型竞技场 #5 GPT-OSS 作为本地编程代理的首次真正测试带来了比我预期的更多信息 - 只是不一定

    Local LLM Arena #5 Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu. Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lok…