据报道,谷歌的新Gemini 4模型在官方基准测试中表现强劲,但内部反响不一。尽管谷歌声称Gemini 4的表现优于OpenAI的GPT-6 Astra等竞争对手,但有员工 reportedly 认为其日常表现,尤其是在编码任务方面,与基准测试结果相比有所欠缺。该公司否认了这些说法,坚称Gemini仍处于人工智能领域的前沿,并强调了其技术进步,例如一百万token的上下文窗口和具有竞争力的定价。 AI
影响 关于AI模型表现的内部辩论凸显了将基准测试转化为实际效用的挑战,可能影响未来的开发重点。
排序理由 该集群讨论的是关于模型表现的内部意见和报告,而不是正式发布或基准测试公告。
在 Mastodon — mastodon.social 阅读 →
- Android
- Anthropic
- Bloomberg
- Gemini 4
- Gemini 4 Argon
- Google DeepMind
- GPT-6 Astra
- Koray Kavukcuoglu
- OpenAI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →