对俄罗斯 AI 助手 YandexGPT 和 GigaChat 的两项独立测试产生了冲突的结果,凸显了当前 AI 评估方法的固有主观性。一项测试发现 YandexGPT 是一个可靠的工作伙伴,而 GigaChat 在多模态任务上表现出色,尽管存在幻觉倾向。相反,另一项评估则青睐 YandexGPT 在分析和创意任务上的表现,评分远高于 GigaChat。这两个模型在俄罗斯境内均提供免费访问,但拥有不同的代币配额系统和货币化策略,在没有标准化、客观基准的情况下,直接比较变得困难。 AI
影响 AI 模型评估结果的冲突,突显了制定标准化基准以指导用户采用和发展的必要性。
排序理由 文章讨论了 AI 模型独立测试结果的冲突,强调了当前评估方法存在的问题,而非宣布新版本或重大行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →