TypeSafe AI发布了Jev,一个“System One”模型,旨在做出小型、具体的决策,而不是生成文本。Jev从固定集合中返回选择、评分或校准的概率,旨在提高信息访问管道的效率。独立评估显示,Jev在各种基准测试中显著优于Qwen和Gemma等开源模型,尤其是在准确性和概率校准方面,尽管它仍然容易受到提示注入的影响,并且在低资源语言上表现下降。此次发布引发了一波开源重写,虽然提供了更低的延迟和成本,但总体上未能达到Jev的开箱即用准确性。 AI
影响 为专门的决策模型设定了新标准,与通用LLM相比,有可能降低特定任务的成本和延迟。
排序理由 Jev被描述为TypeSafe AI的商业System One模型,并进行了与其他模型的评估和比较,表明这是一次产品发布。
- Claude
- Claude Haiku-4-5
- Hacker News
- Jev AI
- Qwen3 0.6B
- Qwen3-4B
- System One
- X
- Belebele
- C Eval Benchmark
- Gemini
- Gemma 4 E4B
- HellaSwag
- IMDb
- Jevíčko
- Laya
- Massive Multitask Language Understanding
- ModernBERT-large
- Qwen 3.5
- Qwen3.8-27B
- SST-2 Benchmark
- TypeSafe AI
- UNFAIR-ToS
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →