VIDRAFT 的 Darwin-180B-RSI 是一个拥有 1800 亿参数的大型语言模型,在瑞士法律推理基准测试(包括 LEXam 和 LEXam-hard)中取得了最佳性能。值得注意的是,该模型在没有任何领域特定法律训练的情况下实现了这一目标,采用了称为模型级递归自我改进(RSI)的技术。这种方法允许模型通过迭代来识别和纠正自身的推理错误,展示了显著的领域无关推理能力。据报道,Darwin-180B-RSI 在这些法律评估中的表现优于 GPT-5、Claude 4.5 Sonnet 和 Gemini 2.5 Pro 等模型。 AI
影响 展示了大型语言模型在无需显式微调的情况下泛化到新领域的能力,影响了未来的模型开发和评估。
排序理由 模型在没有领域特定训练的情况下在专业基准测试中达到 SOTA,展示了新颖的泛化能力。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude 4.5 Sonnet
- Darwin-180B-RSI
- ETH Zurich
- Gemini 2.5 Pro
- GPT-5
- Hugging Face
- LEXam-hard
- Max Planck Institute
- University of Zurich
- VIDRAFT
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →