一个名为Darwin-180B-RSI的开放权重模型在10个Hugging Face官方排行榜上名列前茅,超越了所有其他参与组织。该模型由VIDRAFT基于Alibaba的Qwen3.8-Flash-Next构建,不仅在MMLU-Pro和GPQA等学术基准测试中表现出色,还在文档解析(MDPBench)、结构化数据输出(IFStruct)和PDF字段提取(ExtractBench)等实际的企业级任务中展现出强大性能。该模型的训练方法,称为递归自我改进(RSI),允许它通过解决问题、验证自己的解决方案以及在无需人工标注数据的情况下对已确认的正确输出来重新训练,从而改进其能力。 AI
影响 为学术和实际企业任务中的开放权重模型树立了新标准,可能加速高级AI代理的采用。
排序理由 开放权重模型发布,赢得多个基准测试冠军并详细介绍了训练方法。 [lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Alibaba Group
- Darwin-180B-RSI
- ExtractBench
- Gate Arcade
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Hugging Face
- IFStruct
- Liquid Ai
- MDPBench
- MMLU-Pro
- Qwen3.8-Flash-Next
- VIDRAFT
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →