一款名为 TwIL LM3 Pro 的新型 3.66B 参数模型已发布,该模型专门针对形式逻辑任务进行了微调。该模型基于 IBM 的 Granite 4.2 3B 构建,在规则归纳和逻辑蕴涵检查等领域表现出色,在特定逻辑基准测试中优于更大的模型。虽然它在严格的多项选择逻辑和 BBH 逻辑方面表现强劲,但在规则归纳和 Lean 正式化方面仍落后于 GPT OSS 120B。该模型可用于各种量化级别,并在消费级硬件上运行,但需要非商业许可。 AI
影响 为形式逻辑任务提供了一个专业、高效的选择,可能在代理管道和合同分析中有用。
排序理由 发布了一款专业的、较小的模型,并附有基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →