Claw-Eval
PulseAugur coverage of Claw-Eval — every cluster mentioning Claw-Eval across labs, papers, and developer communities, ranked by signal.
-
TaichuAI发布ZDTaichu5.0-9B多模态基础模型
TaichuAI发布了ZDTaichu5.0-9B,这是一款专为视觉理解、空间推理和智能体任务设计的多模态基础模型。该模型集成了Qwen3.5-9B语言主干和C-RADIOv4-H视觉编码器,能够处理任意分辨率的文本、图像和视频。ZDTaichu5.0-9B在通用视觉理解方面表现出色,同时在空间推理和智能体能力方面也优于同类其他模型。
-
新型Tiel-Coder 35B模型在编码和长对话方面表现出色
一款名为Tiel-Coder-35B-A3B的新型开源模型已发布,该模型针对编码任务和长对话进行了优化。它在SWE-bench-Live基准测试中取得了强劲的性能,修复了25个问题中的12个,这与Anthropic的Opus 4.6中型模型相当。虽然Tiel在编码和多轮对话方面表现出色,但在琐事和常识任务方面能力较弱,在MMLU-Pro上的得分低于同类其他模型。
-
阿里巴巴Qwen发布AgentWorld语言模型用于环境模拟
阿里巴巴的Qwen团队推出了Qwen-AgentWorld,一个旨在模拟各种代理环境的新型语言世界模型。该模型侧重于训练大型语言模型理解和预测环境,而不仅仅是在其中行动。研究探索了两个主要途径:构建一个用于环境模拟的基础模型,以及研究世界建模如何增强代理训练,表明使用世界模型训练的代理可以优于在真实环境中训练的代理,并且预测性知识能有效地迁移到代理任务中。
-
小米的MiMo-v2.5-Pro开源模型可与顶级AI编码助手相媲美
小米发布了MiMo-v2.5-Pro,这是一款专注于编码的开源语言模型,在复杂任务中展现出令人印象深刻的能力。该模型在数小时内成功完成了一个大学级别的编译器项目,根据模糊的提示构建了一个功能齐全的视频编辑器应用程序,并解决了模拟电路设计问题。MiMo-v2.5-Pro在编码基准测试中表现强劲,可与GPT-5.4和Claude Opus 4.6等顶级闭源模型相媲美,现已在HuggingFace上发布。