MiMo v2.5-Pro
PulseAugur coverage of MiMo v2.5-Pro — every cluster mentioning MiMo v2.5-Pro across labs, papers, and developer communities, ranked by signal.
- 2026-06-09 product_launch Xiaomi released the MiMo-v2.5-Pro, a trillion-parameter open-weights model demonstrating significant performance on commodity hardware. 来源
6 天有情绪数据
-
Qwen Lab 发布 Qwen 3.8 27B,性能超越竞争对手
Qwen Lab 发布了 Qwen 3.8 27B,这是一款新推出的超大规模语言模型,其性能显著优于其前代产品以及 Mimo V2.5 Pro 和 DeepSeek V4 Pro 等其他开源模型。用户报告称,Qwen 3.8 27B 在处理复杂提示方面表现更好,甚至能准确渲染出地球仪等细节,而之前的模型在这方面表现不佳。开发者希望 Qwen Lab 能发布研究成果,帮助其他实验室创建类似的高质量、小型模型。
-
Inco AI 发布 DFlash 2 以加快 LLM 推理速度
Inco AI 发布了 DFlash 2,这是大型语言模型(LLM)投机解码的一项进展。新版本在原始 DFlash 的并行草稿方法的基础上,通过最小的延迟增加,将每次验证的输出提高了 20% 以上。DFlash 2 旨在通过在单次传递中优化 token 预测和选择,来提高推理效率,这是 AI 代理的一个关键瓶颈。
-
开放AI模型缩小能力差距,但在企业采用和服务堆栈性能方面落后
开放权重AI模型已显著缩小与专有模型的性能差距,到2026年4月在智能指数上缩小至6分以内。尽管如此,企业对开放模型的采用却滞后,使用率在一年内从19%降至11%。一个关键因素是服务堆栈,相同的开放权重模型在工具调用评估中的性能差异可达15个百分点,具体取决于提供商。虽然开放模型正变得更具成本效益,但在减少幻觉和复杂推理或编码任务的性能方面仍落后于专有选项。
-
像“MiMo”这样的模糊 API 请求需要结构化识别,以防止集成错误
文章讨论了当单个名称(如“MiMo”)可以指代多个不相关的产品时,API 请求的模糊性。它强调了一个常见的接收流程错误,即模糊地请求“MiMo AI API”被错误地视为一个完整的技术要求,导致在错误的服务上进行集成工作。作者提出了一个包含七个字段的结构化接收卡——名称、域、所有者、目的、文档、端点和状态——以清晰地识别正确的产品并防止浪费精力。
-
SWE-rebench 新增多语言编码任务,GLM-5.2 领跑排行榜
SWE-rebench 排行榜已更新,新增了一个多语言测试集,涵盖五种编程语言的软件工程任务:Go、Java、Python、Rust 和 TypeScript。此次更新包含了多个开源模型的性能指标,其中 GLM-5.2 的 Pass@1 分数最高,达到 62.9%。该项目计划在 3-4 周内进行另一次更新,重点关注适合本地部署的模型,并征集社区对未来评估的建议。
-
小米发布原生全模态MiMo-V2.5模型,支持100万上下文窗口
小米发布了其MiMo-V2.5模型,该模型以其“原生全模态”架构而著称。与许多集成不同数据类型独立组件的多模态模型不同,MiMo-V2.5从一开始就被设计为一个能够同时处理文本、图像、视频和音频的统一系统。这款混合专家模型拥有约3100亿个总参数,每个token有150亿个激活参数,并支持高达100万个token的上下文窗口。
-
分析显示 Mimo V2.5 Pro 在成本上优于 DeepSeek V4 Flash
一项对 DeepSeek 和 Mimo (小米) 的大模型 API 定价进行的最新分析发现,在可比的输出质量下,Mimo 的 V2.5 Pro 模型比 DeepSeek 的 V4 Flash 模型便宜约 40%。虽然 DeepSeek V4 Pro 在复杂推理和 STEM 内容方面表现出色,但 Mimo V2.5 Pro 的响应速度更快,非常适合成本敏感型、高吞吐量的应用。该分析是在 TokenPAPA 平台上使用实际推理测试进行的,…
-
开源 MiMo-V2.5-Pro 在成本效益上优于 Claude Opus 4.8
开源模型 MiMo-V2.5-Pro 在人工智能推理方面提供了比 Anthropic 的 Claude Opus 4.8 显著更高的成本效益。MiMo 模型每美元提供的智能是 Claude Opus 4.8 的 14 倍,每 100 万个 token 的成本为 0.544 美元,而 Claude Opus 4.8 为 10 美元。此性能是在一个特定的基准测试套件上测量的,其中 MiMo 的得分是 42.2,而 Claude 的得分是 55.7。
-
2026世界人工智能大会:AI从模型走向落地与商业价值 · 追踪1个来源
2026年世界人工智能大会(WAIC)在上海将重点从技术演示转向实际应用和商业价值。今年的活动强调AI是一个能够理解目标、调动资源并交付成果的系统,超越了简单的模型生成。关键主题包括具身智能、行业专属Agent以及消费级AI硬件,强调AI作为可交付、可复用的智能伙伴的角色。
-
AI模型接受动画SVG生成测试:火烈鸟月球步挑战
Reddit的r/LocalLLaMA版块的一位用户对各种AI模型生成动画SVG代码的能力进行了比较测试。提示要求生成一个火烈鸟在撒丁岛海滩上跳月球步的动画。测试了包括GPT 5.6 Sol、Gemini 3.1 Pro、Deepseek V4 Pro Preview、Grok 4.5、Kimi K3和Qwen 3.8 Max在内的多个模型,用户对Kimi和Qwen的输出表示特别满意。
-
PPIO推出Agentic Cloud,配备面向AI Agent的智能模型网关
PPIO已推出其Agentic Cloud平台,该平台配备了一个新的智能模型网关,旨在服务于蓬勃发展的Agent时代。该网关通过智能地将任务路由到最合适的模型,采用混合模型方法处理关键决策,并使用轻量级模型处理简单任务,从而优化AI Agent的性能和成本。该平台还包括用于任务编排和内存管理的Agent Harness,使Agent能够运行复杂、长时间的任务。PPIO报告称其Token消耗量显著增长,日处理量超过1.2万亿Token,…
-
Anomaly 推出每月 10 美元的 OpenCode Go,提供精选的 AI 编码模型
Anomaly 推出了 OpenCode Go,一项每月 10 美元的订阅服务,提供对 13 个开源 AI 编码模型的精选库的访问。该服务旨在为开发人员提供一种可靠且经济实惠的方式来使用这些模型,而无需管理多个 API 密钥或提供商。OpenCode Go 与现有的 OpenCode AI 编码代理无缝集成,也可以通过与 OpenAI 兼容的端点与其他工具一起使用。该套餐包含慷慨的使用限制,并优先考虑经过编码工作流程测试的模型,选项范…
-
小米的MiMo-V2-Flash凭借高效的MoE架构引领开源编码基准测试
小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation…
-
小米详解 MiMo-V2.5 AI 模型效率优化
小米公司详细介绍了其 MiMo-V2.5 系列 AI 模型背后的工程优化,重点在于实现长上下文推理和多模态任务的效率。与传统的全注意力机制相比,该模型采用混合滑动窗口注意力(Hybrid SWA)来大幅降低 KVCache 的存储和计算成本。进一步的增强包括稀疏 MoE 激活以减少每 token 的计算量,以及用于跨模态理解的多模态编码器。该公司系统地设计了推理系统,以在生产环境中实现这些架构优势,解决了 KVCache 管理、调度和…
-
Claude Fable 5 在 AI 性能排行榜上领先,但也是最昂贵的模型
一项名为 gdpval-aa v2 的新评估使用基于人类基线的 Elo 评分系统,衡量 AI 模型在真实世界任务上的性能。Anthropic 的 Claude Fable 5、Sonnet 5 和 Opus 4.8 模型位列前三名,表现优于 Grok 4.5、GLM-5.2 和 GPT-5.5 等模型。虽然 Claude 模型在原始性能上领先,但它们也是最昂贵的,而 Grok 4.5 因提供性能和成本的良好平衡而受到关注。
-
大语言模型调试基准:DeepSeek V4 Flash最划算,MiMo V2.5 Pro最佳调试器
一项基准测试比较了六个大型语言模型在调试httpcore Python库中真实竞态条件bug方面的能力,揭示了它们各自的优缺点。DeepSeek V4 Flash最具成本效益,识别了一个独特的bug;而MiMo V2.5 Pro作为调试器表现出色,发现了三个不同的竞态条件。在第二轮测试中,所有模型最终都采用了预防策略,尽管它们的方法各不相同,这凸显了在从被动清理转向主动预防方面需要具体的指导。
-
SWE-rebench 排行榜新增 Claude Opus 4.8、GLM-5.2、Gemini 3.5 Flash
SWE-rebench 排行榜已更新,新增了模型并改进了用户界面,使得在编码任务上比较 AI 性能更加容易。值得注意的新增模型包括 Claude Opus 4.8 xhigh、GLM-5.2 和 Gemini 3.5 Flash,以及多个 Qwen 和 DeepSeek 模型。此次更新还突出了本地和自托管模型的测试结果,鼓励社区就接下来要测试哪些模型提供意见。
-
在真实世界的调试任务中,MiMo v2.5-Pro 的表现优于 DeepSeek V4-Pro
一位开发者进行了一项真实的调试基准测试,在 httpcore Python 库的一个复杂竞态条件 bug 上对比了 DeepSeek V4-Pro 和 MiMo v2.5-Pro。该基准测试涉及分析多文件代码库和理解异步任务取消。MiMo v2.5-Pro 展现了更强的调试能力,识别出了 bug 并提供了更深入的分析,而 DeepSeek V4-Pro 则速度更快,更适合代码生成任务。
-
AI 游戏生成基准揭示顶级模型在创建可玩游戏方面仍遇挑战
来自香港中文大学(深圳)、深圳技术大学和腾讯的研究人员推出了 GameCraft-Bench,这是一个旨在评估 AI 生成完整可玩游戏能力的新基准。与以往侧重于静态代码或简单网页游戏的基准不同,GameCraft-Bench 利用 Godot 4 引擎来评估端到端的游戏开发,包括脚本编写、场景配置和资源集成。该基准包含一个多模态模型来评估生成游戏的动态交互和视觉反馈,结果显示即使是顶级 AI 模型在生成复杂交互系统方面也面临困难,平均…
-
小米推出具有持久内存的 MiMo Code,声称在 Claude Code 上具有优势
小米发布了 MiMo Code,这是 OpenCode 终端编码代理的一个开源分支。新版本引入了一个旨在处理长任务的持久内存系统,以及子代理编排和智能上下文重建。小米声称 MiMo Code 在某些基准测试中优于 Claude Code,但这些结果是其自行报告的,并且使用的是旧版本的 Claude Code,而非顶级的 Opus 4.8。独立排行榜显示,像使用 GPT-5.5 的 Codex CLI 等其他代理目前的得分更高。