MiniMax M2.5
PulseAugur coverage of MiniMax M2.5 — every cluster mentioning MiniMax M2.5 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI API 摘要:Qwen 价格飙升,Z.ai 增加 1M 上下文,AI21 & Mancer 模型下架
2026 年 8 月 20 日的 AI API 摘要,重点介绍了各提供商的显著价格变动和模型更新。Qwen 的 Qwen3.6 27B 模型在提示词和完成词元的价格上都有大幅上涨,影响了长文本生成的成本。Z.ai 推出了其 GLM Latest 模型,具有 1M 词元上下文窗口,满足了需要广泛上下文的用户需求。AI21 的 Jamba Large 1.7 和 Mancer 的 Weaver (alpha) 模型已被移除,要求用户迁移其…
-
研究人员开发 Self-Harness,使 LLM 代理能够自主改进其自身系统
一篇新研究论文介绍了一种名为“Self-Harness”的方法,该方法允许基于 LLM 的代理自主改进其自身的运行 Harness。这个迭代过程包括识别模型特定的失败模式、生成 Harness 修改以及通过回归测试验证这些更改。当应用于各种模型和基准测试时,Self-Harness 持续提高了性能,为实现自改进的 AI 代理指明了方向。
-
CI检查管理中文大语言模型名称和Token预算
一位开发者创建了一个CI检查,用于管理快速变化的中文大语言模型名称及其相关的Token预算。该工具通过将模型目录视为可固定和检查的部署时依赖项,帮助确保生产稳定性。演示 walkthrough 展示了如何使用AIWave定价页面构建一个清单检查,该页面作为各种中文AI模型的入口,根据提供的比例计算美元价格。
-
中国AI模型价格比西方低50倍,性能不输 · 追踪4个来源
2026年AI API定价的比较显示,智谱AI、百度、DeepSeek和阿里巴巴集团等中国供应商提供的成本远低于OpenAI、Anthropic和Google等西方竞争对手。GLM 4.7 Flash等模型免费,而其他模型的价格比西方选项便宜几个数量级,且性能通常相当或更优。文章建议采用从更便宜的模型开始进行原型设计,并将模型复杂性与任务需求相匹配的策略来优化成本。
-
AI 自进化可能始于外部系统,而非模型权重
前 OpenAI 安全副总裁 Wonyong Li 提出了一条 AI 自进化的新路径,建议从外部操作系统(Harness)开始,而不是直接修改模型权重。该 Harness 系统负责管理工具使用、上下文、任务拆分和结果验证,并可根据观察到的失败进行迭代改进。DeepSeek 的崔天言等研究人员认为,改进 Harness 是 AI 进步的一个有前景的方向,有可能在不改变核心模型的情况下实现显著的性能提升。
-
AI系统改进活检报告中的幽门螺杆菌检测
研究人员开发了Nimblemind多智能体系统(nMAS),以改进从胃活检报告中提取幽门螺杆菌阳性证据。在一项使用新加坡54份去标识化报告的试点研究中,nMAS在分类与幽门螺杆菌感染相关的四个关键字段时达到了98.61%的准确率。虽然MiniMax M2.5比较器显示出相似的预测性能,但nMAS通过提供带有支持性源句的统一报告级输出来提供更优越的工作流程集成和可追溯性。该系统可以显著减少手动审查时间,可能节省大量员工时间和成本。
-
MiniMax 模型现已登陆 Amazon Bedrock,支持代理工作负载
Amazon Bedrock 现已提供来自全球人工智能技术公司 MiniMax 的三款开放权重基础模型。这些模型属于 MiniMax M2 系列,专为软件工程和代理用例而设计,其中最新的 M2.5 模型专门针对原生代理执行进行了训练。此次集成使组织能够在 AWS 的安全托管基础设施内利用这些先进模型,确保数据保护和运营控制,而无需自行托管。
-
LLM定价波动:NVIDIA、Qwen和Z.ai价格调整;新增模型 · 追踪10个来源
Token Ledger 发布了 2026 年 8 月初 LLM 定价变化的每日更新。包括 NVIDIA Nemotron 3 Super 和 Ultra、Qwen 变体以及 Z.ai 的 GLM 5.2 在内的几款模型价格进行了调整,报告显示有涨有跌。新增了 Meta 的 Muse Spark 1.2 和 inclusionAI 的 Ling-3.0-flash 等新模型,同时一些知名模型如 Gemini、Claude 和 GPT-…
-
新算法TASKER改进视频理解和代理任务
研究人员开发了TASKER,一种新颖的关键帧提取算法,旨在提高视频问答(VideoQA)和视频引导代理任务的性能。该算法在一个新论文中进行了详细介绍,它联合考虑任务相关性和场景动态性来识别信息帧。还引入了一个新的基准VG-GUIBench,用于评估多模态大语言模型(MLLMs)遵循视频教程和完成GUI交互任务的能力,证明了TASKER的有效性。
-
Model Gateway使MiniMax模型可在Claude Code和opencode中使用
一个名为Model Gateway的第三方服务已被开发出来,允许开发者将MiniMax模型(如MiniMax-M3)集成到通常支持OpenAI或Anthropic API的现有编码工作流程中。该网关提供了兼容层,使得在Claude Code和opencode等工具中使用MiniMax模型无需编写自定义适配器代码。开发者可以通过配置指向Model Gateway端点的特定环境变量或配置设置,来测试MiniMax模型执行代码解释、重构和测…
-
新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源
研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…
-
oMLX 通过 KV 缓存提升 Apple Silicon LLM 性能
oMLX 是一个面向 Apple Silicon 的开源 LLM 推理服务器,在处理大型模型和复杂工作流方面展现出显著的性能提升。社区基准测试和本地测试突显了 oMLX 相较于 Ollama 和 LM Studio 等替代方案的优势,尤其是在涉及编码代理和持久化 KV 缓存的场景中。该服务器利用 SSD 进行 KV 缓存的能力极大地缩短了首次令牌生成时间 (TTFT),使得 Claude Code 和 Qwen3-Coder-Next…
-
Self-Harness 使 LLM 代理能够改进其自身的操作工具集
研究人员开发了一种名为 Self-Harness 的新颖方法,使基于 LLM 的代理能够自主改进其自身的操作工具集。这个迭代过程包括识别模型特定的失败模式、生成有针对性的工具集修改以及通过回归测试验证这些更改。当应用于 Terminal-Bench-2.0 基准测试中的三个不同基础模型时,Self-Harness 显著提升了性能,展示了通往自优化 AI 代理的道路。
-
MiniMax 发布 M3,拥有百万级上下文,在 SWE-Bench 上超越 GPT-5.5
中国人工智能初创公司 MiniMax 发布了其 M3 模型,拥有百万级 token 上下文窗口和原生多模态能力,在 SWE-Bench Pro 基准测试中表现优于 GPT-5.5。该公司还以远低于 Anthropic 的 Claude Opus 4.7 等竞争对手的价格提供其 M2.5 模型,同时保持与 OpenAI 和 Anthropic 协议的 API 兼容性。MiniMax 提供开源模型用于自托管,并通过其 Cline 代理与 …
-
开源大模型演进:注意力机制、多模态和效率提升
近几个月来,开源大模型领域发生了重大变化,滑动窗口注意力机制已成为主流,支持更大的上下文窗口。QK-Norm 也因其作为训练稳定器的作用而受到关注,其根源可追溯至 Gemini 3 的架构。Kimi k2.5 中早期出现的多模态预训练,已被证明有利于推理,而 Z.ai 的 GLM-5,尽管经过修改,但性能可与顶级闭源模型相媲美。Step 3.5 Flash 在推理速度和多令牌预测方面表现突出,尽管基准测试性能并不总是与用户偏好一致。
-
AI模型定价革命:中国实验室在代码基准测试中大幅削价GPT-5、Gemini
AI模型市场在定价和性能方面发生了重大转变,尤其是在SWE-bench等代码基准测试中。来自DeepSeek、Kimi和MiniMax等中国实验室的模型,以更低的成本提供了与Claude Opus和GPT-5等顶级模型相当甚至更优的性能。这一趋势归因于混合专家(Mixture-of-Experts)架构的进步、中国实验室因硬件限制而采取的成本优化策略,以及强化学习技术在代码领域的广泛应用。此外,非常低成本的缓存输入Token的出现,特…
-
MiniMax-M2 模型通过高效激活实现前沿性能
研究人员推出了 MiniMax-M2 系列,这是一系列专为代理部署设计的新型专家混合(Mixture-of-Experts)语言模型。旗舰 M2 模型拥有 2299 亿个总参数,但每个 token 仅激活 98 亿个,强调了效率。该系列建立在由代理驱动的数据管道、一个名为 Forge 的可扩展的代理原生强化学习系统以及一个(M2.7)检查点之上,该检查点通过调试训练运行展示了早期自我进化的能力。MiniMax-M2 系列在各种代理基准…
-
Fireworks AI:AI智能体瓶颈在于可靠性而非智力
Fireworks AI 的一项新基准测试显示,AI模型执行的可靠性,而不仅仅是智力,是智能体AI系统的关键瓶颈。在 720 项浏览器自动化任务中,一个模型近 20% 的时间未能产生有效输出,导致重试率、延迟和成本显著增加。该研究引入了“智能体执行税”来量化这一开销,强调在生产环境中,具有一致、可靠输出的模型比只有高推理分数的模型更有价值。
-
新的代理框架通过主动证据搜寻提升大型语言模型临床推理能力
研究人员开发了ClinSeekAgent,这是一个旨在增强大型语言模型临床推理能力的新型框架,使其能够主动搜寻和综合多模态证据。与依赖预选数据的先前方法不同,ClinSeekAgent动态查询医学知识库、导航电子健康记录并利用成像工具来收集信息。这种主动证据搜寻过程显著提高了Claude Opus 4.6和MiniMax M2.5等模型在纯文本和多模态临床任务上的表现,ClinSeek-Bench基准的创建证明了这一点。
-
LLM 基准测试显示路由策略优于单一模型选择
最近的一项基准测试在 38 个真实世界编码任务上测试了 15 个 LLM,结果表明,结合不同模型的路由策略比选择单一顶级模型更有效。研究发现,Gemini Flash 和 GPT-oss-20b 等更便宜的模型足以胜任许多任务,以较低的成本实现了高准确率。对于更复杂的任务,Opus 和 Sonnet 等模型表现出色,该基准测试强调了根据任务复杂性、速度和成本对 LLM 进行分层部署的方法。