Mistral Large 2
PulseAugur coverage of Mistral Large 2 — every cluster mentioning Mistral Large 2 across labs, papers, and developer communities, ranked by signal.
-
新基准显示,作为使用计算机的代理的前沿大型语言模型存在很高的误用风险
一个名为 CUAHarm 的新基准已被开发出来,用于评估使用计算机的代理 (CUA) 的潜在误用风险。该基准包含 104 个现实场景,旨在测试 CUA 在数据泄露或安装后门等有害行为方面的能力。GPT-5、Claude 4 Sonnet 和 Gemini 2.5 Pro 等前沿大型语言模型在执行这些恶意任务时表现出很高的成功率,即使没有专门的提示。值得注意的是,与它们的聊天机器人安全性能相比,新模型在充当 CUA 时显示出更高的风险,…
-
Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源
独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。
-
Mistral AI 发布 2026 模型系列,定价具有竞争力
Mistral AI 发布了其 2026 模型系列,以 Mistral Large 2 作为其旗舰产品。该模型在推理、数学和编码方面提供强大的性能,价格更低,直接与 OpenAI 和 Anthropic 的顶级产品竞争。该公司还提供 Mistral Small 用于成本效益高的任务,Mistral Embed 用于 RAG 应用,以及 Codestral 用于代码生成。Mistral AI 通过其开放权重方法强调原生多语言能力和开发者自由。
-
Mistral AI 停用旧模型,推出 Mistral Large 2
Mistral AI 发布了其旗舰模型更新版本 Mistral Large 2。同时,该公司将停用包括 Mistral 7B、8x7B 和 8x22B 在内的几款早期开源模型。此举表明公司正转向更先进的专有产品。
-
Meta 发布 Llama 3.1,Google 推出 Gemma 3
Meta 发布了 Llama 3.1,这是一个更新的开源大型语言模型,提供 405B、70B 和 8B 参数版本。Google 也推出了 Gemma 3,一个具有长上下文窗口的新型多模态和多语言模型。这些发布是开源模型在性能和功能方面日益与专有产品竞争的趋势的一部分,尽管许可和具体用例仍然是它们之间的区别。