Mistral Medium 3
PulseAugur coverage of Mistral Medium 3 — every cluster mentioning Mistral Medium 3 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Mistral Medium 3 基准测试显示出强劲的性能和成本效益
Mistral Medium 3 在多项基准测试中表现出色,在 GPQA 上达到 57.8%,在 MMLU-Pro 上达到 76%。该模型在 Humanity's Last Exam 上得分 4.1%,在 Long Context Reasoning 上得分 31.7%。值得注意的是,它每美元提供 15.6 智能点,表明其具有成本效益。
-
Mistral AI 将于 2026 年 7 月 31 日退役 NeMo 12B 模型和 API 端点
Mistral AI 将于 2026 年 5 月 22 日开始弃用 Mistral NeMo 12B 模型及其关联的 API 端点 open-mistral-nemo-2407,并于 2026 年 7 月 31 日完全关闭。该模型是与 NVIDIA 合作推出的,以其 128k 上下文窗口、Apache 2.0 许可证、高效的 Tekken 分词器和低成本而闻名,使其成为本地部署和预算有限部署的热门选择。它的退役,以及其他 Mistra…
-
DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布
独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…
-
RAG在电子健康记录临床推理方面优于长上下文提示
一项新的研究论文评估了检索增强生成(RAG)与长上下文提示在利用电子健康记录(EHR)进行临床推理任务中的表现。研究发现,即使在少于8K个token的情况下,RAG在提取影像学检查和重建抗生素时间线等任务上的表现也更好,并且更具token效率。尽管RAG在这些领域显示出明显的优势,但由于文档记录的多样性,诊断生成任务在所有测试方法和模型中仍然具有挑战性。研究结果表明,即使模型在处理长上下文能力方面有所提高,RAG仍然是处理大型EHR数…
-
荷兰政府将于 7 月 1 日推出“Vlam-chat”人工智能助手
荷兰政府将于 7 月 1 日推出“Vlam-chat”,这是一个本地托管的人工智能助手。该工具由 SSC-ICT 开发,使用了 Mistral Medium 3 语言模型,并基于开源软件构建。Vlam-chat 旨在供荷兰政府内部使用。
-
LLM难以检测YouTube上具有文化特异性的健康虚假信息
两篇新研究论文探讨了大型语言模型(LLM)在检测具有文化特异性的健康虚假信息方面的局限性,特别关注在YouTube上推广牛尿作为印度的一种疗法。研究强调,通常在西方数据上训练的LLM难以分析融合了传统语言和伪科学声明的内容。研究人员发现,仅靠提示工程不足以克服这种文化偏见,表明需要更具文化敏感性的AI分析工具。