PulseAugur
实时 23:52:41
实体 Mistral Medium 3

Mistral Medium 3

PulseAugur coverage of Mistral Medium 3 — every cluster mentioning Mistral Medium 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_224467 ·

    Mistral Medium 3 基准测试显示出强劲的性能和成本效益

    Mistral Medium 3 在多项基准测试中表现出色,在 GPQA 上达到 57.8%,在 MMLU-Pro 上达到 76%。该模型在 Humanity's Last Exam 上得分 4.1%,在 Long Context Reasoning 上得分 31.7%。值得注意的是,它每美元提供 15.6 智能点,表明其具有成本效益。

  2. RESEARCH · CL_159203 ·

    Mistral AI 将于 2026 年 7 月 31 日退役 NeMo 12B 模型和 API 端点

    Mistral AI 将于 2026 年 5 月 22 日开始弃用 Mistral NeMo 12B 模型及其关联的 API 端点 open-mistral-nemo-2407,并于 2026 年 7 月 31 日完全关闭。该模型是与 NVIDIA 合作推出的,以其 128k 上下文窗口、Apache 2.0 许可证、高效的 Tekken 分词器和低成本而闻名,使其成为本地部署和预算有限部署的热门选择。它的退役,以及其他 Mistra…

  3. RESEARCH · CL_152721 ·

    DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布

    独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…

  4. TOOL · CL_139598 ·

    RAG在电子健康记录临床推理方面优于长上下文提示

    一项新的研究论文评估了检索增强生成(RAG)与长上下文提示在利用电子健康记录(EHR)进行临床推理任务中的表现。研究发现,即使在少于8K个token的情况下,RAG在提取影像学检查和重建抗生素时间线等任务上的表现也更好,并且更具token效率。尽管RAG在这些领域显示出明显的优势,但由于文档记录的多样性,诊断生成任务在所有测试方法和模型中仍然具有挑战性。研究结果表明,即使模型在处理长上下文能力方面有所提高,RAG仍然是处理大型EHR数…

  5. TOOL · CL_120452 ·

    荷兰政府将于 7 月 1 日推出“Vlam-chat”人工智能助手

    荷兰政府将于 7 月 1 日推出“Vlam-chat”,这是一个本地托管的人工智能助手。该工具由 SSC-ICT 开发,使用了 Mistral Medium 3 语言模型,并基于开源软件构建。Vlam-chat 旨在供荷兰政府内部使用。

  6. RESEARCH · CL_04970 ·

    LLM难以检测YouTube上具有文化特异性的健康虚假信息

    两篇新研究论文探讨了大型语言模型(LLM)在检测具有文化特异性的健康虚假信息方面的局限性,特别关注在YouTube上推广牛尿作为印度的一种疗法。研究强调,通常在西方数据上训练的LLM难以分析融合了传统语言和伪科学声明的内容。研究人员发现,仅靠提示工程不足以克服这种文化偏见,表明需要更具文化敏感性的AI分析工具。