PulseAugur
实时 20:49:49
实体 Mistral Large 3

Mistral Large 3

PulseAugur coverage of Mistral Large 3 — every cluster mentioning Mistral Large 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_119409 ·

    新的RoPoLL方法增强了大语言模型(LLM)评估的鲁棒性

    研究人员推出了一种名为RoPoLL的新方法,以提高大语言模型(LLM)评估的鲁棒性。传统的大语言模型(LLM)评判员小组虽然实用,但容易受到模式崩溃或谄媚等偏见的影响,导致误差无界。RoPoLL通过用鲁棒的均值估计器(特别是几何中位数)替换标准的聚合函数来解决这个问题,该估计器具有最佳的失效点,即使在评判员严重受污染的情况下也能保持准确性。实验表明,RoPoLL的性能显著优于现有方法,在一个关键基准测试中,即使是一个小型RoPoLL委…

  2. FRONTIER RELEASE · CL_83195 ·

    AI 实验室发布 GPT-5 Turbo、Claude Fable 5 和 Llama 4 Ultra

    2026 年 6 月见证了 AI 模型发布的重大浪潮,主要参与者和开源社区正在突破性能和可访问性的界限。OpenAI 推出了 GPT-5 Turbo,以更低的成本和更快的延迟提供 GPT-5 级别的推理能力;Anthropic 发布了 Claude Fable 5,这是他们先进 Mythos 架构的安全调优版本。Meta 的 Llama 4 Ultra 和 DeepSeek 的 Coder V3 和 V3.1 模型引领了开源浪潮,Me…

  3. TOOL · CL_68274 ·

    新的GTBench基准测试大型语言模型作为数学研究助手

    一个名为GTBench的新基准已被开发出来,用于评估大型语言模型作为数学研究助手,特别是在图论领域的能力。该基准包含63个按难度分类的问题,涵盖从本科概念到研究生证明构建的各个级别。在测试中,GPT-5在所有级别上都表现出色,而Llama 3.3等其他模型则表现出显著下降,尤其是在复杂的证明任务上。

  4. RESEARCH · CL_08227 ·

    研究人员通过嵌入引导的字体攻击探测 VLM 安全性

    研究人员开发了一种通过字体提示注入来探测视觉语言模型 (VLM) 安全漏洞的方法。他们的研究发现,多模态嵌入距离可以很好地预测攻击成功率,为漏洞提供了一种模型无关的代理。该技术被用作红队测试工具,用于测试感知可读性和安全对齐等因素,而无需直接访问目标模型。

  5. FRONTIER RELEASE · CL_01781 ·

    Mistral AI 发布新的开源模型:Mistral 3 及小型变体

    据报道,Mistral AI 已发布其新模型系列,命名为 Mistral 3。此次发布包括旗舰模型 Mistral Large 3,以及更小的开源模型:Ministral 3B、8B 和 14B。该消息通过电子邮件通讯宣布,详细信息可通过重定向链接获取。