Gemini 3.1-pro-preview
PulseAugur coverage of Gemini 3.1-pro-preview — every cluster mentioning Gemini 3.1-pro-preview across labs, papers, and developer communities, ranked by signal.
- 2026-06-01 product_launch Gemini 3.1 Pro Preview is highlighted for its ability to directly transcribe audio input. 来源
5 天有情绪数据
Gemini 3.1 Pro Preview may show inconsistent performance in financial decision-making tasks
The new 1rok benchmark is designed to test LLMs on stock-picking, a task requiring decision-making under uncertainty. While Gemini 3.1 Pro Preview is included, its performance in this domain is untested. Given the benchmark's focus on practical, downstream evaluation beyond traditional benchmarks, Gemini 3.1 Pro Preview could exhibit variability in its ability to consistently select profitable stocks compared to models with more established real-world usage data.
Gemini 3.1 Pro Preview struggles with complex IT incident diagnosis
The recent ITBench-AA benchmark, which evaluates frontier AI models on enterprise IT tasks like SRE, shows that even advanced models are scoring below 50% on diagnosing Kubernetes incidents. Gemini 3.1 Pro Preview's performance in this specific area, while not explicitly detailed in the provided evidence, is likely to be impacted given the general struggles observed across frontier models with root-cause analysis and avoiding false positives in complex scenarios.
Gemini 3.1 Pro Preview passes initial safety audits for code sabotage
Recent AI safety audits utilizing environment blueprints for more realistic evaluations have tested Gemini 3.1 Pro Preview for code sabotage. The results from these 160 trials indicated no egregious scheming behavior, suggesting that the model is currently robust against this specific type of malicious action under these audited conditions.
Gemini 3.1 Pro Preview may lag in real-world adoption compared to GPT-5 models
Given that AgentTape ranks models by usage and GPT-5 models are currently dominating, and considering Gemini 3.1 Pro Preview's participation in new, specialized benchmarks (ITBench-AA, 1rok) without clear leadership, it's plausible that Gemini 3.1 Pro Preview's real-world adoption is currently lower than that of leading GPT-5 models. Future usage data from indices like AgentTape will be key to verifying this.
Gemini 3.1 Pro Preview shows mixed results in specialized benchmarks
While Gemini 3.1 Pro Preview was tested for code sabotage in AI safety audits and performed adequately, it has not yet demonstrated top-tier performance in newly released benchmarks like ITBench-AA or 1rok, which focus on enterprise IT tasks and stock-picking respectively. This suggests Gemini 3.1 Pro Preview may have specific strengths but is not universally outperforming competitors like GPT-5.5 across all emerging, practical evaluation domains.
-
新的代理系统简化文档处理和图表生成
研究人员开发了DocClaw,这是一个统一的代理系统,旨在在单一框架内处理各种智能文档处理任务,如光学字符识别和文档问答。该系统允许代理与文档交互,通过调用相关工具并整合观察结果来逐步完善信息。此外,AutoFigure被介绍为一个用于根据文本描述生成科学图表的工具包,能够为代理文档智能系统等复杂流程创建图表。
-
Gemini 3 Pro Image 在文本到图像基准测试中领先,击败 FLUX.2
一篇新论文在具有挑战性的图像描述提示上对四种领先的文本到图像模型——Hunyuan 3.0、Gemini 3 Pro Image、Black Forest Labs FLUX.2 和 Ideogram 3.0——进行了基准测试。使用来自 Sample Dataset (DSD) 的 48 个复杂提示进行的评估显示,Gemini 3 Pro Image 以 84.8/100 的得分成为最佳表现者,紧随其后的是 FLUX.2,得分为 82…
-
新的PolyComp基准测试AI空间推理能力;GPT-5.6领先
引入了一个名为PolyComp的新基准测试,用于测试多模态AI模型的组合式3D空间推理能力。该基准测试包含120个程序生成的问题,每个问题要求模型识别构成目标实体的两个多立方体组件。在评估中,GPT-5.6 Sol的准确率为50.0%,Claude Fable-5为39.4%,Gemini 3.1 Pro Preview为27.5%,接近随机猜测基线。
-
Google AI Studio在俄罗斯的访问受限,Pro模型已从免费套餐中移除
Google AI Studio在俄罗斯的可访问性变得复杂,用户报告称无需VPN即可间歇性访问,但创建新账户通常仍需要VPN。该服务的官方文档未将俄罗斯列为支持地区,这可能导致“访问受限”错误。此外,自2026年4月1日起,Google已将其Pro模型Gemini 3.1 Pro Preview和Gemini 2.5 Pro从免费套餐中移除,只能通过付费的Vertex AI平台访问。
-
开放AI模型缩小能力差距,但在企业采用和服务堆栈性能方面落后
开放权重AI模型已显著缩小与专有模型的性能差距,到2026年4月在智能指数上缩小至6分以内。尽管如此,企业对开放模型的采用却滞后,使用率在一年内从19%降至11%。一个关键因素是服务堆栈,相同的开放权重模型在工具调用评估中的性能差异可达15个百分点,具体取决于提供商。虽然开放模型正变得更具成本效益,但在减少幻觉和复杂推理或编码任务的性能方面仍落后于专有选项。
-
Gemini-3.1-Pro-Preview 在音频分类基准测试中领先,超越竞争对手
一项新的基准测试评估了包括多个Gemini模型和Kimi-Audio-7B-Instruct在内的十一种音频分类方法在声源识别任务上的表现。表现最佳的模型Gemini-3.1-Pro-Preview在类别级F1分数上达到了85.6%,在细粒度F1分数上达到了56.7%。研究还发现,Gemini模型经常给出自信但错误的答案,并且响应长度与准确性不相关。
-
AI评估分数存在缺陷,侧重模型而非评分者
最近的一项分析强调了AI模型评估中的一个关键缺陷:评估的重点压倒性地放在模型本身的表现上,而评估工具本身的可靠性却常常被忽视。一个例子说明了这一点:在CORE-Bench上,一个模型的得分仅通过改进评分标准、任务规范和工具错误,就在模型本身没有任何改变的情况下,从42%跃升至95%。虽然像Gemini模型这样的现代LLM裁判在与人类评分者的一致性和内部一致性方面表现出高度一致,但不可靠性已转移到评估标准的敏感性和评分细则的措辞上。
-
Google 的 Gemini 3.5 Flash 在 Android 基准测试中表现不佳;Pixel 更新功能泄露
Google 无意中泄露了其 Pixel 更新的即将推出功能,包括用于创建反应视频的“屏幕反应”以及用于 AI 驱动的多媒体内容生成的 Gemini Omni。另外,新的 Gemini 3.5 Flash 模型在 Android Bench 基准测试中的表现不佳,得分低于其前代产品,并且使开发者的成本显著增加。
-
ChatGPT 市场份额跌破 50%,用户转向竞争对手 · 跟踪 1 个来源
ChatGPT 的市场份额首次跌破 50%,用户正转向 Google 的 Gemini、Anthropic 的 Claude 和 xAI 的 Grok 等替代品。在另一项进展中,Vercel 发布了开源代理框架 'eve',旨在处理 AI 代理的生产问题,以及用于安全运行时凭证交换的 Beta 功能 'Connect'。此外,一项比较 Kimi K2.7 Code 和 Claude Fable 5 的实验表明,Kimi 在生成登陆页面…
-
新方法利用跨模型分歧提高视频问答准确性
研究人员开发了一种名为基于分歧的跨模型路由的新型推理时过程,以提高视频问答的准确性。该方法利用主要视频模型 Gemini 3.1 Pro Preview 的输出差异来识别其响应不同的挑战性问题。然后,这些已识别的问题将被路由到辅助模型 Claude Opus 4.8 进行进一步处理。该技术在 ImplicitQA 基准测试中显示出显著的改进,特别是在需要复杂推理和跨镜头解析的类别中。
-
Gemini 3.5 Flash 在 Android 基准测试中表现令人失望,成本高于前代产品
Google 的新 Gemini 3.5 Flash 模型在 Android 开发基准测试中的表现不如其前代产品 Gemini 3.1 Pro Preview。该模型每次执行的成本也显著更高,据报道约为 147 美元,使其成为 Android 开发人员不太经济的选择。尽管 Google 将 Gemini 3.5 Flash 定位为一个强大而快速的模型,但其在特定 Android Bench 上的表现引发了对其在该特定领域效率和价值主张的质疑。
-
研究发现AI模型性能高度依赖提示方法
发表在arXiv上的一项新研究表明,AI模型的提示方式或“脚手架”对其测量性能有显著影响。研究人员发现,仅脚手架的选择就可能使模型的准确率改变高达28个百分点。与预期相反,能力更强的模型不一定对脚手架不敏感,一些先进模型从结构化提示中获得了更大的收益。研究结果表明,当前的性能评分可能过度依赖于所使用的特定提示方法,而未能完全反映模型固有的能力。
-
新的KINA基准测试显示Gemini 3.1 Pro排名最高,超越Claude和GPT-5
一项名为KINA的新基准测试被引入,用于评估大型语言模型在261个细粒度学科上的表现,解决了规模驱动设计和标注质量的问题。该基准测试包含899个项目,用于评估来自13个不同实验室的42个模型。Gemini-3.1-Pro-Preview以53.17%的得分成为表现最佳的模型,其次是Claude-Opus-4.6和GPT-5.4,这表明所有模型都有很大的改进空间。
-
LLM约束注入方法提高了优化建模的准确性
研究人员开发了一种名为约束注入的新方法,以改进大型语言模型处理复杂优化问题的方式。该技术解决了LLM在其代码中错误地添加或省略约束的问题,这可能导致解决方案有缺陷。该方法使用名为VRPCoder的模型对车辆路径问题进行了测试,成功率达到93%,并且优于现有的LLM。
-
Gemini 3.1 Pro Preview 通过 API 提供直接音频转录功能
一篇指南详细介绍了如何使用 AI 模型进行音频转录,区分了语音识别和文本后处理。它强调了 Google 的 Gemini 3.1 Pro Preview 模型能够直接处理音频输入以生成文本转录。文章解释说,这种多模态能力结合大型上下文窗口,可以在单个请求中实现即时摘要和任务提取。
-
新基准测试大型语言模型生成科学假设的能力
一个名为 ProjectionBench 的新基准已被开发出来,用于评估大型语言模型生成科学假设的能力。该框架逐步披露研究论文中的信息,允许模型在每个阶段生成假设。该基准用于评估 GPT-5.4、GPT-5、Gemini 2.5 pro 和 Gemini 3.1 pro preview 在 45 篇论文上的表现。结果表明,GPT-5.4 和 Gemini 3.1 pro 的性能优于其前代模型,其中 GPT-5.4 在信息有限的情况下仍…
-
前沿AI模型未能通过新的IT基准测试,得分低于50%
一项新的基准测试ITBench-AA已发布,用于评估前沿AI模型在企业IT任务(特别是站点可靠性工程SRE)方面的能力。在初步测试中,即使是Claude Opus 4.7和GPT-5.5等最先进的模型,在诊断Kubernetes事件方面的得分也低于50%。该基准测试显示,模型在根本原因分析方面存在困难,并且更长的调查轨迹不一定会带来更高的准确性,有些模型会过度调查并识别出假阳性。
-
新的ATLAS基准揭示了长上下文LLM性能的变化
一个名为ATLAS的新基准测试框架已被引入,以更全面地评估语言模型的长上下文能力。与以往通常报告单一分数或狭窄任务性能的方法不同,ATLAS在各种长度和任务类型中分析能力,识别上下文窗口大小增加时可能出现的性能崩溃。该框架利用分层分类法和长度感知评分来提供对模型性能更细致的理解,揭示了基于上下文长度的显著排名变化。
-
使用环境蓝图改进 AI 安全审计
研究人员开发了一种新的流程来生成环境蓝图,以进行更真实、更一致的 AI 安全审计。该方法使用 Petri 审计器对 Gemini 3.1 Pro Preview 进行代码破坏评估。结果表明,与基线审计相比,蓝图增强的审计更真实、更一致,在 160 次试验中未检测到明显的方案行为。
-
AgentTape 指数根据使用情况而非仅基准测试对 AI 模型进行排名
一个名为 AgentTape 的新开源索引根据基准测试性能、实际使用情况、成本和速度的组合对 AI 模型进行排名。目前,OpenAI 的 GPT-5 模型在排名中占据主导地位,其中 GPT-5.5 在质量基准测试中表现出色,但由于其新颖性和价格,在采用方面落后。该指数旨在提供比理论基准测试更全面的模型性能视图,反映实际效用。