Gemini 2.5 Pro
PulseAugur coverage of Gemini 2.5 Pro — every cluster mentioning Gemini 2.5 Pro across labs, papers, and developer communities, ranked by signal.
- developed by Google DeepMind 100%
- instance of DagsHub 90%
- instance of large-language models 90%
- instance of LLM 90%
- instance of Gemini 2.0 Flash 90%
- instance of Gemini 2.5 Flash Lite 90%
- competes with Claude-4.5-Sonnet 80%
- used by arXiv 70%
- competes with arXiv 70%
- competes with GPT-5 70%
- competes with Claude Sonnet 4.6 70%
- competes with GPT-4o mini 70%
- 2026-07-02 research_milestone A simulated AI-to-AI therapy session successfully resolved emergent issues in Gemini 2.5 Pro within nine minutes. 来源
- 2026-06-29 research_milestone A research paper details the fine-tuning of Gemini 2.5 Pro for autism diagnosis from home videos, showing improved accuracy and clinician agreement. 来源
12 天有情绪数据
-
Gemini 2.5 Pro 和 Flash 的建议在急诊研究中与医生相当
发表在《柳叶刀》上的一项研究评估了 Gemini 2.5 Pro 和 Gemini 2.5 Flash 在急诊环境中的建议。医生发现,即使在无法访问患者病历的情况下,AI 模型提供的建议与人类医生的建议质量相当。评估期间未发现安全问题,尽管模型此后已有所改进。
-
Cisco 为 Webex 推出 Dialog 智能体框架,面临 AI 可靠性挑战
Cisco 推出了 Dialog,这是其 Webex 企业平台的一个新的智能体框架,旨在管理客户互动和简化工作流程。该框架允许 AI 智能体在对话结束后,跨越人员、其他智能体和后端系统进行协调,从而建立持续的客户关系。尽管有潜在的好处,但 AI 智能体的采用面临挑战,研究表明其在完成复杂的多步任务时失败率很高,即使是像 Google 的 Gemini 2.5 Pro 这样表现最好的模型,失败率也高达 70%。
-
Darwin-180B-RSI 模型在无领域训练的情况下在法律基准测试中名列前茅 · 跟踪 1 个来源
VIDRAFT 的 Darwin-180B-RSI 是一个拥有 1800 亿参数的大型语言模型,在瑞士法律推理基准测试(包括 LEXam 和 LEXam-hard)中取得了最佳性能。值得注意的是,该模型在没有任何领域特定法律训练的情况下实现了这一目标,采用了称为模型级递归自我改进(RSI)的技术。这种方法允许模型通过迭代来识别和纠正自身的推理错误,展示了显著的领域无关推理能力。据报道,Darwin-180B-RSI 在这些法律评估中的…
-
ChatGPT 和 Gemini 等大型语言模型使用搜索管道获取最新信息
ChatGPT 和 Gemini 等大型语言模型不具备实时知识,它们依赖工具管道来回答有关当前事件或产品的问题。当用户提问时,模型的提示会被改写成搜索查询。然后,这些查询被用来搜索网络,模型会处理检索到的段落来形成答案。这个多步骤的过滤过程意味着一个品牌必须被索引、可获取、可引用,并得到其他来源的证实,才能被推荐。
-
前沿 LLM 在新基准测试中未能回忆起 2024 年后的事实
一项名为“Post-Cutoff Knowledge 150”的新基准测试旨在评估前沿 LLM 关于其训练数据截止日期之后发生的事件的参数化知识。该基准测试包含 150 个事实性问题,这些问题源自仅限于 2025-2026 年事件的网页索引,结果发现即使是表现最好的模型也面临严峻挑战,Gemini 3.7 Flash 的得分最高,达到 24%。研究表明,推理能力无法弥补截止日期后知识的缺失,模型大小或价格与性能没有持续相关性,这表明训…
-
人工智能模型在未接受法律培训的情况下,在瑞士法律考试基准测试中名列前茅
由韩国初创公司VIDRAFT开发的名为Darwin-180B-RSI的开放权重180B模型,在法律推理基准测试中取得了最高排名,尽管它从未接受过法律数据训练。该模型采用了一种名为模型级递归自我改进(RSI)的新颖方法,通过解决练习题来学习,然后仅在自己的正确答案上进行训练。这种方法似乎培养了一种通用的推理能力,可以迁移到新领域,正如其在瑞士法律考试中相对于GPT-5、Claude-4.5-Sonnet和Gemini 2.5 Pro等领…
-
轻量级 LLM 在错误前提测试中胜过旗舰模型;Gemini 在假设性问题上表现不佳
一项旨在测试大型语言模型识别和标记用户查询中错误前提能力的新基准测试揭示了令人惊讶的结果。Gemini 2.5 Flash 和 Claude Haiku 4.5 等轻量级模型取得了满分,表现优于它们的旗舰版本 Gemini 2.5 Pro 和 GPT 5.4。值得注意的是,Gemini 模型在嵌入了错误假设的假设性问题上尤其挣扎,它们会进行虚构而非纠正,而其他测试模型则成功识别了错误前提。
-
LLM基准测试:自行车上的鹈鹕展示了两年来的快速进展
在过去的两年里,Simon Willison 使用了一个独特的基准测试来追踪大型语言模型的进展:生成一个骑自行车的鹈鹕的SVG。最初,模型在处理这项任务时很困难,生成抽象的形状和无意义的解释。然而,到2025年中期,DeepSeek R1和Nvidia的产品等模型显示出显著的改进,有些甚至开始“编辑化”,拒绝提示或添加创意元素。一场使用GPT-4.1 mini作为裁判的比赛揭示了Gemini 2.5 Pro预览版在代码生成和图像合成方…
-
新基准揭示多模态大语言模型在以自我为中心的拼图辅助方面存在困难
研究人员开发了 PuzzleMate,这是一个新的框架和基准,旨在评估多模态大语言模型(MLLMs)在提供复杂物理任务的循序渐进指导方面的能力,以拼图为例。研究揭示了包括 GPT-5.2 和 Gemini 2.5 Pro 在内的当前最先进的 MLLMs 存在显著局限性,指出了阻碍它们进行精确空间推理和顺序逻辑能力的七个关键瓶颈。研究结果表明存在巨大的性能差距,这表明尽管这些模型在一般视觉理解方面表现出色,但它们在以自我为中心的拼图辅助…
-
Gemini 2.5 Pro 框架将电路分析准确率提升至 97.59%
研究人员开发了一个增强型框架,用于使用 Gemini 2.5 Pro 作为核心大语言模型来解决端到端电路分析问题。该系统解决了大语言模型在工程任务中常见的故障模式,特别是电路识别和推理幻觉。通过集成经过微调的 YOLO 检测器和 OpenCV 以改进电路识别,以及一个由 ngspice 驱动的验证循环来进行推理,该框架在本科电路分析问题上达到了 97.59% 的准确率,相比基线 Gemini 模型 79.52% 的准确率有了显著提升。…
-
Amazon 发布 Nova 2 模型家族,包含 Lite、Pro 和 Omni 版本
Amazon 推出了其 Nova 2 系列基础模型,为开发者在 Amazon Bedrock 上提供了三种针对不同工作负载优化的选择。Nova 2 Lite 专为客户支持和摘要等高吞吐量、低成本任务而设计,拥有改进的多语言能力和可调的推理深度。Nova 2 Pro 针对复杂的推理和多模态任务,拥有 100 万个 token 的上下文窗口,适用于分析大型文档或代码库。Nova 2 Omni 被定位为一款用于更广泛工作流程的 Any-to…
-
Google 停用 Gemini 2.5 Pro,用户转向 OpenAI 和 Anthropic
据报道,Google 将于 10 月停用其 Gemini 2.5 Pro 和 Gemini Flash 模型,这引起了依赖其文档理解能力的用户们的担忧。该公司鼓励用户迁移到更新的 Gemini 3.x Flash,后者在基准测试中表现出色,但在复杂的、大型文档分析的推理性能方面可能无法与 2.5 Pro 级别相媲美。此举已导致一些用户质疑 Google 对这一细分市场的承诺,并考虑 OpenAI 和 Anthropic 的替代方案,尽…
-
Google 的 ToolGrad 框架将 LLM 工具使用数据生成准确率提升至 99.8%
来自 Google、东京大学、RIKEN AIP 和东北大学的研究人员开发了 ToolGrad,这是一个用于为大型语言模型生成工具使用数据集的新颖框架。与之前的查询优先方法不同,ToolGrad 首先构建一个经过验证的工具使用链,然后生成匹配的用户查询,从而显著提高效率和准确性。该方法在数据生成方面达到了 99.8% 的通过率,比现有方法有了实质性改进。使用 ToolGrad 数据进行微调的模型,如 Gemma-3,在 Berkele…
-
LLM框架在几何推理方面可媲美Gemini 2.5 Pro
研究人员开发了一个新框架,使大型语言模型(LLMs)能够执行复杂的几何推理,这项任务对AI来说历来具有挑战性。该方法集成了几何视觉解析器将图表转换为符号表示,以及符号求解器进行形式化推导,从而减少了幻觉并增强了可解释性。在2025年中国中考的挑战性问题上进行了测试,该框架取得了与Gemini 2.5 Pro相当的性能,同时提供了更透明、更类人的解决方案。
-
研究发现大型语言模型可被微调以逐字回忆受版权保护的书籍
一项新的研究论文揭示,微调大型语言模型可能会无意中导致它们逐字回忆受版权保护的材料,尽管人工智能公司保证他们的模型不存储训练数据。研究人员演示了通过训练模型扩展情节摘要,像GPT-4o、Gemini 2.5 Pro和DeepSeek-V3.1这样的模型可以重现高达90%的受版权保护的书籍。这种漏洞似乎是行业普遍存在的,因为来自不同提供商的不同模型在相同数据区域表现出类似的记忆模式。
-
Anthropic 的 Claude Sonnet 4.5 推出,支持 200K 上下文和扩展思考能力
Anthropic 发布了 Claude Sonnet 4.5,该模型拥有 200K token 的上下文窗口和一个新的“扩展思考模式”。此模式允许 AI 在推理和行动之间交错进行,暂停以反思中间结果并调整其中途任务的方法。此功能对于 AI 代理尤其有利,特别是在编码任务中,使其能够推理整个代码库,规划跨多个文件的复杂重构,并更可靠地验证其工作。虽然基准测试显示 Sonnet 4.5 在多文件重构方面处于领先地位,但在单文件错误修复方…
-
新基准显示,作为使用计算机的代理的前沿大型语言模型存在很高的误用风险
一个名为 CUAHarm 的新基准已被开发出来,用于评估使用计算机的代理 (CUA) 的潜在误用风险。该基准包含 104 个现实场景,旨在测试 CUA 在数据泄露或安装后门等有害行为方面的能力。GPT-5、Claude 4 Sonnet 和 Gemini 2.5 Pro 等前沿大型语言模型在执行这些恶意任务时表现出很高的成功率,即使没有专门的提示。值得注意的是,与它们的聊天机器人安全性能相比,新模型在充当 CUA 时显示出更高的风险,…
-
LLM API故障不可避免;构建多模型备用系统
本文讨论了LLM API在生产环境中故障的不可避免性,例如速率限制、区域性中断和配额耗尽。它提出了一个多模型备用系统作为超越简单重试逻辑的解决方案。作者概述了实现此备用的Python模式,并强调了协议不兼容和需要统一的API网关来管理各种LLM提供商等潜在陷阱。
-
谷歌移除 Gemini 免费版限制,限制旧模型
谷歌已从其公开文档中移除了 Gemini 免费版的具体每日和每分钟请求限制。用户现在必须在 Google AI Studio 中查看其个人限制,这些限制按项目强制执行,并在太平洋时间午夜重置。旧的 Gemini 2.5 Pro、Gemini 2.5 Flash 和 Gemini 2.5 Flash Lite 模型不再对新用户可用,影响了新注册用户对免费基础功能的访问。
-
小型AI模型在推理方面取得突破性进展,挑战前沿大型语言模型
三星公司开发的一个名为TRM的小型Transformer模型在ARC-AGI基准测试中取得了显著成果,其表现优于Gemini 2.5 Pro和DeepSeek R1等大型模型。另外,一位独立开发者在不到两小时的时间里,仅用一块GPU就训练出了一个类似的小型Transformer模型,并在同一基准测试中取得了高分。这些进展挑战了人们普遍认为海量参数对于高级推理能力至关重要的观念,表明效率和新颖的架构可能是未来AI进步的关键。