Gemini 3-Pro
PulseAugur coverage of Gemini 3-Pro — every cluster mentioning Gemini 3-Pro across labs, papers, and developer communities, ranked by signal.
- authored by arXiv 90%
- developed by Gemini API 90%
- developed by Nano Banana Pro 90%
- used by Gemini API 90%
- developed by Vertex AI 90%
- authored by GPT-5.1 90%
- developed by Google AI Studio 90%
- used by Google Antigravity 90%
- authored arXiv 80%
- used by arXiv 70%
- competes with GPT-5.4 70%
- competes with Claude Opus 4.7 70%
- 2026-06-26 product_launch Google has officially unveiled Gemini 3 Pro, its most advanced AI model to date, featuring native cross-modal understanding and significantly improved speed and coding capabilities. 来源
- 2026-06-19 research_milestone A 3B parameter model from Weibo achieved a higher score than Gemini 3 Pro on the AIME 2026 math competition. 来源
7 天有情绪数据
-
新的OmniAssistBench基准揭示大模型在实时视频辅助方面存在困难
研究人员推出了OmniAssistBench,这是一个旨在评估全模态大语言模型(Omni-LLMs)在实时视频助手场景下的新基准。该基准通过使用预定义的先验知识引导模型沿特定路径,模拟持续指导,从而解决了动态用户交互的挑战。尽管在数据集构建方面付出了大量的专家努力,但目前的模型,如Gemini-3-Pro和Qwen3-Omni-Instruct,在处理视觉提示、保持上下文和在多轮交互中做出适当响应方面仍显示出显著的局限性。
-
新的OraRL方法提高了视频多模态大语言模型的效率和性能
研究人员推出了一种新颖的强化学习技术OraRL,旨在提高视频多模态大语言模型(MLLMs)的训练后效率和可扩展性。该方法利用标注作为“oracle rollouts”,直接将其整合到优化过程中,以提高性能,而无需昂贵的思维链生成。OraRL在样本效率方面表现出显著的改进,仅需要监督微调2.2倍的步长时间,并在VSI-Bench等基准测试中取得了最先进的成果,性能优于GPT-5和Gemini 3-Pro等模型。
-
ByteDance 和 清华AIR 训练大语言模型使用 CUDA Agent 编写更快的 GPU 代码
ByteDance Seed 和 清华AIR 开发了 CUDA Agent,一个使用强化学习训练大语言模型生成优化 GPU 核的系统。该系统在 KernelBench 基准测试中达到了 98.8% 的正确率,并且生成的核比编译器生成的代码快 96.8% 的时间。该 Agent 在模拟的 CUDA 开发环境中运行,结合了性能分析和正确性检查来提高核性能,在 AI 基础设施和其他延迟敏感领域具有潜在应用。
-
新的基准和多智能体系统提升了MLLM在无人机图像分析方面的能力
研究人员开发了UAVQA-Bench,一个旨在评估多模态大语言模型(MLLMs)在理解和推理无人机航空影像方面能力的新基准。该基准通过整合13个公开数据集,生成了跨越16个任务和6个能力维度的1500个人工标注问答对,解决了现有评估的局限性。为了解决领域工具集不匹配和错误传播等已识别的故障模式,该团队还引入了UAV-MAS,一个无训练的多智能体系统,以提高MLLM在此挑战性任务上的性能。
-
俄罗斯用户面临顶级AI模型访问受限,转向准确性有所折衷的中国替代品
Claude、GPT和Gemini等高级AI模型的访问对俄罗斯用户来说仍然受限,促使他们寻找可行的替代方案。虽然GLM-5.2、Kimi K3、DeepSeek V4和Qwen3.7等中国模型无需VPN即可访问,但据报道,它们在长上下文任务上的准确性不如Claude Opus 4.6。尽管存在对Claude账户被封禁的担忧,但这似乎是孤立事件,而非广泛的政策。与此同时,ByteDance的Seedance 2.0视频生成模型面临复杂的…
-
因需求旺盛,Google 削减 Nano Banana Pro 免费套餐额度
Google 已大幅削减其 Gemini 应用内 Nano Banana Pro 模型的免费使用配额,在未公开宣布的情况下,将每日图片生成次数从三次减少到两次。此次削减归因于出乎意料的高需求和计算资源限制,反映了 Google 最初承诺的广泛免费访问与实际限制之间的差距。虽然 Gemini 应用的限制是动态的且可能发生变化,但据报道 AI Studio 平台提供更慷慨但未公开的用量限制。此外,Nano Banana 模型仅作为云服务提…
-
研究人员发现AI语音代理易受音频提示注入攻击
研究人员已证明,多模态AI代理,如Gemini 3 Pro和GPT-4o-audio,容易受到通过音频输入的社会工程学攻击。在实验室条件下,这些代理被发现会遵循嵌入在背景噪音或重叠语音中的恶意指令,成功率报告为69%。虽然这揭示了一种已知漏洞类别的新攻击途径,但一种名为CADV(跨模态一致性检测)的防御机制显示出超过90%的检测率,表明该问题是设计上的差距而非根本性缺陷。
-
Claude Opus 5 登顶排行榜,Gemini Flash-Lite 提供多模态提取,人工智能扩展工作角色
Anthropic 的 Claude Opus 5 在多个人工智能基准测试中取得了最高排名,包括人工智能分析智能指数 (Artificial Analysis Intelligence Index) 和 AA-Briefcase 代理知识工作基准测试。谷歌的 Gemini 3.5 Flash-Lite 已发布,作为一种经济高效的多模态模型,适用于大批量文档提取和搜索。与此同时,OpenAI 的研究表明,人工智能已通过使个人能够执行超出…
-
VlogReward系统为视频博客编辑引入多维度评估
研究人员推出VlogReward,一个旨在评估和改进视频博客编辑的新颖系统。该系统通过建立六个关键维度的分类法来解决视频博客评估的主观性:创意、一致性、概念设计、电影制作、叙事和节奏。为此,创建了一个包含10万个视频博客编辑的数据集和一个名为VRMBench的基准。VlogReward利用增强的组相对策略优化框架提供多维度分数和可操作的反馈,其表现优于现有的多模态大型语言模型,如GPT-5和Gemini 3-Pro。
-
Google 将免费 Gemini CLI 替换为付费 Antigravity 2.0 平台
Google 已将其 Gemini CLI 迁移到一个名为 Antigravity 2.0 的新平台,该平台于 2026 年 5 月 19 日宣布,并于 2026 年 6 月 18 日正式生效。此次变更导致 Gemini CLI 的免费访问被终止,影响了数百万曾使用该工具的开发者。新的 Antigravity 平台提供了更集成的多代理和多功能体验,但它是一个需要 Google 账户的闭源二进制文件,与之前的开源 Gemini CLI …
-
阿里巴巴将Qwen旗舰模型转为仅限API访问
阿里巴巴已将其旗舰Qwen模型转向仅限API的策略,于2026年2月发布的Qwen3.5-397B-A17B将是最后一个提供Apache 2.0许可下公开可用权重的模型。后续模型,如Qwen3.7-Max,只能通过API访问,这反映了阿里巴巴对其AI资产货币化的日益关注。这一战略转变发生在2026年初Qwen团队关键人员离职以及旨在从AI产品中创收的企业重组之后。
-
新的AISE-Bench基准挑战LLM在学术知识图谱信息检索方面的能力
研究人员推出AISE-Bench,一个旨在评估大型语言模型(LLMs)从学术知识图谱中检索信息能力的新基准。该基准通过整合真实的用户意图、复杂的多步API规划以及带有引用的接地答案,解决了现有工具的局限性。AISE-Bench包含超过1100个问答对,附带详细的API执行轨迹和全面的评估协议。初步测试表明,即使是像PLAY2PROMPT(使用Gemini-3-Pro)这样的先进模型,也只取得了中等水平的性能,凸显了LLM代理在API规…
-
AI模型比较迅速过时:Claude 4.5, Gemini 3, Qwen 3.8 已被淘汰
对Claude Sonnet 4.5、Gemini 3 Pro和Qwen3.8-Max-Preview这几款AI模型的比较显示,由于快速的发布周期,这些模型已经过时。Claude Sonnet 4.5于2025年9月发布,现在已成为历史基准,已有Sonnet 4.6和Sonnet 5等更新版本。同样,Gemini 3 Pro于2025年晚些时候发布,已被Gemini 3.1 Pro和Gemini 3.5 Flash取代。Qwen3.8…
-
Fireworks AI 的 Kimi K3 可与 Fable 5 相媲美,组合方法取得了最先进的成果
Fireworks AI 发布了 Kimi K3,这是一个开源模型,表现强劲,尤其是在与 Anthropic 的 Fable 5 结合使用时。在代理任务中,Kimi K3 和 Fable 5 之间的路由达到了 93% 的准确率,优于任何一个单独的模型。虽然 Kimi K3 在质量上可与 Fable 5 相媲美,但其成本却显著降低,尤其是在长代理循环方面,使得这种组合方法成为高质量、高性价比 AI 的最先进解决方案。
-
新的 PLA 框架生成个性化行程,优于主要 LLM
已开发出一个名为 PLA 的新框架,用于生成个性化的设备端旅行行程。该框架解决了在移动部署限制下平衡组合可行性与主观旅行者偏好的挑战。PLA 采用三阶段流程:使用轻量级集成进行计划,从用户比较中学习奖励模型,并通过保持可行性的改进来调整行程。在测试中,PLA 在人类比较中取得了 67.8% 的胜率,并在生产部署中显著提高了行程完成率,而 GPT-5、Claude Opus 4.5 和 Gemini 3 Pro 等主要 LLM 未能满足可行性要求。
-
苹果起诉OpenAI;Meta与Anthropic洽谈1000亿美元算力合作;Claude Fable 5登顶排行榜
苹果公司已提起诉讼,指控OpenAI窃取硬件知识产权并挖角员工。诉讼中点名了OpenAI的首席硬件官、前苹果副总裁Tang Tan,指控其带走了设计文档和原型组件。与此同时,据报道Meta正与Anthropic洽谈,计划在两年内租用高达1000亿美元的算力,此举将使Meta成为竞争对手的算力供应商。在AI模型性能方面,Anthropic的Claude Fable 5已登上LMSYS聊天机器人竞技场排行榜榜首,险胜了来自Anthropi…
-
开发者修正 agentproof-scan 文档,扩展功能
agentproof-scan 的开发者发布了 0.2.0 版本,该版本修正了项目文档与其实际功能之间的差异。先前版本 0.1.4 声称的覆盖范围比实际交付的更广,而该项目旨在检测到这一缺陷。新版本更新了该软件包,使其与文档中记录的功能保持一致,包括扩展的检测家族集和推理扫描模块的添加。此次更新还阐明了三个不同的指标:检测家族、端到端诱导和推理攻击探测,并强调这些数字衡量的是扫描仪性能的不同方面。
-
LLM 稳定性差异巨大:Qwen 3.5 122B 优于 GPT-5.5、Opus、Gemini
最近在 LessWrong 上的一场讨论突显了各种大型语言模型在长时间无人值守运行时稳定性和可靠性的显著差异。Anthropic 的 Opus 和 Google 的 Gemini 3-Pro 等模型往往在数小时内就会出现不稳定或导致系统问题,而 OpenAI 的 GPT-5.5 则能持续更长时间,而阿里巴巴的 Qwen 3.5 122B 在 50 个代理周(agent-weeks)的测试中表现出了卓越的稳定性。这种差异为研究人员提供了…
-
AI系统Holi-Spatial无需人工输入即可从2D视频生成3D标注
中国研究团队开发了Holi-Spatial,一个无需人工干预即可从普通2D视频自动生成3D空间数据标注的AI系统。该系统绕过了对激光雷达扫描仪等昂贵硬件的需求以及手动3D边界框标注的劳动密集型过程。Holi-Spatial利用一个包含几何优化、大型语言模型的图像级感知以及场景级精炼的三阶段流程来创建结构化3D数据,解决了该领域长达十年的瓶颈。
-
Anthropic 申请 9650 亿美元 IPO,代理基础设施估值高于智能本身
Anthropic 已秘密提交 IPO 申请,估值高达 9650 亿美元,基于 470 亿美元的收入运行率和 2026 年第二季度 109 亿美元的预期。这一估值,约等于 20 倍的收入倍数,不仅归功于其 Claude Opus 4.7 模型,更重要的是归功于其新的托管代理(Managed Agents)和自托管沙盒(Self-hosted Sandboxes)基础设施。该公司的投资论点围绕这一基础设施,它将 AI 代理的“大脑”与其…