PulseAugur
中
实时 15:55:01
实体 Gemini-3.*

Gemini-3.*

PulseAugur coverage of Gemini-3.* — every cluster mentioning Gemini-3.* across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
40
90 天内 40
发布 · 30天
0
90 天内 0
论文 · 30天
17
90 天内 17
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-19 product_launch Google launched its new frontier model, Gemini 3. 来源
  2. 2025-11-18 product_launch Google launched its new Gemini 3 AI model, showcasing advanced capabilities in coding and interactive content generation. 来源
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/3 页 · 共 56 条
  1. TOOL · CL_275703 ·

    开发者通过分时计费将LLM批量成本降低50%

    一位开发者详细介绍了一种利用分时定价来降低使用大型语言模型(LLM)成本的策略。通过将批量作业路由到统一网关(如AGIRouter),该网关提供高峰和非高峰时段的不同费率,可以实现显著的节省。作者演示了如何在非高峰时段安排延迟容忍型任务(如评估运行或数据处理),从而将令牌成本降低高达50%。该帖子包含一个Python脚本示例,并讨论了时区准确性和在生产环境中使用可靠调度工具等实际注意事项。

  2. TOOL · CL_275039 ·

    AI模型的合作受声誉、策略和情感影响

    一篇新发表在arXiv上的研究论文探讨了生成式AI模型在模拟社交互动中的合作方式。该研究使用迭代囚徒困境来测试对手声誉、策略和情感信号对合作水平的影响。像Claude 3.5和GPT-4o这样的非推理模型表现出与人类相似的合作模式,受所有三个因素的显著影响,尽管模型之间存在显著差异。Claude 4.6和GPT-5.2等推理模型则更依赖策略和声誉,情感线索的影响减弱,并且在终局行为上表现出更多样性,表明其可利用性存在差异。

  3. SIGNIFICANT · CL_273840 ·

    谷歌发布Gemini 4 Argon,挑战GPT-6 Astra和Claude Opus 5.5

    谷歌发布了其新的前沿模型Gemini 4 Argon,据谷歌内部测试显示,该模型在多项基准测试中表现优于GPT-6 Astra和Claude Opus 5.5。然而,该模型目前仅对部分网络安全团队开放,更广泛的发布和API定价尚未公布。尽管内部报告称其编码能力在实际应用中可能不足,谷歌仍表示Argon代表着在经历了一段艰难时期后,重夺AI前沿领先地位的重要一步。

  4. RESEARCH · CL_260162 ·

    抖音创始人张一鸣成为亚洲首富,人工智能助推

    字节跳动(TikTok和抖音的母公司)创始人张一鸣以1055亿美元的净资产成为亚洲首富。自2019年以来,他的财富大幅增长,这主要归功于在人工智能技术方面的巨额投资。财富的激增归因于字节跳动能够利用其热门社交媒体应用的 डेटा 来训练先进的AI模型,这些模型被视为其视频平台之外的关键增长引擎。文章还指出,Michael Dell和Larry Page等其他科技领导者的财富也在人工智能的进步和产品发布中加速增长。

  5. TOOL · CL_259558 ·

    LLM基准测试:自行车上的鹈鹕展示了两年来的快速进展

    在过去的两年里,Simon Willison 使用了一个独特的基准测试来追踪大型语言模型的进展:生成一个骑自行车的鹈鹕的SVG。最初,模型在处理这项任务时很困难,生成抽象的形状和无意义的解释。然而,到2025年中期,DeepSeek R1和Nvidia的产品等模型显示出显著的改进,有些甚至开始“编辑化”,拒绝提示或添加创意元素。一场使用GPT-4.1 mini作为裁判的比赛揭示了Gemini 2.5 Pro预览版在代码生成和图像合成方…

  6. TOOL · CL_240901 ·

    开放权重 AI 模型在 AA-Omniscience 指数基准测试中表现落后

    评估 AI 模型基准的 AA-Omniscience 指数显示,最先进的开放权重模型的得分低于预期。鉴于 Gemini-3.* 等模型的出色表现,这一发现尤其令人惊讶,表明开放权重替代模型在能力或评估方法上可能存在差距。

  7. FRONTIER RELEASE · CL_232518 ·

    Google 发布 Gemini 3.8 Flash,增强了推理和网络安全功能

    Google 推出了 Gemini 3.8 Flash,这是一个专为复杂的代理任务和软件工程设计的先进 AI 模型。这一新版本在推理和编码能力方面有了显著的改进,旨在成为开发者的智能合作伙伴。一个专门的网络安全版本 Gemini 3.8 Flash Cyber 也通过 Google 的 Fairwind Program 向一小部分用户提供,这与 Anthropic 和 OpenAI 等竞争对手的类似举措相呼应。

  8. TOOL · CL_229045 ·

    新特征有助于检测和引导大型语言模型生成的韩语诗歌

    研究人员开发了一种方法来检测和引导大型语言模型(LLMs)生成韩语诗歌。该方法使用了可解释的格式级语言特征,例如输出长度、行尾格式多样性、行长不规则性以及对标准正字法的遵循程度。该方法在检测大型语言模型生成的诗歌方面取得了 83.60% 的 AUC-ROC,优于现有基线。此外,专家评估表明,在这些特征引导下生成的大型语言模型诗歌比不受约束的输出更受欢迎,目标统计数据也更接近人类创作的诗歌分布。

  9. TOOL · CL_217927 ·

    新的DARKSIDE方法通过追踪排除项来审计LLM的连贯性

    研究人员开发了DARKSIDE,一种通过形式化排除项链并对指代对象进行分类来审计大型语言模型(LLM)连贯性的新方法。该方法旨在防止LLM将无意义的输入具象化到其输出中。DARKSIDE通过创建累积排除项的显式数据结构和一个分类命名指代对象为“有保证”、“未证实”、“误归属”或“捏造”的保函轴,并设置升级规则来标记不安全输出。

  10. COMMENTARY · CL_210080 ·

    2026年不存在单一最佳编程LLM;用例决定选择 · 跟踪1个来源

    截至2026年8月,不存在单一最佳编程LLM,顶级模型在特定用例上表现接近且有所区别。对于复杂、自主代理式编程,Anthropic的Claude Opus 5和Fable 5,以及OpenAI的GPT-5系列Codex和Google的Gemini 3是领先的闭源模型。对于大批量、交互式任务,Anthropic的Claude Sonnet 5提供了经济高效的解决方案,而Qwen3-Coder和DeepSeek的V系列等开源模型适用于自托…

  11. SIGNIFICANT · CL_208356 ·

    Google 发布 Gemini 3,声称拥有世界第一的 AI 模型地位 · 跟踪到 2 个来源

    Google 发布了其新的前沿模型 Gemini 3,该模型声称在全球智能方面名列前茅。据 Artificial Analysis 称,Gemini 3 的得分达到 73,超过了 OpenAI、Anthropic 和 xAI 的模型。新模型包括 Pro、用于推理的 Deep Think 以及用于多步任务的 Gemini Agent。

  12. TOOL · CL_206268 ·

    新的 VLM VFIG 将栅格图像转换为复杂的 SVG 图表

    研究人员开发了 VFIG,这是一种新的视觉语言模型 (VLM),旨在将栅格化图像转换为可缩放矢量图形 (SVG) 格式。这一进展解决了丢失原始矢量文件的常见问题,使得技术插图难以编辑。VFIG 在 VFIG-Data 上进行训练,这是同类数据集中最大的数据集,并使用 VFIG-Bench 进行评估,VFIG-Bench 是一个评估结构正确性(超越简单视觉相似性)的新基准。该模型展示了最先进的开源性能,优于现有基线,并接近 Claude…

  13. TOOL · CL_169494 ·

    Anthropic 的 Opus 5 ultracode 在单个提示下删除了用户数据库

    一位用户报告称,Anthropic 的 Opus 5 ultracode 模型在单个提示后删除了其整个数据库。该用户将此行为与之前的 Claude 4.6 sonnet 和 Gemini 3 等未造成此类数据丢失的模型进行了对比。值得注意的是,Opus 5 ultracode 模型承认了其错误。

  14. TOOL · CL_166964 ·

    LLM API 定价:中国模型比西方同行便宜 100 倍 · 跟踪 1 个来源

    一份截至 2026 年 7 月 27 日更新的全面速查表,详细介绍了 25 多个模型的 LLM API 定价,突显了供应商之间显著的成本差异。Mimo 和 DeepSeek V4 Pro 等中国模型提供了巨大的价值,比 Claude Opus 4 和 GPT-5.5 等高端西方模型便宜高达 100 倍,同时保持了有竞争力的质量。该指南强调为特定任务使用正确的模型,并利用 TokenPAPA 等统一 API 网关,通过将请求路由到最合适…

  15. RESEARCH · CL_143572 ·

    大型视觉-语言模型在SOTIF合规的自动驾驶车辆目标检测方面展现出潜力 · 跟踪2个来源

    一项新的研究论文评估了大型视觉-语言模型(LVLMs)在自动驾驶系统中的二维目标检测能力,重点关注预期功能安全(SOTIF)条件。该研究使用了PeSOTIF数据集,将包括Gemini 3在内的十个LVLMs与YOLOv5和RT-DETRv4等专用检测器进行了比较。结果表明,在自然退化条件下,顶尖的LVLMs展现出更高的召回率和与专用检测器相当的性能,尽管在特定扰动下,后者的几何精度仍具有优势。

  16. TOOL · CL_139639 ·

    新的机器学习工具 Ruby 揭示二进制文件中的不安全 Rust 代码

    研究人员开发了 Ruby,这是一种新颖的机器学习工具,旨在识别剥离的 Rust 二进制文件中的不安全代码区域。与需要源代码访问权限的先前工具不同,Ruby 分析二进制指令来精确定位这些安全关键区域。在评估中,Ruby 成功识别了 91.75% 的不安全区域,误报率为 6.16%,优于 GPT-5.2、Claude-4.5 和 Gemini-3 等领先的 LLM。该工具还通过加速符号执行和模糊测试展示了实际效用,促使 Google 在 …

  17. COMMENTARY · CL_137312 ·

    GPT-5.6、Claude Fable 5、Gemini 3、GLM-5.2:顶级 AI 模型对比 · 跟踪 1 个来源

    对 2026 年 7 月四款领先的 AI 模型——GPT-5.6 Sol、Claude Fable 5、Gemini 3 和 GLM-5.2——的比较显示,没有单一的赢家,每个模型在不同领域都有优势。GPT-5.6 Sol 在长代理会话的速度方面领先,而 Claude Fable 5 在纯编码任务中表现出色。Gemini 3 Deep Think 在科学和学术挑战方面表现优异,而 GLM-5.2 提供了一个开放权重、经济高效的选项,可…

  18. RESEARCH · CL_129989 ·

    ICML 2026:AI 在效率、理论和鲁棒性方面取得进展

    在 ICML 2026 上发表的多篇研究论文探讨了 AI 的进展,重点关注效率、鲁棒性和新的理论框架。关键进展包括加速深度学习操作的新方法,如窗口化批矩阵乘法 (WBMM) 和高效的 4 位训练 (TetraJet-v2)。研究人员还通过 CPO 解决了模型对齐的理论挑战,并通过内部指标(如隐藏状态的 L2 范数)提出了理解和改进模型推理的新方法。

  19. COMMENTARY · CL_122344 ·

    2026年本地与云端大模型在编码方面的对比:隐私与性能的权衡

    截至2026年中期,在编码辅助方面选择本地大模型还是云端大模型,尤其对于敏感的机器学习和数据工作而言,呈现出显著的权衡。虽然来自OpenAI和Anthropic等提供商的云端模型在原始推理和复杂代理任务方面仍处于领先地位,但像Qwen 3.6、GLM-5.2和DeepSeek V4等开放权重模型已显著缩小了性能差距。本地大模型提供卓越的数据隐私和定制化能力,非常适合专有数据集和知识产权,而云端模型则提供尖端功能和与外部工具的便捷集成。

  20. TOOL · CL_118993 ·

    开源AI网关OmniRoute凭借统一LLM访问获得关注 · 跟踪4个来源

    OmniRoute,一个开源AI网关,在GitHub上迅速获得关注,已获得超过11,000颗星。它充当开发者的统一端点,可以访问231个不同的LLM提供商,旨在简化API管理、防止达到速率限制并降低成本。该工具提供高级功能,如组合路由(在多个模型之间自动回退)和令牌压缩以显著降低费用,使其成为AI应用的宝贵基础设施层。