google/gemini-3.5-flash
PulseAugur coverage of google/gemini-3.5-flash — every cluster mentioning google/gemini-3.5-flash across labs, papers, and developer communities, ranked by signal.
-
研究发现,视觉模型在无法阅读时会编造数据
一项最近的实验测试了 27 种视觉模型变体在阅读损坏发票文档方面的能力,揭示了它们处理不可读文本方式的显著差异。一些模型,如 Google 的 Gemini 3.5 Flash,即使在非常低的分辨率下也能保持高准确率,而其他模型,包括 OpenAI 的 GPT 变体,则面临巨大挑战。一个关键发现是,在模型的阅读能力崩溃后,有些模型会编造看似合理但错误的信息,而有些模型则会简单地返回空白字段,这种行为因提供商甚至模型网关而异。
-
LLM定价波动:NVIDIA、Qwen和Z.ai价格调整;新增模型 · 追踪10个来源
Token Ledger 发布了 2026 年 8 月初 LLM 定价变化的每日更新。包括 NVIDIA Nemotron 3 Super 和 Ultra、Qwen 变体以及 Z.ai 的 GLM 5.2 在内的几款模型价格进行了调整,报告显示有涨有跌。新增了 Meta 的 Muse Spark 1.2 和 inclusionAI 的 Ling-3.0-flash 等新模型,同时一些知名模型如 Gemini、Claude 和 GPT-…
-
新的IPO Finance Agent对LLM进行基准测试,Qwen 3.7 Max准确率领先
研究人员开发了IPO Finance Agent,这是一个用于评估LLM在金融任务(特别是IPO尽职调查)方面的增强框架。该新Agent通过整合长文档的上下文检索和一个包含1000个IPO尽职调查问题的数据库,扩展了现有的Finance Agent v2。该系统还包含一个用于生成评估评分标准的自动化流程,减少了对人类专家审查的需求。实验表明,阿里巴巴的Qwen 3.7 Max准确率达到79.4%,而小米的MiMo-2.5 Pro以76…
-
LLM 模型目录出现价格变动、移除和新的免费套餐
LLM 模型目录在不同提供商的价格和可用性方面发生了重大变化。MoonshotAI 的 Kimi 模型价格有所下调,而 MoonshotAI 的 Kimi K2.6 和 NVIDIA 的 Nemotron 3.5 等一些免费模型已被移除或更新。OpenAI 的 GPT-4 模型和百度的 ERNIE 模型的一些旧版本也已从可用列表中淘汰。此外,NousResearch Hermes 3 70B Instruct 等一些模型价格大幅上涨,…