PulseAugur
实时 17:15:15
实体 Gemma 4-31B-it

Gemma 4-31B-it

PulseAugur coverage of Gemma 4-31B-it — every cluster mentioning Gemma 4-31B-it across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 17
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 9
层级分布 · 90 天
主题
关系
时间线
  1. 2026-07-13 product_launch Google Cloud has released the Gemma 4 31B IT model, offering options and guidance for self-hosting. 来源
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_224105 ·

    SambaNova 在没有 API 密钥的情况下提供模型列表,并披露了具有 100 万个 token 的上下文模型

    与 Groq、Together、DeepSeek 和 Cerebras 等许多其他推理提供商不同,SambaNova 用于列出可用模型的 API 不需要身份验证。这种开放访问允许用户在无需账户或 API 密钥的情况下查看模型列表,目前共有七个模型。值得注意的是,MiniMax-M3 模型拥有超过一百万个 token 的上下文窗口,而 DeepSeek-V3.2 模型的上下文窗口小于其前身 DeepSeek-V3.1。

  2. TOOL · CL_203910 ·

    新协议衡量AI消息的“轨迹价值”,超越答案正确性

    研究人员开发了一种名为“多样化假设审议”(DHD)的新协议,用于评估多智能体推理系统中消息的价值,即使这些消息包含不正确的答案。DHD协议通过评估消息的包含是否帮助或损害了后续推理,独立于其最终答案的正确性来衡量消息的“轨迹价值”。使用GPT-OSS 120B和Gemma 4-31B-it模型在各种基准测试上的实验表明,“错误但有用”的消息很常见,并且可以显著地积极影响下游推理。研究结果表明,仅关注答案的正确性是不够的,DHD提供了一…

  3. TOOL · CL_189982 ·

    Gemma 4 31B "scotoma-2" 模型减少AI写作的怪癖

    一款新AI模型 Gemma 4 31B "scotoma-2" 被开发出来,旨在解决AI生成文本中常见的“写作怪癖”,例如过度使用形容词或重复措辞。该模型基于Google的Gemma 4 31B,通过三轮直接偏好优化(Direct Preference Optimization)过程,使用超过9300对数据进行微调,以减少这些风格上的怪癖。尽管进行了修改,scotoma-2并非不受限制,并保持负责任的AI安全功能,专注于通过降低可预测…

  4. TOOL · CL_165026 ·

    Gemma 4 31B-IT模型在核执照考试中达到操作员级别性能

    一项新研究对310亿参数的多模态语言模型Gemma 4 31B-IT在美国核管会(NRC)反应堆操作员执照考试上的表现进行了基准测试。研究评估了八种不同的模型检索配置,发现结合了监督微调和使用固定大小分块策略的检索增强生成方法,在14项考试中的8项达到了人类通过标准。该方法实现了79.7%的总准确率,表明特定的微调和检索方法可以使大型语言模型在该领域达到操作员级别的能力。

  5. RESEARCH · CL_158004 ·

    新的 K-12 知识图谱基准测试 LLM 课程认知能力

    研究人员开发了 K12-KGraph,这是一个源自中国 K-12 教科书的知识图谱,旨在对教育类 LLM 的课程认知能力进行基准测试和训练。该图谱包含九种节点类型和十四种关系类型,并被用于创建 K12-Bench(一个包含 23,640 个问题的基准测试集)和 K12-Train(一个包含 7,335 个样本的监督微调语料库)。初步测试表明,Gemini-3-Flash 和 Gemma-4-31B-IT 等模型在课程理解方面存在困难,…

  6. TOOL · CL_154590 ·

    WeedExpert-R1 大语言模型通过植物学推理推进精准农业

    研究人员开发了 WeedExpert-R1,这是一种新颖的多模态大语言模型(MLLM),专为农业中的精准杂草识别和定位而设计。该模型利用强化学习和思维链合成管道来改进植物学推理,并克服传统闭集词汇目标检测器的局限性。在对 37 种杂草进行的评估中,WeedExpert-R1-4B 的性能优于 GPT-5.4 和 Gemini-3.1 Pro 等专有模型,实现了高精度和召回率,同时展示了开放词汇能力,可实现更广泛的部署。

  7. RESEARCH · CL_151305 ·

    新的 ASCIITermDraw Bench 测试视觉语言模型生成 ASCII 图的能力

    引入了一个名为 ASCIITermDraw Bench 的新基准,用于评估视觉语言模型(VLMs)在生成和编辑 ASCII 图方面的能力。与侧重于编码或推理的基准不同,ASCIITermDraw-Bench 评估模型仅使用纯文本创建准确图表的能力,这与仅仅描述它们是不同的挑战。该基准包含四个类别的 80 个任务,包括基本布局、网络拓扑、软件架构和图像条件编辑,结果在结构和语义上进行评分。目前的排行榜结果显示 Gemma-4-31B-I…

  8. SIGNIFICANT · CL_140048 ·

    Google Cloud 发布 Gemma 4 31B IT 以供自托管

    Google Cloud 已发布 Gemma 4 31B IT,这是一款专为自托管设计的新型大型语言模型。该模型面向希望在其自有基础设施内部署 AI 功能的开发者和组织。此次发布包括有关自托管模型潜在挑战和最佳实践的指南。

  9. TOOL · CL_164802 ·

    Fireworks AI 按用例对 2026 年顶级开源 LLM 进行排名

    Fireworks AI 评估了 2026 年 4 月至 7 月期间发布的几款开源 LLM,并强调最佳选择取决于具体的用例,例如推理、编码、多模态、上下文窗口大小和许可。Kimi K3 在 AI 和编码基准测试中处于领先地位,但其权重和许可尚未发布。GLM 5.2 被认为是目前在 Fireworks 上可用的模型中的顶级性能模型,而其他模型则根据不同的约束(如模态支持、上下文长度和服务成本)保持竞争力。

  10. TOOL · CL_120599 ·

    2026年6月迎来一系列新的开源AI模型和量化方法

    2026年6月,开源AI模型领域迎来众多更新,重点是新的微调和量化方法。发布了几个新的微调模型,包括Nex-N2、Ornith-1.0、Agents-A1、Holo3.1、Tmax-27b、MusaCoder-27B和VibeThinker-3B。此外,NVIDIA为NVIDIA-Nemotron-3-Ultra-550B-A55B和Qwen3.6-27B等模型引入了NVFP4量化,而AMD则为Kimi-K2.7-Code和GLM-5…

  11. RESEARCH · CL_117346 ·

    研究发现大型语言模型展现零样本视觉创造力评分能力

    一项新的研究论文探讨了多模态大型语言模型(LLMs)在没有预先训练的情况下评估视觉创造力的能力。该研究测试了包括Gemini 3 Flash、Gemma 4-31B-it和GPT-5.4 Mini在内的六个大型语言模型,对AI生成的图像和人类素描进行了评估。结果表明,这些模型能够与人类的创造力评分保持一致,相关性范围从.29到.68。虽然大型语言模型的逐步推理过程提供了对其评估标准的解释性,例如平衡原创性和质量,但这种推理并未增强其与…

  12. TOOL · CL_113874 ·

    量化影响多令牌预测中的LLM草稿率

    Reddit的r/LocalLLaMA论坛上的一位用户研究了模型量化如何影响大型语言模型多令牌预测(MTP)中的草稿率。测试使用了Gemma 4-31B-it作为主模型,并进行了各种量化级别(从Q5_K_S到IQ2_M)的测试,同时使用Gemma 4-31B-it-assistant作为MTP草稿器。结果显示,随着草稿深度的增加,所有量化级别下的接受率都会降低,而较低比特率的模型与草稿器的_一致性_略有下降。

  13. TOOL · CL_68319 ·

    新框架发现并修复AI逻辑数据集中的错误

    研究人员在流行的自然语言到一阶逻辑(NL-to-FOL)数据集中发现了显著的不准确之处,其中FOLIO和MALLS分别显示约39%和36%的公式化错误。这些错误扭曲了模型评估,当使用Gemma 4、Qwen3和GPT-4o-mini等模型的修正后真实值时,准确率提高了高达22个百分点。为解决此问题,提出了一种新的LLM辅助框架,该框架通过审查不到24%的实例即可达到90%的数据集准确率,远优于无指导审查。

  14. TOOL · CL_55600 ·

    Gemma-4-Harmonia-31B-Uncensored-Heretic模型发布

    一款新的微调模型Gemma-4-Harmonia-31B-Uncensored-Heretic已发布。该模型是多个Gemma-4-31B-it微调模型的合并,旨在实现深度神经巩固,最大限度地减少回归并放大独特的能力。它提供Safetensors和GGUF格式,并附带了基准测试结果。

  15. TOOL · CL_53683 ·

    LLM和RAG增强SDN中的DDoS攻击检测

    研究人员开发了一个新的框架,使用检索增强生成(RAG)和大型语言模型(LLM)来检测和缓解软件定义网络(SDN)中的地毯式轰炸DDoS攻击。该方法利用流量特征、语义嵌入和LLM推理进行实时分类,无需传统的监督训练。实验显示出高准确性和稳定性,其中Gemma-4-31B-IT模型配置产生了最佳的检测结果,证明了该集成对于自适应SDN安全性的有效性。

  16. TOOL · CL_26456 ·

    开发者使用AI和GitHub Actions自动化新闻来源摄入

    一位开发者结合使用AI工具和GitHub Actions,自动化了向数据库添加新新闻来源的过程。该工作流程首先使用Firecrawl抓取顶级新闻网站列表,然后通过OpenRouter访问三个免费层级的LLM,从抓取的数据中提取干净的URL。最后,它为这些来源生成YAML文件,并自动创建一个拉取请求来更新实时仪表板。

  17. TOOL · CL_27584 ·

    新的K-12知识图谱基准测试大型语言模型课程认知

    研究人员开发了K12-KGraph,一个新颖的知识图谱,旨在专门评估和训练K-12教育领域的大型语言模型(LLMs)。该图谱源自官方教材,捕捉了课程结构,包括先决条件和概念关系,超越了简单的事实回忆。为了支持这一点,他们创建了K12-Bench(一个包含23,640个问题的基准测试集)和K12-Train(一个微调数据集)。实验表明,当前的大型语言模型在课程认知方面存在困难,而K12-Train数据集在教育基准测试上显著提高了性能,且样本效率高。