Gemma 2-2B
PulseAugur coverage of Gemma 2-2B — every cluster mentioning Gemma 2-2B across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新研究探索Transformer层中语法的几何结构
一篇新研究论文探讨了Transformer模型中语言表示的几何特性。该研究调查了这些表示的内在维度(ID)如何在不同层之间变化,以及这与词元的语法角色之间的关系。研究人员发现,不同类型的词(开放类词与封闭类词)表现出不同的ID扩展和收缩模式,并且仅凭几何特征就可以预测词元的语法角色。
-
针对疟疾药物发现微调的大型语言模型性能优于专有模型
一项新研究推出了 Malaria-Instruct,这是一个用于利用大型语言模型(LLM)进行疟疾药物发现的数据集。该研究评估了几种开源LLM,发现经过微调的模型在虚拟筛选抗疟化合物方面,其性能显著优于经典的机器学习方法,甚至优于未经微调的专有模型,如Gemini 2.5和OpenAI o3。特定领域的微调对于性能至关重要,其中TxGemma-9B和LlaSMol-Mistral-7B等模型表现最佳。
-
大型语言模型在冲突任务中表现出与人类认知相似的一致性效应
研究人员开发了一种新颖的言语冲突任务,用于研究大型语言模型中的一致性效应,并与心理学和神经科学研究进行类比。该任务涉及引发默认完成的提示,其中明确的规则要么同意,要么与此默认规则相冲突。对 Gemma-2-2B 和各种 Pythia 版本的模型分析显示出强烈的默认倾向和显著的一致性效应,这归因于权重内默认映射与上下文内基于规则的映射之间的竞争。该研究利用了因果归因、注意力分析和消融来识别由表面线索或明确规则激活的不同处理路径。
-
新方法使用Koopman算子进行模型可解释性分析
研究人员开发了一种名为“内在结构”的机制可解释性新方法,该方法利用Koopman算子分析模型内部动力学的谱特性。这种方法旨在区分模型固有的特征和可解释性方法产生的伪影。该研究为机制可解释性原语提供了第一个识别定理,证明了可以从校准样本中恢复模型的频谱,且误差率可预测。在GPT-2 small、Gemma 2-2B和Qwen3-8B-Base上的实验表明,频谱会收敛,并且在Qwen3-8B-Base上实现了预测的误差指数,这表明Koop…
-
HyperSAE 使用庞加莱几何来提升稀疏自编码器性能
一个名为 HyperSAE 的新 PyTorch 库已被开发出来,通过采用庞加莱双曲几何来提高稀疏自编码器 (SAE) 的效率。这种方法解决了标准 SAE 的局限性,标准 SAE 使用欧几里得空间,并且可能遭受特征冲突和死隐变量的问题,尤其是在字典大小很大的情况下。HyperSAE 在训练期间将字典权重投影到庞加莱球中,对概念进行分层组织,以减少重建误差和死隐变量。在 Gemma-2-2B 上的基准测试显示,平均平方误差降低了 9.8…
-
新的LLM微调方法旨在实现性能与碳排放的盈亏平衡
研究人员开发了一种新的微调方法,该方法包含一个可微分的能量代理模型,用于优化大型语言模型(LLM)的性能和碳排放。该方法旨在在推理过程中以最小或零碳成本实现任务准确性,而推理是LLM整体碳足迹的主要贡献者。在Gemma-2 2B、Llama-3.1 8B和Qwen-2.5 14B模型上针对特定MMLU科目进行的实验表明,碳感知微调充当了任务相关的正则化器,其有效性因任务结构而异。
-
新的分块SVD方法直接从权重中提取网络机制
研究人员开发了一种名为列分块SVD的新方法,可以直接从神经网络中的线性位提取可用的权重机制。该方法识别网络权重本身的概念,而不是依赖外部代理词典。该方法在Gemma-2-2B上使用WikiText-2进行了评估,在所有测试的线性映射中均获得满分182/182,其中特定的映射在残差写入方面显示出完整的A/B/C评分。
-
新的训练方法通过减少信号损失来增强 LLM 的可解释性
研究人员开发了一种名为“替换感知训练”的新方法,以提高大型语言模型的可解释性。该技术训练稀疏自编码器 (SAE),使其能够抵抗上层引入的错误,而之前的方法则依赖“错误节点”来补偿信号损失。当应用于 Gemma-2-2B 时,这种方法产生了一个保留了语言能力并在 MMLU 等基准测试中表现更好的替换模型,而标准的 SAE 通常会使模型不连贯。
-
Gemma 2-2B研究发现主动特征平面具有更少全纯性
一篇新发表在arXiv上的研究论文调查了Gemma 2-2B模型特定特征平面的全纯性集中情况。该研究在检查数据之前预先注册了其方法论和分析规则。与主动特征平面会表现出更多全纯性的预测相反,结果显示情况恰恰相反,主动平面携带的全纯性少于对照组。该论文总结认为,这是一个可审计的操作性反转,而非确定的因果声明,其根本原因仍有待进一步研究。
-
新“prolepsis”现象在小型 Transformer 模型中被识别
研究人员在小型 Transformer 模型中识别出一种称为“prolepsis”的现象,即模型在处理早期就做出决定,且无法纠正。这种承诺由特定任务的注意力头维持,并且不易被标准的残差流方法检测到,尽管基于 CLT 的引导显示出一些成功。研究发现,这种 prolepsis 模式出现在 Gemma 2-2B 和 Llama 3.2 1B 等仅解码器模型中的不同任务上,表明存在一个共享的潜在机制。
-
Google 的 Gemma 2 模型通过高效架构实现高性能
Google 的新款 Gemma 2 模型,特别是 27B 参数版本,正通过架构创新而非仅仅增加模型大小来展示显著的性能提升。这些模型采用了混合注意力机制,结合了局部滑动窗口注意力和全局注意力,以提高效率和上下文感知能力。此外,分组查询注意力 (GQA) 和小型模型中的知识蒸馏等技术也为其增强的性能和开发者可访问性做出了贡献。
-
新研究确定了缓解人工智能模型错位的可操作方向
研究人员通过分析激活方向,发现了一种检测和缓解语言模型中新出现的错位的方法。该方法在包括 Qwen2.5-1.5B、Gemma-2-2B、Llama-3.2-1B 和 Ministral-3-3B 在内的四个模型系列上进行了测试,发现了一个共享的激活方向,可以有效地区分对齐和错位的行为。虽然模型内部方向被证明在因果上具有特异性,并且对于纠正代码泄露等问题是可操作的,但跨模型方向虽然真实存在,但缺乏特异性,表明在直接架构迁移以进行缓解方…
-
新方法通过处理稠密激活来提高神经网络的可解释性
研究人员提出了一种新方法来提高神经网络的可解释性,他们质疑了所有激活内容都可以稀疏分解的假设。他们假设激活包含一个计算上重要的、低秩的、稠密成分,不适合稀疏表示。为了解决这个问题,他们在标准稀疏自编码器(SAE)旁边引入了一个小的线性瓶颈,允许在稀疏重建之前吸收稠密结构。这种方法在 Gemma-2-2B 第 12 层上,显著减少了稠密潜在计数,同时提高了稀疏探测和目标探测扰动。
-
专业化AI裁判未能降低审计成本,帮助有限
一位研究人员探索使用轻量级、专业化的裁判模型(Gemma 2-2B)来协助AI代理在审计中识别不一致性。虽然代理模型一致使用该裁判模型,但仅在训练数据直接匹配不一致性类型且主要审计模型(Sonnet)已遇到困难的特定场景下才证明有帮助。该实验并未降低整体评估成本,因为主要驱动模型占了绝大多数费用,并且强制工具使用甚至增加了成本。
-
Transformer残差流展现时间几何性,集中上下文
研究人员发现,Transformer中的残差流(常被比作工作记忆)展现出与时间相关的独特几何性。通过分析Gemma-2-2B模型,他们发现跨越许多token的持久信息集中在一个低维子空间中,而不是弥散的。这些持久信息对序列顺序高度敏感,因为打乱token会急剧降低这些慢方向的时间尺度。
-
LLM漏洞检测依赖安全模式,而非直接签名
研究人员采用机械可解释性来分析大型语言模型(LLM)如何检测软件漏洞,重点关注Gemma-2-2b模型。他们的研究表明,该模型主要通过特定的注意力头识别安全的编码模式来识别易受攻击的代码,而不是直接检测漏洞签名。这种电路级分析确定了关键的神经组件,包括早期层的注意力头和第7层的MLP神经元,这些组件对模型的安全预测至关重要。消融实验证明了这些组件的因果影响,表明移除它们会显著降低检测准确性,突显了LLM漏洞检测电路的稀疏性和可解释性。
-
决策树增强大型语言模型在分子性质预测方面的能力
研究人员开发了一种名为TreeKD的新方法,以提高大型语言模型(LLMs)在分子性质预测任务中的准确性,这项任务在药物发现中至关重要。TreeKD通过将从基于分子特征训练的专业决策树中提取的知识,通过口头提示蒸馏到LLMs中。这种方法增强了LLMs的内部知识和预测能力。该方法还采用了一种称为规则一致性的技术,用于在测试时聚合预测,进一步提高性能。
-
AI模型可解释地检测多囊卵巢综合征和饮食失调
研究人员开发了开源语言模型,用于检测社交媒体帖子中多囊卵巢综合征(PCOS)、身体意象困扰和饮食失调的三重负担。使用1000个与PCOS相关的帖子数据集,对三个模型(Gemma-2-2B、Qwen3-1.7B和DeepSeek-R1-Distill-Qwen-1.5B)进行了低秩适应(Low-Rank Adaptation)微调,以提供解释和文本证据。表现最佳的模型在独立测试集上达到了75.3%的准确率,展示了强大的合并症检测和可解释…
-
新的FiPS框架以最小的精度损失压缩Transformer模型
研究人员开发了一个名为细粒度参数共享(FiPS)的新框架,用于压缩大型Transformer模型。FiPS在一个单一的优化过程中结合了跨块参数共享、低秩分解和稀疏性。该方法有效地减小了Vision Transformers(ViTs)和大型语言模型(LLMs)的尺寸,同时精度或性能损失极小,优于现有的压缩技术。
-
新协议检测 LLM 提供商的模型替换
一篇新的研究论文提出了一个提交-开放协议,用于检测托管大型语言模型提供商何时用更便宜的模型替换广告中的模型。该协议使用 Merkle 树来提交模型输出的稀疏自编码器 (SAE) 特征追踪,允许验证者检测此类替换。在 Qwen3-1.7B、Gemma-2-2B 和规模更大的 Gemma-2-9B 上的实验证明了该协议在拒绝各种替换攻击方面的有效性,其性能优于 SVIP 等现有方法。