gemma3:12b
PulseAugur coverage of gemma3:12b — every cluster mentioning gemma3:12b across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Persona塑造LLM Agent在策略游戏中的行为
研究人员调查了Persona提示如何影响大型语言模型Agent在“分还是偷”游戏中的策略行为。他们使用了四种开源模型(Ministral-3-3B、phi4:14b、Gemma3:12b和Gemma4:e4b)与一个由GPT-4.1 mini驱动的虚拟人类进行交互,发现相互“分”的结果占主导地位,约占回合数的74%。模型选择显著影响了Agent的行为,phi4和Ministral-3-3B始终表现出合作性,而Gemma模型则展现出更多…
-
开源语言模型在隐私保护的临床决策制定评估方面展现出潜力
一项新研究 LLM4SDM 调查了使用开源小型语言模型 (OS-sLLMs) 来评估临床咨询中的共同决策制定 (SDM)。与以往使用大型商业模型的研究不同,本研究侧重于隐私保护、本地部署的模型以及荷兰黑色素瘤咨询记录。研究结果表明,通用 OS-sLLMs 的表现优于医学领域模型,其中 Gemma3:12b 与人类标注者的一致性最强。虽然目前的 OS-sLLMs 尚不能取代人类标注者,但它们为隐私保护、以人为中心的 SDM 评估奠定了可行基础。
-
研究发现:大型语言模型无法复制人类心理意象结构
一篇新发表在arXiv上的研究表明,大型语言模型(LLMs)无法复制在人类群体中发现的心理意象的关系结构。研究人员分析了来自不同人类样本和多个LLMs的生动性评分,构建了心理网络来比较节点中心性和社区结构。虽然人类网络在不同人群中表现出一致的模式,但LLMs却持续产生退化的、单聚类的拓扑结构,这表明仅通过语言训练无法复制影响人类记忆组织的具身经验。
-
量化下AI模型质量指标无法作为安全代理
一项新的研究论文挑战了在量化AI模型中使用质量指标作为安全代理的普遍做法。研究发现,在安全指标(如拒绝率)显著下降的同时,质量可能保持稳定甚至提高。这表明在直接进行安全测试之前,仅依赖质量评估是一个不可靠的捷径。研究结果表明,即使量化模型的质量表现良好,直接的安全评估也是至关重要的。
-
AI 代理后台任务消耗 6.03 亿 token;开发者实施路由
一位 AI 开发者发现,由于后台任务静默运行,他们的 Hermes Agent 在七天内消耗了大量 token,总计 6.03 亿个。问题追溯到 kimi-k2.6 模型。开发者实施了显式路由来优化 token 使用,将不同任务分配给更轻量级或更合适的模型,如 rnj-1:8b、gemma3:12b、deepseek-v4-flash 和 kimi-k2.5,从而将成本降低了高达 125 倍。
-
新的GRADE框架评估AI助教的教学能力
一篇新研究论文介绍了一个名为GRADE的框架,用于评估AI助教的教学能力。该研究系统地评估了五种语言模型的120种配置,探索了零样本推理、LoRA微调和CoT+推理等方法。Gemma3-12B在单任务评估中表现出色,而Gemma3-27B在多任务预测中更可靠。研究还指出,虽然数据增强可以帮助表现不佳的模型,但LoRA微调可能会阻碍某些模式下的指令遵循,并且碳排放量因模型选择和推理方法而异。