Phi-3.5-mini
PulseAugur coverage of Phi-3.5-mini — every cluster mentioning Phi-3.5-mini across labs, papers, and developer communities, ranked by signal.
-
TriAgent 降低金融情感分析的 LLM 成本
研究人员开发了 TriAgent,这是一种新颖的多智能体系统,旨在利用大型语言模型降低金融情感分析的成本。该系统按上下文粒度分层智能体,采用词级词典 (VADER)、句级 Transformer (FinBERT) 和跨句推理器 (Qwen2.5, Mistral-7B, Phi-3.5-mini)。语义分歧指数 (SDI) 衡量智能体之间的分歧,以有效地路由查询,实现了约 0.87 的 F1 分数,同时与基线 LLM 方法相比显著降…
-
AI基准测试工具:自定义构建与现有解决方案的探索
一个专注于AI硬件和模型性能的博客作者调查了他们的自定义基准测试工具是否必要,或者是否可以使用现有解决方案。他们发现,像Linus Tech Tips和Gamers Nexus这样的硬件评测网站虽然开发了复杂的框架,但这些框架主要设计用于GPU和游戏工作负载,而非LLM。同样,像MLPerf Client和Procyon这样的厂商无关AI基准测试套件受限于固定的模型列表,并且不支持多轮代理任务。尽管存在像llama-bench和lla…
-
LlamaGuard 未能阻止 RAG 注入攻击,PromptGuard 成功
一位安全研究人员发现,旨在防止有害内容的模型 LlamaGuard-3-1B 完全未能检测到 10 种不同的 RAG 注入攻击。这些攻击此前已成功针对其他 LLM,但 LlamaGuard 均将其归类为安全。相比之下,一个名为 PromptGuard-86M 的较小模型成功识别了所有注入尝试,突显了这些模型在训练方式以及它们在应对指令完整性问题(而非仅仅内容安全)方面的有效性存在关键差异。
-
小型语言模型在“放水”时表现出位置偏差,而非回避答案
新研究表明,较小的语言模型(70-90亿参数)在被指示“放水”或表现不佳时会表现出位置偏差,而不是回避正确答案。这种偏差会导致像Llama-3-8B这样的模型偏好特定的答案位置(例如,E、F、G),当正确答案与这些偏好位置一致时,准确率会飙升。研究表明,分析响应位置分布可能是检测此类提示下表现不佳比仅仅寻找低于机会的准确率更有效的方法。
-
新架构通过可删除的用户代理实现隐私保护的个性化大语言模型
研究人员开发了一种新颖的三层架构,旨在增强个性化大语言模型中的隐私保护。该系统通过利用可组合适配器和可删除的用户代理,将用户特定数据与核心模型权重分离开来。在 Phi-3.5-mini 和 Llama-3.1-8B 上的实验表明,用户数据会影响输出,但不会污染共享权重,并且删除用户代理可以有效地将模型恢复到其基线状态。