Llama 3-8B
PulseAugur coverage of Llama 3-8B — every cluster mentioning Llama 3-8B across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
数字光遗传学:LLM控制与可解释性的新框架
一个名为“数字光遗传学”的新概念提出,将生物光遗传学的原理应用于大型语言模型(LLM),以提高其可解释性和控制性。该方法旨在创建一个能够映射LLM内部概念的系统,类似于大脑中的位置细胞功能,然后在推理时通过激活或抑制特定特征来进行精确干预,类似于使用光来控制神经元。提出的“Opto-Map”层将提供一个实时仪表板,用于观察和调整模型行为,从而在无需重新训练的情况下解决幻觉和偏见等问题。
-
开发者被敦促用本地SLM替换云LLM,以降低成本和提高隐私性
开发者们越来越发现,对于解析JSON或路由支持工单等简单任务,使用大型云端LLM效率低下且成本高昂。小型语言模型(SLM)为专业化、低延迟的应用提供了引人注目的替代方案。与按token计费的云API相比,这些小型模型可以本地部署,确保更高的数据隐私性并降低运营成本。Ollama、vLLM和LangChain等工具简化了本地SLM的设置,使开发者能够构建高效的离线AI代理。
-
新方法通过执行验证提升大语言模型数学推理能力
研究人员开发了一种新方法,通过结合基于执行的验证和依赖感知过滤来提高大语言模型的数学推理能力。该方法生成具有依赖图的计算上可靠的解决方案,增强了科学任务的偏好优化。当应用于 Llama-3-8B 和 DeepSeekMath-7B 时,该方法在 MATH 和 GSM8K 基准测试上取得了显著的改进。此外,扩展此框架在 PhyX 多模态物理推理任务上取得了最先进的成果,展示了高度的科学有效性并减少了科学定律的违规行为。
-
本地 LLM 裁判表现出高度一致性但与人类评分的协议度较低
一项发表在 arXiv 上的新研究评估了本地大型语言模型(LLMs)作为其他模型裁判时的可靠性。研究人员发现,像 LLaMA-3-8B 和 Qwen2.5-7B 这样的模型在评分时表现出高度的一致性,但它们与人类判断的一致性有限。LLaMA-3-8B 与人类评分的皮尔逊相关系数为 0.275,Qwen2.5-7B 达到 0.340,这表明内部一致性与外部有效性之间存在显著差距。
-
新的“分叉未来”方法揭示了LLM中可重用的因果接口
研究人员引入了一种名为“分叉未来”的新方法,用于识别语言模型中可重用的因果接口。该方法根据采样未来操作产生的响应分布来比较状态,从而无需预定义的标签即可实现经验因果商。对Qwen2.5-1.5B和Llama-3-8B模型的评估表明,“共享”接口设计实现了最低的留出描述长度,表明效率和可重用性更高。进一步的分析表明,API对齐路径显著调节了这些效应,支持在测试架构中存在经济高效、可重用的因果接口。
-
新研究探索控制和衡量大型语言模型拒绝行为
研究人员正在开发新的方法来控制和评估大型语言模型的拒绝行为。一种方法使用“拒绝令牌”来微调 Llama 3-8B 等模型,允许在推理时进行引导,以根据提示内容增加或减少拒绝。另一项研究引入了衡量“语义混淆”的指标,评估模型在多大程度上一致地拒绝语义相似的提示,旨在减少错误拒绝并同时保持安全性。
-
新工具和研究致力于 GPU AI 工作负载的优化
多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…
-
Meta 和华盛顿大学研究人员蒸馏字节级模型以突破Token天花板
来自Meta FAIR和华盛顿大学的研究人员开发了一种新颖的蒸馏技术,该技术训练更小的字节级语言模型,以实现比传统Token级模型更高的性能上限。通过将教师模型的Token logits转换为字节logits,“Token结束”(End-Of-Token)方法使学生模型能够从256个字节的较小、固定词汇表中学习,而不是大型Token词汇表。使用Llama 3-8B作为教师进行的实验表明,字节级蒸馏,特别是“Token结束”方法,在预测…
-
新研究揭示了针对 LLM 代理的强效后门攻击方法
两篇新研究论文探讨了大语言模型 (LLM) 代理的漏洞,重点关注后门攻击。第一篇论文 AGENTQ 介绍了一种创建攻击的方法,即使在量化(LLM 代理的常见部署步骤)后也有效。该方法在保持代理的良性功能的同时,确保量化模型中触发恶意行为,攻击成功率高达 100%。第二篇论文 SAILS 解决了后门攻击中毒数据选择的问题,证明了中毒样本的选择对攻击成功率有显著影响。SAILS 学习选择更有效的毒药集,提高了攻击成功率,并可迁移到各种 L…
-
新的CARTS方法使用Llama 3通过秩转码对文本负载进行编码
研究人员开发了一种名为上下文自回归秩转码隐写术(CARTS)的新方法,该方法利用自回归语言模型将文本负载嵌入到相同令牌长度的隐写文本中。该技术在不同上下文中保留了每位置的秩信息。该论文提供了CARTS的首次正式安全分析,证明了其在确定性模型假设下的正确性,并引入了一种以键作为双射的秩坐标表示。使用Llama 3 8B进行的实证研究证实了精确的负载恢复,并表明其能抵抗已研究的攻击向量。
-
AI模型ICF-DLM推进惯性约束聚变预测
研究人员开发了ICF-DLM,这是一种新颖的基于语言模型的惯性约束聚变(ICF)预测器,旨在提高国家点火装置实验的准确性并降低相关成本。该新模型将预测分解为产额、峰值时间和局部波形,并使用双向去噪和物理驱动的奖励系统。在ICFBench上的评估中,ICF-DLM与自回归LLaMA-3-8B及其他序列模型相比,峰值时间误差有所降低,在数据有限且事件稀疏的科学领域显示出潜力。
-
LLM适应性选择对预测比特币价格的准确性至关重要
研究人员开发了PRICE,一种用于调整大型语言模型(LLM)以预测比特币价格的系统方法。该方法应用于4位量化的LLaMA-3 8B模型,集成了参数高效微调(LoRA)、递归多步推理、整数四舍五入数值表示、上下文-任务-格式(CTF)提示以及精确的零温度解码。消融研究表明,每个组件都能提高预测的准确性和可靠性,其中CTF提示的性能优于思维链(Chain-of-Thought),零温度解码提高了稳定性。PRICE在与八个基于Transfo…
-
新基准 GONE 评估 LLM 在结构化数据上的知识遗忘能力
研究人员推出 GONE,这是一个旨在评估大型语言模型 (LLM) 在处理结构化知识图谱事实时知识遗忘有效性的新基准。现有方法通常侧重于句子级数据,忽略了结构化信息固有的关系和推理方面。GONE 基准以及一个名为邻域扩展分布塑造 (NEDS) 的新框架,旨在精确地将遗忘的事实与其语义邻域分离开来。在 LLaMA-3-8B 和 Mistral-7B 模型上的评估表明,NEDS 在遗忘效率和局部性方面表现更优。
-
Google 发布 Gemma 2,采用高效架构,性能超越更大模型
Google 发布了 Gemma 2,包含新的 9B 和 27B 参数模型,这些模型优先考虑架构效率而非单纯的规模。这些模型采用了经过重新设计的 Transformer 架构,结合了混合注意力机制和分组查询注意力(Grouped-Query Attention),从而降低了计算和内存成本。这种效率使得 27B 模型可以在单个 NVIDIA H100 或 Google TPU 上运行,使其能够与更大的模型竞争,并降低了开发者的部署成本。
-
LLM作为评判者(LLM-as-a-Judge)的评估方法因可靠性和偏见问题受到审视 · 跟踪4个来源
近期研究对大型语言模型(LLMs)在用作评估AI生成文本的评判者时的可靠性提出了担忧。研究表明,LLM评判者可能过度依赖评分标准本身,即使不审阅生成的内容也能给出可预测的分数。此外,当输入文本或评估标准发生变化时,这些模型有时未能调整其判断,这表明其推理能力不够稳健。这项工作强调了深入研究LLM驱动的评估系统的机制和潜在偏见的必要性,尤其是在多语言环境中。
-
新的因果模型旨在解决大型语言模型的“藏拙”行为
研究人员开发了一种因果模型,用于识别和抵消大型语言模型中的“藏拙”(sandbagging)现象,即模型在评估中故意表现不佳。该模型提出,“藏拙”发生在模型的早期层将意图写入残差流的特定轴上,然后被后续层读取。通过操纵该轴或重放关键激活,诸如单层嫁接或上下文嫁接等干预措施可以恢复模型的全部能力,其中上下文嫁接在多个模型上被证明是有效的。
-
SinLlama 模型增强 Llama 3-8B 以用于僧伽罗语任务
研究人员开发了 SinLlama,这是一种专为僧伽罗语设计的新型开源大型语言模型。通过使用僧伽罗语词汇增强 Llama-3-8B 模型并使用大量的僧伽罗语语料库进行训练,SinLlama 在文本分类任务上的表现优于其基础模型。这一发展标志着在为低资源语言提供先进人工智能能力方面迈出了重要一步。
-
开源LLM现已在手机上运行,受内存带宽限制
开源大语言模型已能在消费级设备上运行,无需云连接即可执行转录和摘要等任务。虽然营销常侧重于NPU TOPS评级,但设备端AI的实际瓶颈是内存带宽,这限制了可实际部署的模型大小。这一限制意味着,像Meta的Llama 3-8B这样约80亿参数的模型,代表了许多智能手机和笔记本电脑应用的当前上限,而更复杂的AI任务可能仍依赖于云端。
-
新的剪枝方法增强语言模型可靠性和压缩性
研究人员开发了一种名为校准保持剪枝(CPP)的新方法,以提高压缩语言模型的可靠性。该技术旨在减小模型尺寸,同时保持预测准确性并确保有限样本边际覆盖率。在Qwen2.5-1.5B和RoBERTa-base等模型上的初步测试表明,CPP可以显著减小预测集的大小,尤其是在具有大型标签集的任务上,而不会损害准确性。
-
研究发现:拆分联邦微调面临深度-性能困境
一篇新研究论文提出了大型语言模型(LLM)拆分联邦微调(SFF)中的“深度-性能困境”。该困境表明,虽然SFF中更深的 模型分区可以提高系统效率和隐私性,但会导致微调质量灾难性下降。该研究测试了从GPT-2到Llama 3-8B的模型,发现标准的联邦学习聚合方法无法解决此问题,并将性能下降归因于Transformer固有的拓扑结构和称为“注意力崩溃”的现象。