Llama 3.1 70B
PulseAugur coverage of Llama 3.1 70B — every cluster mentioning Llama 3.1 70B across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
大型语言模型中发现新的“桥接路由头”用于多语言推理
研究人员在大型多语言大型语言模型中识别出“桥接路由头”(BRHs),揭示了这些模型如何处理跨不同语言的多跳推理。研究发现,BRHs在很大程度上是语言特定的,在Llama 3.1 70B和Qwen 2.5-72B等模型中,英语、西班牙语、法语、德语和中文等语言的电路之间几乎没有重叠。消除这些头会显著降低推理性能,而在失败的实例中放大它们可以在不重新训练的情况下将准确性提高多达51.7%,证明了激活级别干预纠正跨语言推理错误的潜力。
-
新方法提升LLM推测解码速度和安全性 · 跟踪7个来源
多篇研究论文和一篇博客文章探讨了大型语言模型推测解码的进展,旨在加速文本生成。DLoop、SecureSD、SpecFold、Nucleus Speculative Decoding (NSD) 和 AgSpec 等技术引入了新颖的方法来提高效率和安全性。这些方法侧重于优化验证过程、处理多分支冗余以及调整草稿长度,其中一些方法在保持或增强模型性能和安全性的同时实现了显著的加速。
-
新工具可确定性地评估LLM基准,标记模型可复现性问题
一款名为Crucible的新工具已被开发出来,用于解决当前大型语言模型(LLM)基准测试的缺陷。Crucible不依赖其他模型来评判性能,而是使用确定性的评分系统,进行正则表达式和JSON路径等精确比较。这种方法旨在提供可复现的结果,并识别出区分度不足以区分不同模型的任务。该工具还突出了专有模型存在的问题,指出当由于无法公开访问特定模型版本而无法重现运行结果时的情况。
-
新的QK-Wanda方法通过耦合查询和键来改进LLM剪枝
研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。
-
LLM 的注意力机制在新颖的语境和不同模型中表现出独特的行为 · 跟踪 3 个来源
研究人员正在探索大型语言模型(LLM)的内部机制,特别是注意力函数,如何影响它们在新颖语境下的行为。一项研究提出了一种“函数混合注意力”(MoFA),该模型为 softmax 和 sigmoid 头分配固定的比例,发现这种比例对分布内任务的影响很小,但对分布外性能有显著影响,并根据比例区分文本类型。另一篇论文回顾了 LLM 中注意力机制的演变,通过记忆表示、更新、访问、读出和整合等视角分析了上下文记忆的发展,强调了深度和异构架构如何协…
-
研究发现,训练后的大语言模型更有趣但多样性降低
一项研究调查了训练后是否能增强大型语言模型的幽默感,发现虽然它通常能使其更有趣,但也会降低响应的多样性。该研究追踪了 Tulu 3、OLMo 3.1 和 Qwen2.5 等模型在训练后 11 个阶段的表现,使用了超过 2,300 次人工评分的正面评价。结果表明,后期训练阶段产生了更搞笑、更简洁的笑话,但模型倾向于重复类似的笑话结构。
-
新研究应对不可检测的AI智能体共谋与检测
研究人员开发了检测AI智能体共谋的新方法,这是多智能体系统中日益增长的担忧。一种名为NARCBench的方法引入了一个基准和探测技术,通过聚合个体智能体信号来识别群体级别的欺骗,在各种开源模型上显示出高有效性。同时,一个名为Codetta的协议被提出,用于独立部署的LLM智能体之间进行高容量、无密钥、不可检测的共谋,能够将通信隐藏在看似普通的输出中。这些进展凸显了复杂智能体共谋日益增长的可行性,以及超越简单文本检查进行高级审计的必要性。
-
开源大模型成本:硬件和工程费用远超免费模型权重
自托管 Llama 3.1 70B 等开源大型语言模型,除了免费的模型权重外,还会产生显著的成本,主要在于硬件和工程方面。一个配备 GPU 和机器学习工程师的基本设置每月可能花费超过 10,000 美元,其中还包括模型评估、安全和漂移监控等隐藏费用。虽然为特定用例(如受监管数据或专有算法)提供了更大的控制权,但自托管的总拥有成本可能每月高达数万美元,这是一项重大的运营承诺。
-
大型语言模型准确地从临床文本中选择胸部CT方案
研究人员开发了一个决策支持系统,该系统使用大型语言模型(LLM)来自动选择胸部CT方案。该系统利用临床影像请求的文本嵌入,旨在通过解决当前方案选择方法的手动和不一致性来提高诊断质量和患者安全。基于LLM的方法表现出强大的性能,在18种CT方案中整体准确率为79%,在独立病例上的准确性与放射科医生相当,表明其有潜力成为未来方案推荐工具的基础。
-
LLM路由方法提高效率并降低延迟 · 已追踪2个来源
一篇新研究论文介绍了一种名为HeRo(History-Aware Routing)的动态路由框架,用于大型语言模型。该框架使用一种记忆机制来跨模型深度维护路由状态。这种方法将先前的路由分数聚合为紧凑的历史表示,在Llama 3.1-8B、Llama 2-7B和Llama 2-13B的基准测试中持续优于现有方法。与此同时,Amazon SageMaker Inference推出了前缀感知路由,这是一种将具有相似前缀的请求导向同一实例的策…
-
Snowflake 的 Arctic-SnowCoder 模型优先考虑数据质量而非数量
Snowflake AI Research 推出了 Arctic-SnowCoder,一个拥有 13 亿参数的代码模型,它挑战了更大数据集总是更优的观念。通过一种新颖的三阶段预训练课程,该模型优先考虑数据质量而非原始数据量,使用了 5550 亿 token 的精选数据集。这种方法使 Arctic-SnowCoder 能够实现与在数万亿 token 上训练的更大模型相媲美的性能,展示了以数据为中心的策略在 AI 开发中的重要影响。
-
新LLM评估系统用于AI药物发现代理,经人类专家验证
研究人员开发了一个新的基于LLM的评估系统,用于评估AI代理在药物发现中的性能,解决了传统指标的局限性和人类评估的可扩展性问题。该系统在AstraZeneca的ChatInvent助手上进行了测试,定义了四个质量维度,并使用LLM裁判来评估输出。一项人类对齐研究发现,Gemini-3.1 Pro、Claude Opus 4.7、GPT-5和Llama 3.1 70B被评估为潜在裁判,通过少样本演示优化表现最佳的裁判,以实现与人类专家的…
-
新方法在无需重新训练的情况下恢复了非洲语言的AI安全性
研究人员开发了一种名为潜在空间拒绝锚定(Latent Space Refusal Anchoring, LSR-Anchoring)的新型无需训练的方法,以提高低资源非洲语言指令调优AI模型的安全性。该技术旨在恢复模型在英语中通常存在但在约鲁巴语、伊博语、伊加拉语和豪萨语等语言中缺失的拒绝能力,而无需进行大量重新训练或新的标记数据。主要变体“平均激活引导”(Mean-Activation Steering, MAS)在某些架构上显示出…
-
本地 LLM 推理受内存瓶颈,而非计算能力限制
像 Llama-3.1 这样的大型语言模型在本地进行推理时,由于一个根本性的瓶颈:模型权重从内存中访问的速度,常常会显得 GPU 资源利用不足。生成单个 token 需要读取所有模型权重,这个过程比现代 GPU 的计算能力慢得多。这意味着 GPU 的算术单元大部分时间处于空闲状态,等待数据,而不是执行计算。虽然将多个用户的请求进行批处理可以在托管推理中克服这一点,但单个用户无法实现这种效率,从而导致了感知到的利用不足。
-
新方法为NLI任务生成常识公理,提高LLM准确性
研究人员开发了一种为自然语言推理(NLI)任务生成常识知识公理的方法,并使用 Llama 3.1 70B 和 GPT-OSS 120B 等LLM评估了其有效性。引入了一种新颖的无参考LLM作为裁判框架来评估这些生成公理的事实性,揭示了模型之间显著的性能差异。一种选择性整合高度事实性公理的混合方法在SNLI和ANLI基准测试中展示了持续的准确性提升,性能提高了高达8.5%,并帮助模型克服了偏见。
-
到 2026 年,AI 开发转向本地优先以提高速度和隐私性
AI 开发格局正迅速转向本地优先的方法,这是由克服云 API 延迟、确保数据隐私和降低成本的需求所驱动的。到 2026 年,在本地硬件上运行 AI 模型预计将成为开发者的默认选择,从而在速度和控制方面带来显著的改进。这一转变得益于模型量化、高效推理引擎以及功能媲美专有产品的开源模型的可用性日益提高。
-
LLaMA-3.1-70B 从财经新闻中提取结构化数据以提升股票预测
研究人员开发了一个新的框架,用于从财经新闻中提取结构化信息,超越了传统的情感分析。该框架利用LLaMA-3.1-70B识别六个语义维度,包括事件类型、影响范围、时间范围和语义置信度。在FNSPID数据集上的实验表明,与单独使用情感分析相比,这些结构化特征与情感分析相结合可以显著提高股票预测的准确性。
-
新方法改进LLM记忆检测,修正先前研究
一篇新的研究论文提出了一种更严谨的方法来检测大型语言模型(LLM)中的记忆现象。该研究强调了先前提取技术中的缺陷,认为它们常常通过未能正确区分记忆的训练序列和可预测的非训练序列而夸大了记忆现象。提出的方法涉及匹配比较,以建立可预测性的基线,从而能够更准确、更可靠地声称存在记忆现象。该方法表明,像OLMo 2 32B和Llama 3.1 70B这样的模型可能表现出先前被低估或误认的记忆模式。
-
新的基准和方法解决了 LLM 代理工具使用失败的问题
研究人员正在开发新的方法来识别和缓解使用外部工具的大型语言模型 (LLM) 代理中的失败。一种方法,“少推理,多验证”,引入了确定性的预执行门来防止静默策略违规,提高了 gpt-4o-mini 等模型的成功率,甚至对 gpt-5.2 等前沿模型也显示出希望。另一个框架 AgentLocate 专注于查明导致系统范围失败的具体代理和最早的步骤。此外,ToolFailBench 提供了一个诊断性基准来对工具使用失败进行分类,揭示了 Lla…
-
模型上下文协议简化了AI模型的发现和验证
模型上下文协议(MCP)是一个新系统,旨在简化在Hugging Face等平台上发现和验证AI模型的过程。开发人员可以使用配备MCP的AI代理,以编程方式检查模型文件、检查元数据标签,甚至直接从其集成开发环境(IDE)进行讨论,而不是在Web浏览器上手动浏览模型存储库。该协议旨在通过允许代理充当自主研究员,在无需用户下载文件或离开其工作流程的情况下对模型存储库进行深度审计,从而减少AI开发中的摩擦。