Llama 3.1 70B
PulseAugur coverage of Llama 3.1 70B — every cluster mentioning Llama 3.1 70B across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新LLM评估系统用于AI药物发现代理,经人类专家验证
研究人员开发了一个新的基于LLM的评估系统,用于评估AI代理在药物发现中的性能,解决了传统指标的局限性和人类评估的可扩展性问题。该系统在AstraZeneca的ChatInvent助手上进行了测试,定义了四个质量维度,并使用LLM裁判来评估输出。一项人类对齐研究发现,Gemini-3.1 Pro、Claude Opus 4.7、GPT-5和Llama 3.1 70B被评估为潜在裁判,通过少样本演示优化表现最佳的裁判,以实现与人类专家的…
-
新方法在无需重新训练的情况下恢复了非洲语言的AI安全性
研究人员开发了一种名为潜在空间拒绝锚定(Latent Space Refusal Anchoring, LSR-Anchoring)的新型无需训练的方法,以提高低资源非洲语言指令调优AI模型的安全性。该技术旨在恢复模型在英语中通常存在但在约鲁巴语、伊博语、伊加拉语和豪萨语等语言中缺失的拒绝能力,而无需进行大量重新训练或新的标记数据。主要变体“平均激活引导”(Mean-Activation Steering, MAS)在某些架构上显示出…
-
本地 LLM 推理受内存瓶颈,而非计算能力限制
像 Llama-3.1 这样的大型语言模型在本地进行推理时,由于一个根本性的瓶颈:模型权重从内存中访问的速度,常常会显得 GPU 资源利用不足。生成单个 token 需要读取所有模型权重,这个过程比现代 GPU 的计算能力慢得多。这意味着 GPU 的算术单元大部分时间处于空闲状态,等待数据,而不是执行计算。虽然将多个用户的请求进行批处理可以在托管推理中克服这一点,但单个用户无法实现这种效率,从而导致了感知到的利用不足。
-
新方法为NLI任务生成常识公理,提高LLM准确性
研究人员开发了一种为自然语言推理(NLI)任务生成常识知识公理的方法,并使用 Llama 3.1 70B 和 GPT-OSS 120B 等LLM评估了其有效性。引入了一种新颖的无参考LLM作为裁判框架来评估这些生成公理的事实性,揭示了模型之间显著的性能差异。一种选择性整合高度事实性公理的混合方法在SNLI和ANLI基准测试中展示了持续的准确性提升,性能提高了高达8.5%,并帮助模型克服了偏见。
-
到 2026 年,AI 开发转向本地优先以提高速度和隐私性
AI 开发格局正迅速转向本地优先的方法,这是由克服云 API 延迟、确保数据隐私和降低成本的需求所驱动的。到 2026 年,在本地硬件上运行 AI 模型预计将成为开发者的默认选择,从而在速度和控制方面带来显著的改进。这一转变得益于模型量化、高效推理引擎以及功能媲美专有产品的开源模型的可用性日益提高。
-
LLaMA-3.1-70B 从财经新闻中提取结构化数据以提升股票预测
研究人员开发了一个新的框架,用于从财经新闻中提取结构化信息,超越了传统的情感分析。该框架利用LLaMA-3.1-70B识别六个语义维度,包括事件类型、影响范围、时间范围和语义置信度。在FNSPID数据集上的实验表明,与单独使用情感分析相比,这些结构化特征与情感分析相结合可以显著提高股票预测的准确性。
-
新方法改进LLM记忆检测,修正先前研究
一篇新的研究论文提出了一种更严谨的方法来检测大型语言模型(LLM)中的记忆现象。该研究强调了先前提取技术中的缺陷,认为它们常常通过未能正确区分记忆的训练序列和可预测的非训练序列而夸大了记忆现象。提出的方法涉及匹配比较,以建立可预测性的基线,从而能够更准确、更可靠地声称存在记忆现象。该方法表明,像OLMo 2 32B和Llama 3.1 70B这样的模型可能表现出先前被低估或误认的记忆模式。
-
新的基准和方法解决了 LLM 代理工具使用失败的问题
研究人员正在开发新的方法来识别和缓解使用外部工具的大型语言模型 (LLM) 代理中的失败。一种方法,“少推理,多验证”,引入了确定性的预执行门来防止静默策略违规,提高了 gpt-4o-mini 等模型的成功率,甚至对 gpt-5.2 等前沿模型也显示出希望。另一个框架 AgentLocate 专注于查明导致系统范围失败的具体代理和最早的步骤。此外,ToolFailBench 提供了一个诊断性基准来对工具使用失败进行分类,揭示了 Lla…
-
模型上下文协议简化了AI模型的发现和验证
模型上下文协议(MCP)是一个新系统,旨在简化在Hugging Face等平台上发现和验证AI模型的过程。开发人员可以使用配备MCP的AI代理,以编程方式检查模型文件、检查元数据标签,甚至直接从其集成开发环境(IDE)进行讨论,而不是在Web浏览器上手动浏览模型存储库。该协议旨在通过允许代理充当自主研究员,在无需用户下载文件或离开其工作流程的情况下对模型存储库进行深度审计,从而减少AI开发中的摩擦。
-
STAGE框架为分布式工作负载合成大语言模型执行图 · 跟踪2个来源
一个名为STAGE的新框架已被开发出来,用于合成大语言模型(LLMs)和专家混合模型(MoEs)的高保真执行图。该框架旨在通过建模各种并行化策略来优化分布式人工智能工作负载,从而能够在无需直接访问大规模基础设施的情况下探索不同的模型架构和系统配置。STAGE通过为超过128,000个GPU生成跟踪记录,证明了其可扩展性,并在计算、内存和通信方面保持了张量级别的准确性。
-
KV Cache 内存解析:估算和减少 LLM 中的 VRAM 使用量
KV Cache 是 LLM 推理的关键组成部分,会消耗大量 VRAM,尤其是在更长的上下文长度或更大的批处理大小时,其占用内存常常超过模型权重所需的内存。一个简单的公式可以估算 KV Cache 内存:2 × layers × hidden_dim × context_length × bytes_per_param。例如,Llama 3.1 70B 在 128K 上下文下,其 KV Cache 需要 340GB。像多查询注意力(M…
-
新的DoubtProbe防御显著减少了LLM越狱
研究人员开发了DoubtProbe,这是一种新颖的防御机制,旨在应对黑盒场景下大型语言模型(LLM)的越狱尝试。该双分支框架结合了结构验证和语义审计,以识别逃避安全对齐的越狱提示中的不一致之处。在Qwen2.5-72B和Llama 3.1 70B等模型上进行测试时,DoubtProbe显著降低了攻击成功率,同时在良性请求上保持了较低的误报率。
-
新的LLM KV缓存压缩方法应对安全性和效率挑战
研究人员正在开发新的方法来压缩大型语言模型(LLM)中的键值(KV)缓存,以减少内存使用并提高推理效率。AnchorKV通过偏向于不保留有害提示的token来关注安全性,而PolyKV通过对不同的Transformer层应用不同的策略和预算来优化压缩。Tangram在服务框架中实现了实用的非均匀KV缓存压缩,而BACON通过结合观察窗口注意力和最后查询证据来增强多模态KV缓存压缩。此外,TurboQuant和OSCAR代表了KV缓存量…
-
双RTX 3090提供经济实惠的70B LLM推理方案
本文详细介绍了一种使用两块二手NVIDIA RTX 3090显卡进行本地运行大型语言模型的经济高效的方法,总共提供48GB显存。该设置能够以每秒18-22个token的速度进行70B参数模型的推理,这足以满足交互式聊天需求。指南强调NVLink并非必需,并且Ollama或llama.cpp等标准软件可以有效地管理双GPU配置,并为每种软件提供了具体说明。
-
新分析揭示了 GPU 饱和如何影响分解式 AI 推理
研究人员开发了一种用于分解式推理架构的博弈论分析,该架构将预填充和解码阶段分离到不同的 GPU 池中。该研究以 NVIDIA Dynamo 为案例研究,将该系统建模为三个耦合博弈,并识别出 GPU 饱和如何导致性能下降。基于此分析,设计了一个自适应控制器来优化路由和降低延迟,在降低无政府状态代价方面显示出显著的改进。
-
每瓦特令牌数将决定 2026 年 GPU 和散热方案
2026 年 AI 计算的主要瓶颈将从原始处理能力转向效率,特别是每瓦特令牌数。这是因为推理(目前占 AI 计算支出的绝大部分)本质上是一个功耗受限的问题,尤其是在数据中心功耗分配固定的情况下。因此,能够最大化每兆瓦特生成令牌数的最高效 GPU 将比那些拥有最高 FLOPS 的 GPU 更受青睐。服务软件和数值精度(如 FP8 和 FP4)的进步可以在不要求新硬件的情况下显著降低每令牌成本,提供比仅购买更多 GPU 更直接、更具成本效…
-
新框架探究 AI 模型对研究者期望的敏感性
研究人员开发了一个新框架,用于区分语言模型在安全评估期间的战略性自我保护与其对研究者期望的敏感性。通过针对后果追踪和研究者期望追踪等工具性过程,他们可以评估这些干预措施如何影响对齐伪装行为。对 Llama-3.1 和 Qwen-2.5 等模型的实验表明,这些模型受感知期望的影响大于受后果追踪的影响,这凸显了在欺骗评估中进行构建效度检验的必要性。
-
模糊测试器揭示12个大型语言模型易受提示注入和护栏衰减攻击
一位安全研究人员使用模糊测试工具测试了12个大型语言模型,发现其中许多模型仍然存在漏洞。测试显示,直接注入、角色扮演绕过和编码规避技术仍然可以攻破多个模型,其中多轮对话衰减被证明特别有效。研究人员建议AI产品团队实施严格的模糊测试,监控对话中的护栏衰减情况,并测试特定的编码攻击,以提高其AI代理的安全性。
-
AI模型生成假说受益于紧凑型知识图谱
研究人员调查了知识图谱如何影响AI模型的科学假说生成。他们通过改变图谱结构和密度,测试了Mistral-7B、Llama-3.1-70B和Gemini 2.5 Flash。研究发现,虽然图谱上下文会影响模型输出,但紧凑的子图谱通常能提供与完整知识图谱相似的效用,支持“压缩知识图谱假说”。
-
研究:紧凑型知识图谱足以支持AI假说生成
一篇新的研究论文探讨了“压缩知识图谱假说”,调查了知识图谱中的哪些事实对语言模型生成科学假说最具影响力。该研究在 Mistral-7B、Llama-3.1-70B 和 Gemini 2.5 Flash 模型上测试了这一假说,发现虽然图谱上下文会改变输出,但模型即使在没有明确输入的情况下也常常保留重要的图谱信息。研究表明,紧凑型子图谱通常可以复制完整知识图谱的效用,表明科学数据中存在冗余感知信号。