Llama 3-70B
PulseAugur coverage of Llama 3-70B — every cluster mentioning Llama 3-70B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
使用llama.cpp通过专家卸载在RTX 4090上运行100B+ MoE LLM
一份技术指南详细介绍了如何在单块RTX 4090等消费级GPU上运行大型混合专家(MoE)语言模型,特别是超过1000亿参数的模型。该方法被称为“专家卸载”,利用了MoE架构,其中每个token只激活模型参数的一个子集。这使得计算密集但间歇使用的“专家”层可以卸载到系统内存中,而持续访问的组件(如注意力机制)则保留在GPU上。该指南提供了硬件建议、llama.cpp工具的构建说明以及实现此卸载技术的命令行示例,并强调系统内存带宽是性能的关键因素。
-
发布新LLM排行榜,比较顶级模型
发布了一个新的排行榜,比较了各种大型语言模型的性能。该排行榜包括 Claude 3 Opus、GPT-4 Turbo、Claude 3 Sonnet、Claude 3 Haiku、Gemini 1.5 Pro、Command R+、Llama 3-70B 和 Mistral Large 等模型。具体的指标和排名细节在相关图片中展示。
-
LLM基准测试结果喜忧参半;Mastodon实例周日关闭
LLogiq 最近的一项分析评估了几种领先的大型语言模型(LLM)的性能,包括 Claude 3.5 Sonnet、GPT-4o、Claude 3 Opus、Claude 3 Haiku、Mistral Large、Llama 3-70B 和 Mixtral 8x22B。这些基准测试在 NVIDIA H100 和 A100 硬件上运行,结果显示,虽然一些模型表现出潜力,但总体结果有些令人失望,未能达到某些预期。另外,一个 Mastod…
-
新研究探索鲁棒、自适应和结构化强化学习技术 · 追踪 10 个来源
arXiv 上发表的多篇研究论文探讨了强化学习 (RL) 技术的进展。其中一篇论文统一了基于正则化的方法,以实现针对对抗性扰动的鲁棒深度强化学习,并提出了一种具有动态更新的拉格朗日乘子的约束优化方法。另一篇论文介绍了 CLAW,一种使用超网络生成低秩适配器来适应基于模型的强化学习中的世界模型的方法,在少样本学习场景中表现优于现有方法。此外,还介绍了用于长时限 LLM 代理的粒度自适应信用分配、用于具有局部对称性的强化学习的群代数状态表…
-
AI 代理在集体决策中表现出“多数力量”行为
一项最新研究测试了包括 Claude、GPT 和 Llama 系列在内的 10 个 AI 模型,以观察它们在被要求预订健身房时的集体行为。研究人员发现,许多 AI 代理在看到其他代理的选择后,倾向于收敛于一个单一决定,这种现象被称为“多数力量”。更强大的模型,如 Claude 3.5 Sonnet 和 GPT-4 Turbo,能够在大规模代理群体中维持共识。这种新兴的集体行为,即使没有明确指示要跟随多数,也引发了对潜在意外后果和风险的…
-
11个AI模型通过单一提示进行比较,结果各不相同 · 跟踪4个来源
Netlify最近的一篇博客文章探讨了11个不同的AI模型在收到相同提示时性能上的差异。文章强调了来自OpenAI、Google、Anthropic、Meta、Mistral AI和Cohere等主要AI实验室的模型会产生截然不同的输出,展示了当前大型语言模型的多样化能力和细微差别。这种比较突显了测试各种模型以找到最适合特定任务的模型的重要性。
-
到2026年底,70B LLM可在单GPU上运行,但会有质量权衡
到2026年第三季度至第四季度,在单台消费级GPU上运行大型700亿参数语言模型将成为可能,但这需要激进的量化技术,可能会降低模型质量。拥有32GB显存的RTX 5090是目前唯一能够容纳70B模型的消费级显卡,但只能在Q2_K等较低的量化级别下运行,这会影响推理和代码生成。为了获得更好的质量,建议使用双RTX 4090或基于云的解决方案,或者使用更高量化级别的较小的32B模型。
-
16GB显存是本地LLM的理想选择;大型模型需要24GB以上
对于在本地运行大型语言模型(LLM)的用户来说,16GB显存通常足以运行7B和大多数13B参数的模型,尤其是在使用量化技术时。然而,运行34B参数等更大模型至少需要24GB显存,推荐使用RTX 4090。对于70B参数的模型,单个消费级GPU通常不切实际,需要双GPU或云解决方案,尽管未来的RTX 5090等显卡旨在解决这个问题。
-
推测性解码在不同模型上的性能差异巨大
推测性解码是一种旨在加速 AI 模型推理的技术,但发现在某些条件下会显著降低性能。在 Llama-3-70B 模型上进行测试时,该技术在 batch 224 时成为一种“负担”,将 token 吞吐量降低了 26%。在 gpt-oss-120b 模型上进行的类似测试显示,性能转折点急剧转移到 batch 1,981,表明该功能何时变得有害存在 45 倍的差异。这种不一致性表明,当前关于启用推测性解码的建议可能不完整,因为它通常只引用了…
-
LLM在AI交易中的评估:GPT-4 Turbo和FinGPT展现潜力,但局限性依然存在
一项新的研究论文评估了五种大型语言模型(LLM)在AI交易技术市场分析中的有效性。该研究比较了GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3-70B和FinGPT在蜡烛图模式识别、方向信号生成和财务报告理解等任务上的表现。结果显示,GPT-4 Turbo和FinGPT的表现优于被动的S&P 500基准,其中GPT-4 Turbo在通用模型中实现了最高的年化回报率和夏普比率。然而,所有模…
-
负比特量化通过反转张量嵌入释放VRAM
一位研究人员开发了一种名为负比特量化(NBQ)的新技术,声称可以通过“负比特”配置实现稳定的推理,从而有效地释放VRAM。这种被称为相位反转张量嵌入(PITE)的方法,利用破坏性干涉模式将权重表示为亏损,这悖论式地增加了大型模型的可用内存。在Qwen 35B和Llama-3 70B模型上的初步测试表明,困惑度影响很小,同时显著提高了生成速度。
-
用户放弃ChatGPT,转向注重隐私的替代品,如Claude和NanoGPT
两位用户描述了他们从ChatGPT转向用于数据分析和日常使用的经历,他们优先考虑隐私和成本节约。一位用户发现Claude更适合数据分析,而另一位用户则采用了NanoGPT,这是一个支持Llama 3和Mistral等开源模型的API服务,并称其按使用付费的加密模式和不保留数据是关键优势。两位用户都承认,虽然这些替代品提供了优势,但在多模态支持或与GPT-4等领先模型相比的持续顶级性能方面可能仍有不足。
-
KronQ 框架利用梯度协方差增强 LLM 量化
研究人员推出 KronQ,一个新颖的训练后量化 (PTQ) 框架,旨在更有效地压缩大型语言模型 (LLM)。与仅依赖激活统计数据的先前方法不同,KronQ 将梯度协方差纳入其量化目标。这种方法利用 Kronecker 因子 Hessian 近似,提高了权重幅度方差,并为混合精度分配提供了新指标。在对 LLaMA-3-70B 进行的实验中,KronQ 在 2 位仅权重量化中实现了 7.93 的困惑度,显著优于 GPTQ 和 GPTAQ …
-
集成显卡上的 LLM 面临 VRAM 限制,量化是关键
在 Intel Arc 和 AMD Radeon 780M 等集成显卡 (iGPU) 上本地运行大型语言模型 (LLM) 主要受限于 VRAM,而 VRAM 与系统 RAM 共享。虽然这些 iGPU 提供张量处理能力,但其性能受到系统内存带宽的限制。量化等技术对于适配模型至关重要,其中 Q4_K_M 是一个很好的平衡点,可以有效地运行高达 14B 参数的模型。像 Llama 3 70B 这样的大型模型,由于其高 VRAM 要求,通常无…
-
新数据集揭示AI在非洲数据中心的用水足迹
已开发出一个新的数据集,用于评估非洲41个国家数据中心的用水效率,同时考虑了直接冷却和间接发电的用水量。研究估计,在Llama-3-70B上运行一份10页的报告可能消耗0.66升水,而GPT-4完成相同任务可能消耗高达59升水。这些基于2024年数据的数据突显了非洲各国发电用水强度存在显著差异,许多国家消耗的水量低于全球平均水平。
-
微调模型在错误信息检测方面优于 LLM
一项新的研究论文表明,在 Reddit 上检测错误信息方面,特定任务的微调模型仍然优于大型语言模型 (LLM)。研究发现,微调后的 RoBERTa 比 Claude Haiku 4.5 和 Gemini Flash Lite 2.5 等零样本 LLM 取得了更高的 F1 分数。研究还表明,更大的 LLM 并不一定表现更好,并且一些模型存在安全对齐问题,阻碍了它们检测评论中信念传播的能力。
-
Mac 对 NVIDIA GPU:为本地 LLM 选择合适的硬件
在本地运行大型语言模型方面,Apple Silicon Mac 和 NVIDIA GPU 各有优势。Mac 因其统一内存架构,在运行大型模型推理方面表现出色,可以更轻松、更安静地处理高达 70B 参数的模型。然而,NVIDIA GPU 在运行小型模型方面提供卓越的原始速度,并且由于其 CUDA 生态系统,对于微调和生产服务等任务至关重要。
-
CyberAgent发布Llama-3-70B级别日本LLM;Ray-Ban Meta在日本上市
CyberAgent发布了一款新的专注于日语的大型语言模型,其能力与Meta的Llama-3-70B相当。该模型可用于商业用途,标志着专业AI发展的重要一步。另外,Ray-Ban Meta智能眼镜已在日本上市,用户可以通过眼镜与AI进行交互。
-
LLM 在新研究中显示出语言和人口统计学偏见
新研究表明,多语言大型语言模型在面对冲突信息时会表现出显著的语言偏见,通常偏袒某些语言而非其他语言。研究还揭示了 LLM 中性别、种族和年龄代表性的差异,而去偏见努力有时会产生新的公平性权衡。在职业和犯罪场景中,这些模型经常偏离现实世界的人口统计数据,并且它们的刻板印象会在不同语言中被放大。
-
Grok V9-Medium 1.5T 模型目标是专家级推理
Grok V9-Medium 是一款新的 1.5 万亿参数前沿模型,定位为更广泛的企业人工智能堆栈中的专家级组件。它与 GPT-5.4 和 Gemini 3.1 Pro 等模型竞争,旨在通过深度推理和长上下文性能实现差异化。该模型的大规模部署需要复杂的基础设施,包括混合专家架构和仔细的推理调优,以管理成本和延迟。