Llama 4 Scout
PulseAugur coverage of Llama 4 Scout — every cluster mentioning Llama 4 Scout across labs, papers, and developer communities, ranked by signal.
- 2026-07-04 product_launch The Llama 4 Scout model has been released on Cloudflare Workers AI. 来源
- 2026-06-01 product_launch Meta's Llama 4 Scout model was announced with a claimed 10 million token context window. 来源
- 2026-05-24 product_launch Meta released the Llama 4 Scout model, detailing its hardware requirements. 来源
1 天有情绪数据
Llama 4 Scout to be integrated into enterprise workflow tools within 60 days
The recent availability of Llama 4 Scout on Cloudflare Workers AI suggests a strategic push for broader adoption. Given Cloudflare's enterprise focus, it's probable that integrations into workflow or productivity tools will follow to leverage this new model's capabilities, especially if it offers performance improvements over Llama 3.2 11b.
Emergence of specialized LLM frameworks like CogWM indicates a trend towards nuanced AI evaluation
The development of CogWM, which focuses on tracking cognitive states for social influence evaluation, highlights a growing trend in LLM research. This move away from purely text-based metrics towards deeper psychological state tracking suggests a future where AI evaluation becomes more sophisticated and human-like in its understanding of interaction dynamics.
Llama 4 Scout performance benchmarks to be released by Cloudflare within 30 days
With Llama 4 Scout now live on Cloudflare Workers AI, it's a reasonable expectation that Cloudflare will release performance benchmarks. This would serve to demonstrate the model's advantages, particularly in comparison to other readily available models like Llama 3.2 11b, and encourage wider adoption on their platform.
-
Meta 从开放权重 AI 转向,前沿转移至中国
作为开放权重大型语言模型(LLM)的关键参与者,Meta 已将其重点从发布开放模型转移,其最后一次公开版本是 2025 年 4 月的 Llama 4 Scout 和 Maverick。该公司最新的前沿模型 Muse Spark 以私有 API 的形式发布,并且大规模裁员表明其战略重心发生了转变。尽管 Meta 进行了调整,但开放权重 AI 的前沿并未崩溃,而是已迁移,主要迁移到了中国的实验室,西方的一些坚持者也做出了贡献。目前的开放权…
-
Llama 4 Scout模型现已在Cloudflare Workers AI上可用
Llama模型的一个新变体,名为Llama 4 Scout,已在Cloudflare Workers AI上推出。用户正在寻求可能测试过该模型的其他人的建议和反馈,特别是作为其bsid-js项目中Llama 3.2 11b模型的潜在替代品。
-
新的LLM框架CogWM追踪认知状态以进行社会影响评估
研究人员开发了一个名为CogWM的新型LLM框架,用于评估对话中的社会影响。该模型侧重于追踪用户内部认知状态的变化,如信念、欲望、意图和情绪,而不仅仅是表面文本指标。CogWM既充当用户模拟器,也充当评估平台,利用三层框架进行全面评估。该模型在超过150,000个用户回合样本上进行了训练,在预测情绪状态方面表现出更高的准确性,优于GPT-5.5。在区分试验中,CogWM成功地根据其认知影响识别出商业代理,其中Llama-4-Scout表现最佳。
-
新的LLM框架CogWM追踪认知状态以评估社会影响力
研究人员开发了一个名为认知世界模型(CogWM)的新型LLM框架,用于评估对话中的社会影响力。与关注表面文本的传统方法不同,CogWM在对话过程中追踪用户内部认知状态的变化,例如信念、愿望、意图和情绪。该模型在超过15万个用户回合样本上进行了训练,在预测认知状态和区分不同商业代理的影响力方面表现强劲。
-
AI框架利用VLM和RAG实现运动员画像数字化
研究人员开发了一种新颖的基于LLM的整体运动员画像框架,旨在克服传统手动或基础计算机视觉评估方法的局限性。该框架由LangGraph编排,整合了用于运动学追踪的计算机视觉和用于语义推理的Vision-Language Models,并特别符合印度体育局的协议。为了管理计算需求并防止幻觉,该框架采用了时间分块策略、LLM-as-a-Judge自我纠错循环以及使用ChromaDB进行自然语言查询的双持久化RAG管道。
-
研究论文探讨多智能体LLM团队的领导风格
一篇新研究论文探讨了领导风格如何影响多智能体LLM团队的表现。该研究题为“领导力作为协调控制:多智能体LLM团队的行为特征和恢复优势边界”,调查了传统领导力理论是否适用于AI代理。研究人员将交易型、变革型和情境型领导力操作化为LLM团队的控制器,发现它们的有效性高度依赖于特定的任务条件和模型行为,而不是提供普遍的性能提升。
-
新的GeoNatureAgent基准测试LLM代理在环境地理空间任务中的表现
一个新的基准测试GeoNatureAgent已经发布,用于评估AI代理在使用真实API进行环境地理空间分析方面的性能。该基准测试包含93个跨越不同类别的任务,例如空间推理和错误处理,并使用了可自托管的API,包含西班牙和葡萄牙的环境指标。对七个LLM的初步评估显示,Claude Sonnet 4表现最佳,但DeepSeek V3.2等开源模型提供了更具成本效益的替代方案,以较低的成本实现了Claude相当一部分的能力。研究还强调,比较…
-
Meta的Llama 4 Scout声称拥有10M上下文窗口,但理解能力欠佳
一款名为Llama 4 Scout的新AI模型发布,声称拥有1000万token的上下文窗口,远超OpenAI、Anthropic和Google等现有模型。该模型采用混合专家(Mixture-of-Experts)架构和交错旋转位置嵌入(iRoPE)技术来管理其超长上下文,并且定价实惠。然而,实际测试显示其存在局限性,在托管平台上实际上下文窗口被限制在327,680 token,并且在约256,000 token之后理解能力显著下降,…
-
新的MoE架构通过重叠计算和通信来提高AI模型速度
研究人员开发了FarSkip-Collective,这是一种用于混合专家(MoE)模型的新型架构修改,旨在提高分布式环境中的通信效率。该方法通过引入跳跃连接,使计算能够与通信重叠,即使对于Llama 4 Scout (109B)等大型架构,也能保持与原始模型相当的准确性。该方法在训练和推理方面都显示出显著的加速效果,在DeepSeek-V3推理过程中,首次令牌时间(Time To First Token)提高了32.6%,并在训练期间…
-
谷歌调整后,DuckDuckGo 用户寻求无 AI 搜索量激增
在谷歌将其搜索引擎整合更多 AI 功能后,DuckDuckGo 报告称其应用安装量和网站访问量显著增加,尤其是在美国。这种激增归因于用户寻求提供对搜索结果中 AI 控制权的替代方案。作为回应,DuckDuckGo 推出了新的浏览器扩展,以使其无 AI 搜索体验更加便捷。
-
Meta的Llama 4 Scout需要25GB显存;推荐RTX 5090或双3090
Meta的Llama 4 Scout是一个拥有1090亿参数的混合专家模型,在Q4_K_M量化下,需要大约25GB的显存才能获得可用的性能。拥有32GB显存的RTX 5090被认为是唯一能够本地运行该模型的消费级GPU。对于更具成本效益的本地解决方案,双RTX 3090设置提供了相似价格下的可比性能和更多的显存,但会增加复杂性。建议仅偶尔需要运行该模型的用户使用云GPU实例。
-
AI代理在陪审团模拟中难以像人类一样进行审议
研究人员开发了一个新颖的基准,使用多代理框架来评估大型语言模型(LLM)的审议能力,该框架的灵感来源于电影《十二怒汉》。该研究测试了GPT-4o和Llama-4-Scout,发现大多数模拟都导致了悬而未决的陪审团(hung juries),表明存在锚定效应而非说服力。与GPT-4o相比,Llama-4-Scout表现出更大的审议灵活性和更高的投票变化次数,这表明强化学习从人类反馈(RLHF)对齐训练的强度,而不是原始能力,影响了这种灵活性。