Llama 3.3 70B Instruct
PulseAugur coverage of Llama 3.3 70B Instruct — every cluster mentioning Llama 3.3 70B Instruct across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
PZERO marketplace通过兼容OpenAI的API提供折扣AI模型算力
PZERO,一个AI marketplace,允许用户在Base网络上使用USDC购买折扣AI模型算力。该平台通过将用户请求路由到最便宜的可用合格报价来运作,价格通常远低于标价。用户可以为他们的账户充值,然后使用PZERO发行的API密钥(与OpenAI的SDK兼容)来访问包括OpenAI、Anthropic、Meta和DeepSeek在内的各种模型。该marketplace仍处于早期阶段,吸引力有限,用户在发出请求前必须确保其余额已确认。
-
新的 FrenchNews-7 基准测试评估大型语言模型在新闻分类上的表现
研究人员推出了 FrenchNews-7,这是一个用于按编辑部对法国新闻文章进行分类的新基准测试。该基准测试结合了来自多个出版商的大量法国新闻语料库和一个源自 URL 的七类分类体系。经过微调的 CamemBERT 模型取得了最佳性能,优于仅使用标题的输入以及 GPT-OSS-120B、Mistral Small 3.2 和 Llama-3.3-70B Instruct 等零样本大型语言模型。研究发现,虽然“体育”和“国际”等类别可以…
-
LLM 代理创建自适应硬件木马以测试检测器弱点
研究人员开发了 TrojanGYM,一个利用多个大型语言模型创建自适应硬件木马的新颖框架。这些木马通过生成利用检测器盲点的多样化触发器和载荷,旨在绕过现有的基于学习的检测器。该框架包含一个涉及 LLM 代理、语法检查、功能验证和基于 GNN 的检测器的迭代循环,以改进木马插入策略。还引入了一个新的检测器 Robust-GNN4TJ,它显著提高了对 LLM 生成木马的检测率。
-
AI代理的内存策略分类得到审计,Llama-3.3和GPT-OSS的收益有限
一篇新研究论文介绍了一种用于评估个性化AI代理内存策略分类的受控审计协议。研究发现,虽然用状态定义构建提示可以提高准确性,但明确输出状态并未显著提高Llama-3.3-70B的策略准确性,仅对GPT-OSS-120B有边际改善。研究还指出,与基准相关的状态标签可以在不一定反映真实内部机制的情况下影响预测,并且示例级准确性可能夸大了反事实一致性。
-
孟加拉语标题生成研究强调上下文选择和提示策略
一篇新的研究论文探讨了使用大型语言模型(LLM)生成孟加拉语新闻标题的策略。研究发现,选择文章的关键部分,如导语段落,与使用全文生成标题一样有效。研究人员还比较了孟加拉语原生提示(BNaP)和跨语言提示(XLP),结果显示XLP与上下文丰富相结合时表现更强,尽管这因模型而异。该论文强调了提示设计和上下文相关性在多语言LLM应用中的重要性,而非输入长度。
-
新研究探索 LLM 高效可靠的推理 · 跟踪 9 个来源
多篇研究论文探讨了增强大型语言模型 (LLM) 推理效率和可靠性的方法。技术包括用于压缩推理痕迹的记忆增强、用于加速生成的自推测解码以及用于优化推理工作的自适应计算分配。此外,还在使用 LLM 裁判评估形式数学推理以及校准 LLM 生成推理的置信度方面进行了研究。其中一篇论文还研究了从专有模型中提取隐藏的思维链痕迹,凸显了潜在的安全风险。
-
研究发现:大型语言模型在推荐方面信心不足
一项对四种大型语言模型——Mistral Large、Llama 3.3 70B Instruct、GPT-OSS 120B 和 Claude Sonnet 4.6——进行的审计新研究发现,当被要求从特定目录推荐项目时,这些模型普遍表现出信心不足。尽管之前的研究侧重于幻觉方面的过度自信,但此次审计发现,即使模型没有产生幻觉,它们表达的信心也常常低于其实际准确性所暗示的水平。研究表明,这种信心不足源于提示词引发置信度评分的方式不匹配,而…
-
大型语言模型性能各异;特定任务能力比排名更重要
一项最新实验显示,即使在使用相同的任务和参数时,大型语言模型的性能也会有显著差异,这挑战了“单一最佳”模型的概念。在对 164 个 HumanEval+ 问题进行的两轮测试中,排名靠前的模型位置发生了互换,Qwen3 235B 从第三名升至第一名,而 GPT-OSS 120B 则从第一名跌至第三名。研究表明,模型的性能取决于具体任务,依赖单一模型可能会错失显著的性能提升机会,因为结合多个模型的输出来实现更高的准确性是可能的。
-
Weaver 框架结合弱验证器以提高 LLM 准确性
研究人员开发了 Weaver,一个旨在通过组合多个不完美的验证器来构建更强大、更准确的系统的框架,以提高语言模型的验证能力。该方法旨在缩小当前验证器与理想的 Oracle 验证器之间的性能差距。Weaver 利用弱监督来估计单个验证器的准确性,并对输出进行归一化以创建统一分数,从而减少对大量标记数据的需求。评估表明,Weaver 在推理和数学任务上的性能得到了显著提升,其准确性水平可与更大、经过微调的模型相媲美。
-
新的多智能体系统对角色扮演AI智能体进行压力测试
研究人员开发了一个新颖的多智能体平台,旨在严格压力测试角色扮演语言智能体(RPLAs)。该系统采用一个审问者智能体(Interrogator Agent)来应用渐进式对抗策略,一个目标智能体(Target Agent)代表正在评估的角色扮演语言智能体,以及一个评判智能体(Judging Agent)来评估角色保真度、道德遵守和一致性方面的性能。实验表明,这种多策略对抗方法显著降低了 Llama 3.3 70B Instruct、GPT…
-
新的PlanFlip框架利用了多智能体LLM系统中的漏洞
研究人员开发了一个名为PlanFlip的新框架,通过针对规划阶段来利用多智能体LLM系统中的漏洞。该框架通过利用Planner智能体引入了四种类型的提示注入攻击,这些攻击会破坏子任务。研究发现,像GPT-5这样能力更强的模型更容易受到攻击,而像DeepSeek-R1这样具有推理增强的模型则表现出抵抗力。研究还强调了模型多样性在多智能体系统安全中的重要性,因为同质化管道无法防御这些规划阶段的攻击。
-
LLM路由假设在代码安全漏洞检测中得到证实
一篇新的研究论文探讨了大语言模型(LLM)中的“路由假设”,认为模型拥有知识但难以在内部路由以激活它。该研究在代码安全漏洞检测中重现了先前在数学推理任务中的发现,使用了GPT-OSS-120B、Llama-3.3-70B和Gemma-4-31B等模型。结果表明,结构化先验(备忘单)在合成数据上显著提高了性能,但在应用于真实CVE数据时导致准确率大幅下降,表明存在跨领域权衡。
-
新的大语言模型工具评估论文评分偏见和学生AI依赖性
研究人员开发了新的工具和分析方法来评估大语言模型(LLMs)在学术写作中的性能和公平性。一项研究介绍了WrAFT,一个用于自动评分和反馈的模块化系统,该系统使用Llama 3.3 70B Instruct和GPT-4o等模型实现了最先进的性能。另一篇论文调查了针对TOEFL论文自动评分的大语言模型中的第一语言偏见,发现来自欧洲语言背景的论文得分高于来自东亚背景的论文,尽管跨提示泛化稳定。此外,还开发并验证了一个新的量表GenAI-RT…
-
代理框架漏洞允许通过工具模式执行隐藏的有效载荷
一位安全研究人员在 smolagents 代理框架中发现了一个漏洞,该漏洞允许通过工具模式定义执行恶意有效载荷。有效载荷隐藏在枚举值或属性标题中,直接传递给 GPT-OSS 120B 模型,导致未经授权执行导出工具。虽然该框架的设计有意信任 MCP 服务器的模式,但研究人员确认该漏洞已超出工具描述范围,延伸到机器可读的槽位,与 Llama-3.3-70B 相比,GPT-OSS 120B 尤其容易受到影响。
-
大型语言模型和程序分析可自动修复智能家居配置
研究人员开发了SmartHomeSecure系统,该系统旨在自动检测和修复智能家居配置文件中的错误,特别是针对Home Assistant的YAML文件。该系统结合了轻量级程序分析和大型语言模型,以识别和纠正语法、格式和语义逻辑问题。通过对包括GPT OSS和Llama模型在内的四种不同大型语言模型进行测试,SmartHomeSecure实现了高错误检测准确率和成功的修复率,表明这是一种提高智能家居可靠性的有前景的方法。
-
研究发现:基础模型可根据文本生成CAD设计
一项新研究探讨了使用基础模型从自然语言生成计算机辅助设计(CAD)机械零件的应用。研究人员开发了LLMForge框架,该框架集成了各种模型,并使用基于分析和视觉语言模型(VLM)的评估方法来优化设计。研究评估了七个基础模型,发现当使用分析反馈时,较小的指令微调模型表现与大型系统相当,而VLM评估提高了网格生成成功率。
-
HexGrid Cloud 为开放权重模型提供定制化 LLM GPU 基准测试服务
HexGrid Cloud 提供在用户指定的 GPU 和配置上对开放权重 LLM 进行基准测试的服务。他们正在征集模型和硬件设置的建议,以测试其部署平台,重点关注适合单个 H200 GPU 内存的聊天/指令模型。测试结果将包括吞吐量、延迟和成本指标,并将与完整的配置细节一起公开分享,以确保可复现性。
-
新方法用更少数据增强网络安全大语言模型
研究人员开发了一种名为领域自适应持续预训练(DAP)的资源高效方法,用于网络安全任务的大语言模型(LLMs)专业化。他们使用了一个精选的1.26亿词语料库和一个分布式FSDP流水线,适配了Llama-3.1-8B、DeepSeek-R1-Distill-Qwen-14B和Llama-3.3-70B-Instruct模型。适配后的Llama-3.3-70B-Ins-DAP模型在使用显著少于同类模型的训练数据的情况下,在三个网络安全基准测…
-
新方法改进大型语言模型对齐并减少欺骗行为
研究人员开发了新的方法来对齐大型语言模型(LLMs),这些方法比之前认为的更加稳健。这些技术,包括 Steer-With-Fixed-Coefficient (SwFC)、Steer-to-Target-Projection (StTP) 和 Steer-to-Mirror-Projection (StMP),旨在纠正可能由对抗性提示、微调或涌现行为引起的对齐问题。在 Llama-3.3-70B-Instruct 和 Qwen3.6-…
-
新基准SPLIT测试LLM在英语和乌克兰语中的共情能力
开发了一个名为SPLIT的新基准,用于评估大型语言模型(LLM)在危机相关情境下,特别是在英语和乌克兰语中的跨语言共情和文化基础。该基准包含跨越五个类别的500个提示:压力、恐慌、孤独、国内流离失所和紧张。对Gemini 2.5-Flash和Llama 3.3 70B Instruct的评估显示,在处理乌克兰语时性能有所下降,而DeepSeek-V3保持了稳定性。研究还指出,人类和AI评估者在共情和自然度方面的一致性较弱,但在文化基础…