PulseAugur
实时 10:14:59
实体 Mistral-7B-v0.3

Mistral-7B-v0.3

PulseAugur coverage of Mistral-7B-v0.3 — every cluster mentioning Mistral-7B-v0.3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_193749 ·

    新的大语言模型剪枝方法提升效率和生成性能

    研究人员开发了一种新颖的方法,用于剪枝大语言模型高层的注意力头以提高效率。该技术引入了一个自适应重缩放参数,以在剪枝后维持表示尺度,抵消潜在的幅度变化。在 LLaMA3.1-8B、Mistral-7B-v0.3、Qwen2-7B 和 Gemma2-9B 等模型上进行的各种任务实验表明,与现有的结构化剪枝方法相比,该方法在生成任务上表现更优。

  2. TOOL · CL_193471 ·

    研究发现,大型语言模型安全探测可跨模型家族泛化

    一项新研究重现并扩展了先前关于使用潜在空间安全探测来检测大型语言模型中有害提示的研究。研究人员发现,在 LLaMA-3.1-8B、Gemma-4-E4B、Mistral-7B-v0.3 和 Qwen2-7B 等模型的激活上训练的轻量级 MLP 探测器,可以跨不同模型家族和规模进行泛化。他们的实验还表明,无论推理过程中使用的随机种子如何,最终的 token 潜在向量在不同架构之间保持一致。

  3. RESEARCH · CL_139599 ·

    新方法旨在提高 LLM KV 缓存压缩效率

    研究人员正在开发先进的技术来压缩大型语言模型 (LLM) 的键值 (KV) 缓存,这是推理过程中内存成本的主要贡献者。JoLT 和 FlashJoLT 等新方法利用张量分解和残差分配,在性能损失极小的情况下实现了显著压缩,如在 Mistral-7B-v0.3 和 Llama 2 13B 等模型上所证明的。其他研究探讨了查询可见性如何影响压缩方法的排名,一些方法在事先不知道查询的情况下表现不佳。此外,PM-KVQ 和 REAL 等方法旨…

  4. TOOL · CL_104778 ·

    新的TTT-NTP方法提高了LLM在长上下文任务上的性能

    研究人员引入了一种名为“测试时训练与下一词预测”(TTT-NTP)的新方法,该方法提高了预训练长上下文语言模型的性能。该技术无需重新设计架构即可适应现有的LLM检查点。TTT-NTP使用模型自身的下一个上下文隐藏状态来监督更新,与自监督的下一词预测目标保持一致。该方法在RULER Full-13和LongBench-v2等基准测试中,在包括Llama 3.1:8b和Mistral-7B-v0.3在内的各种模型上都显示出了一致的改进,同…

  5. RESEARCH · CL_70413 ·

    RAMPART 内存模型提升 LLM 代理性能

    研究人员推出 RAMPART,这是一种专为基于 LLM 的代理设计的新型编译时内存模型。该系统利用结构化注册表来管理上下文组装,允许以零提示令牌成本进行可编程的排序、包含和淘汰。使用 Qwen、Llama 和 Mistral 等各种 LLM 系列进行的实验表明,RAMPART 的块分组和相关性门控显著提高了任务成功率并降低了提示成本。

  6. TOOL · CL_22450 ·

    人工智能安全研究揭示区域性大语言模型偏见差异

    一篇新研究论文引入了一个因果分析框架,用于审计大语言模型(LLM)的安全机制,超越了观察性偏见测量。该研究应用Pearl的do-算子来分离人口统计信息注入提示的因果效应,涉及来自美国、欧洲、阿联酋、中国和印度的七个指令调优模型。研究结果表明,由于上下文毒性,标准的公平性指标可能高估人口统计偏见,并揭示了不同的对齐趋势,其中西方模型对某些群体的因果拒绝率更高,而东方模型则表现出有针对性的敏感性。

  7. RESEARCH · CL_36289 ·

    LLM 推理和推理技术随着新研究和硬件的进步而发展

    研究人员正在探索新的方法来提高大型语言模型 (LLM) 的效率和推理能力。Google Research 正在开发训练 LLM 以贝叶斯方式进行推理的技术,从而提高它们更新概率估计和泛化到新任务的能力。同时,推理优化方面的进展包括“投机级联”,它将更小、更快的模型与更大的模型结合起来,以及“上下文回收”来管理长对话范围。此外,正在开发“级联多粒度剪枝”和“SharQ”等方法来压缩 LLM 以进行设备上推理,从而在保持准确性的同时降低延…