PulseAugur
实时 09:51:49
实体 ruler

ruler

PulseAugur coverage of ruler — every cluster mentioning ruler across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 32
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 26
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. TOOL · CL_227185 ·

    PolicyLong 通过策略内数据演进推进 LLM 上下文扩展

    研究人员推出了一种名为 PolicyLong 的新方法,通过动态构建训练数据来扩展大型语言模型的上下文窗口。与使用固定模型生成数据的先前离线方法不同,PolicyLong 使用当前模型迭代地重新筛选数据,确保训练分布与模型不断发展的能力保持一致。这种策略内方法创建了一个新兴的自课程学习机制,其中正面和挑战性上下文都源自模型自身的熵景观。在 RULER、HELMET 和 LongBench-v2 等基准测试上的实验表明,PolicyLo…

  2. TOOL · CL_223213 ·

    PragAlign 系统改进了多语言回复辅助,在中文方面表现优于基线模型

    研究人员开发了 PragAlign,一个旨在改进跨语言和跨文化回复辅助的新系统。PragAlign 将上下文阅读与选择性澄清分开,并与 Direct 和 Rule 基线模型进行了评估。在与中文母语者的测试中,PragAlign 的表现显著优于其他两个系统。虽然对日语母语者的结果并非在所有方面都具有统计学意义,但 PragAlign 展现了高排名率,表明其在支持跨文化交流方面的潜力。

  3. RESEARCH · CL_217752 ·

    新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能

    研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…

  4. SIGNIFICANT · CL_189523 ·

    Pokee AI 发布 28B 模型,拥有 10M token 上下文窗口,支持本地部署

    Pokee AI 发布了 Pokee-Isaac 28B,这是一个拥有 280 亿参数的纯文本基础模型,专为部署在私有客户边界内而设计。该模型拥有 1000 万 token 的上下文窗口,使其能够在不离开安全环境的情况下保持连贯性并处理大量数据。Pokee-Isaac 28B 在智能体基准测试中表现强劲,在最大上下文长度下 RULER 得分为 93.3%,并且优于在超过 200 万 token 后性能下降的云端模型。

  5. TOOL · CL_188745 ·

    新的基准测试 LLM 长上下文推理,超越简单检索

    新的基准正在涌现,以测试大型语言模型(LLM)在处理扩展上下文方面的能力,超越了简单的“大海捞针”检索测试。虽然由 Greg Kamradt 推广的大海捞针测试在初步评估中很有用,但它存在一些局限性,例如容易被优化以及不能反映现实世界的语义复杂性。研究人员正在开发更稳健的方法,如 NVIDIA 的 RULER 和清华大学的 LongBench,它们旨在通过评估模型在整个文档上进行推理的能力,而不仅仅是定位特定事实,来衡量模型的“有效上下文长度”。

  6. RESEARCH · CL_183287 ·

    新技术提升 LLM 推理速度和效率 · 已追踪 10 个来源

    研究人员正在开发多种新技术来加速大型语言模型 (LLM) 推理。Hugging Face 的 LFM2.5-DSpark 通过使用推测解码将速度提升高达 3.2 倍,而 Intel 正在探索使用流水线并行和推测解码在 AI PC 上进行分布式推理。其他方法包括用于混合精度注意力的 TileMix、用于超低比特推理的 FluxBin 以及优化请求分组的多箱批处理。此外,Pallas 旨在通过在蜂窝切换期间主动迁移 KV 缓存来改善 AI…

  7. TOOL · CL_176538 ·

    AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM

    AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…

  8. TOOL · CL_169571 ·

    新框架赋能大语言模型生成复杂多视图可视化

    研究人员开发了Crystalis,一个旨在赋能大语言模型(LLMs)生成协调多视图可视化(CMVs)的新框架。当前的大语言模型在CMVs复杂的相互依赖性方面存在困难,其中一个组件的错误可能导致其他组件失效。Crystalis通过一种以查询为中心的方法来建模CMVs,将可视化分解为不同抽象级别的数据、可视化和交互组件。该框架采用渐进式成核和语义退火,以确保垂直查询结晶和水平一致性,在12个任务的基准测试中成功率高达75%,并在用户研究中…

  9. TOOL · CL_167561 ·

    PIVOT索引方法加速LLM中的稀疏注意力

    研究人员开发了PIVOT,一种新颖的索引方法,旨在优化大型语言模型中的令牌级稀疏注意力。PIVOT通过减少冗余计算,解决了DeepSeek Sparse Attention等系统中索引器造成的瓶颈。它通过对附近的查询进行分组并执行一次共享扫描来识别候选令牌,从而显著加速了索引过程。

  10. TOOL · CL_167436 ·

    新的LOCKS方法显著降低了LLM长上下文解码延迟

    研究人员开发了一种名为LOCKS(页面局部紧凑键摘要)的新方法,以提高大型语言模型长上下文解码的效率。该技术通过为每个上下文页面创建谱摘要来解决由键值(KV)缓存引起瓶颈,使模型能够仅关注最相关的页面。LOCKS在包括LongBench-v1、RULER、AIME26和MATH-500在内的各种基准测试中表现强劲,即使显著减少了对令牌的关注,也能保持高质量。该方法可作为vLLM的即插即用插件使用,可大幅降低解码延迟和KV缓存大小。

  11. COMMENTARY · CL_163194 ·

    OpenAI subreddit 用户寻求聊天评估基准

    一位 r/OpenAI subreddit 的用户正在寻求用于评估聊天模型性能的数据集和基准的建议。他们特别关注衡量多轮对话准确性和内存管理,并指出 LongBench、NIAH 和 RULER 等现有基准可能已过时。该用户旨在识别当前最先进的方法并找出自己工作中的薄弱环节,目前不包括基于代理的评估。

  12. TOOL · CL_160715 ·

    Pulsar Attention 为长序列提供高效的 LLM 推理

    研究人员推出了一种名为 Pulsar Attention 的新方法,旨在提高大型语言模型在长序列上推理的效率。与使用静态前缀的 Star Attention 等之前的分块方法不同,Pulsar Attention 采用了内容感知的前缀和紧凑的跨块摘要。与 Star Attention 相比,这种方法将计算成本降低了高达 3.3 倍,同时保持了相同的 KV 缓存占用空间。使用 Llama-3.1-8B 在 RULER 和 BABILon…

  13. RESEARCH · CL_135238 ·

    新算法在局部可采样图模型下学习常数深度电路

    研究人员开发了一种新的算法,用于在可以局部采样的图模型下学习常数深度电路。这项工作扩展了 Chandrasekaran、Gaitonde、Moitra 和 Vasilyan(arXiv 2026)之前的发现,那些发现仅限于具有强大空间混合和多项式增长的模型。新方法利用了 Gibbs 分布的一种新颖的低度近似,通过模拟和截断 Glauber 动力学来实现。这种方法使得在各种有界度图上学习硬核模型和伊辛模型等系统成为可能,即使在接近其采样…

  14. RESEARCH · CL_135321 ·

    Jet-Long 方法在无需重新训练的情况下提升了 LLM 的长上下文性能

    研究人员推出了一种名为 Jet-Long 的新方法,可以在无需重新训练的情况下扩展大型语言模型的上下文窗口。这种无需微调、零样本的方法可以动态调整重缩放因子,以平衡短上下文的保真度和长上下文的外插性。Jet-Long 集成了包含-排除注意力合并和即时 RoPE 校正,从而在 NVIDIA H100 等硬件上实现了最小的推理开销和更高的吞吐量。

  15. TOOL · CL_129801 ·

    HOLA 为线性注意力模型增强了互补记忆系统

    研究人员开发了一种名为 HOLA(海马体线性注意力)的新方法,以增强线性注意力和状态空间语言模型的记忆能力。该方法引入了一个互补的“海马体”组件,用于存储精确的键值关联,解决了传统循环状态可能覆盖早期事实的损失性质。HOLA 在有界精确缓存旁边维护一个压缩记忆,从而能够高效存储线性可压缩结构,同时保留关键关联。这种半参数记忆系统在 Wikitext 和 LAMBADA 基准测试中的困惑度方面取得了显著改进,并在“针尖麦芒”召回测试中表…

  16. TOOL · CL_122997 ·

    新的HOLA架构通过双记忆系统增强线性注意力语言模型

    研究人员开发了HOLA(海马体线性注意力)架构,这是一种通过引入互补记忆系统来增强线性注意力语言模型的新型架构。该系统解决了标准线性注意力模型中信息丢失的问题,在这些模型中,由于固定大小的循环状态,早期事实可能会被覆盖。HOLA在保持压缩状态的同时,增加了精确的KV缓存来存储关键关联,从而提高了召回率并降低了困惑度。

  17. COMMENTARY · CL_118848 ·

    上下文工程:在大型上下文窗口之外优化LLM信息

    上下文工程已成为AI开发中的一个关键学科,其重点在于优化提供给大型语言模型(LLM)的信息,而不仅仅是增加上下文窗口的大小。这种做法涉及仔细选择和构建数据,以确保模型能够获得给定任务最相关的信息,从而提高推理能力、降低延迟并减少成本。采用了诸如语义分块、分层检索和上下文压缩等技术来最大化信号并最小化噪声,确保模型能够有效地利用呈现给它们的信息。

  18. TOOL · CL_115682 ·

    新的强化学习框架优化LLM KV缓存以实现高效推理

    研究人员开发了一个名为KV Policy (KVP) 的新颖框架,通过优化键值(KV)缓存来解决大型语言模型(LLM)的内存需求。KVP将KV缓存驱逐重构为一个强化学习问题,训练轻量级代理来预测未来解码的token有用性。该方法在长上下文和多轮对话基准测试中显著优于现有的启发式方法,并展示了在不改变底层LLM的情况下泛化到新任务和更长序列长度的能力。

  19. COMMENTARY · CL_112783 ·

    观察到LLM上下文压缩质量退化曲线,缺乏基准测试

    一位用户观察到,像DeepSeek V4和Claude Code这样的LLM,在重复进行上下文压缩后,输出质量并非线性下降。相反,在第二次压缩后似乎会出现短暂的改善,随后才出现下降。该用户搜索了测量这种多轮压缩退化的现有基准测试,但没有找到专门针对这种现象的测试,现有的测试侧重于静态输入长度或单轮漂移。如果这种“压缩曲线”是真实存在的,它可能会告知用户何时重置会话,并为比较LLM提供商提供一个新的维度,但目前主要的基准测试套件缺乏这一指标。

  20. TOOL · CL_101317 ·

    通过自定义规则和技能,Cursor AI 编码工具的使用量大幅减少

    作者详细介绍了他们如何通过实施自定义规则和技能,显著减少了对 AI 编码工具 Cursor 的日常使用量。这一改变源于他们意识到之前的方法效率低下且成本高昂,从而促使他们采用了更优化、更具成本效益的工作流程。