PulseAugur
中
实时 11:00:10
实体 LLMLingua-2

LLMLingua-2

PulseAugur coverage of LLMLingua-2 — every cluster mentioning LLMLingua-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. RESEARCH · CL_251989 ·

    新工具和研究致力于 GPU AI 工作负载的优化

    多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…

  2. TOOL · CL_223114 ·

    研究发现:提示词压缩在非英语语言上表现不佳

    一篇新发表在arXiv上的研究论文《Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors》调查了提示词压缩技术在不同语言上的有效性。研究发现,虽然提示词压缩可以降低LLM的推理成本,但其在非英语语言上的性能会显著下降,从而扩大了代币溢价差距。仅在英语数据上训练的压缩器表现出这种跨语言性能差距,而一个多语言训练的压缩器…

  3. TOOL · CL_217942 ·

    新研究量化了AI系统中西里尔字母分词的开销

    一篇题为《超越每个字母两个字节:西里尔字母AI系统中的分词开销》的新研究论文,量化了像乌克兰语这样代表性不足的西里尔字母语言与英语相比,存在显著的分词开销。研究发现,现代分词器可以将乌克兰语文本的碎片化程度提高121%,高于英语,这会影响成本和上下文容量。研究人员评估了缓解策略,包括使用LLMLingua-2来缩短输入长度,以及训练一个平衡的字节级BPE分词器,这些策略成功降低了分词比例。

  4. RESEARCH · CL_211955 ·

    研究发现:边缘RAG系统可通过自适应压缩节省能源

    一项新的研究论文探讨了面向边缘设备的检索增强生成(RAG)系统的自适应压缩技术。该研究在NVIDIA Jetson AGX Thor上进行,证明了根据工作负载和设备遥测数据动态调整压缩率,可以在不影响输出质量的情况下显著降低能耗。研究结果表明,中间压缩级别可以将GPU和SoC的能源使用量降低50%以上,比静态或离线压缩方法提供了更有效的方法。

  5. RESEARCH · CL_180557 ·

    AI模型难以预测文本中的人类注意力,融合技术提供改进

    一篇新的研究论文探讨了预测文本中人类注意力的挑战,为“地板”(朴素截断)和“天花板”(对半分神谕)分数设定了基准。研究发现,当前前沿语言模型在这些界限之间的差距中实现了35-53%的性能,而最先进的提示压缩器表现不如随机。然而,五种前沿模型的无权重融合显著提高了性能,并且通过将融合蒸馏到一个8B的开放权重学生模型中,这种增益得以保留。

  6. TOOL · CL_227984 ·

    新论文发现:提示压缩在非英语语言上表现不佳

    一篇题为“Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors”的新论文揭示,旨在通过移除低信息量标记来降低LLM推理成本的提示压缩技术,在非英语语言上的表现明显不如英语。这种差异归因于这些压缩器以英语为中心的训练数据,导致在其他语言中上下文效用损失严重。研究表明,多语言训练或“先翻译后压缩”的方法可以缓解这些问题,…

  7. TOOL · CL_122668 ·

    免费自托管网关绕过Claude限制,共享订阅

    一位开发者创建了一个免费的自托管网关,旨在规避使用限制并改善Anthropic的Claude模型用户的会话连续性。该工具在GitHub上获得了显著关注,提供了诸如跨多个提供商的自动模型故障转移和团队共享订阅管理等功能。它还包含一个多引擎压缩管道,以减少提示令牌使用量,保留代码和URL,同时包含防止提示膨胀的保护措施。

  8. RESEARCH · CL_68171 ·

    新型中间件将AI编码代理的提示令牌减少高达47%

    研究人员开发了一种新型中间件,通过在边缘进行预处理来优化AI编码代理的提示。该系统使用本地Llama 3.2模型将非英语文本翻译成英语,并将提示重写成更紧凑、面向任务的格式。该方法显著减少了高达47%的输入令牌使用量和18.8%的总令牌数,同时在多语言基准测试中保持或提高了编码准确性。

  9. RESEARCH · CL_20596 ·

    Telegraph English 使用结构化符号压缩提示,性能优于 LLMLingua-2

    研究人员开发了一种名为 Telegraph English (TE) 的新提示压缩协议,该协议将自然语言重写为使用逻辑符号的结构化方言。与删除标记的方法不同,TE 将输入分解为原子事实,并用符号替换短语,使压缩适应信息密度。在 OpenAI 模型上的 LongBench-v2 评估显示,TE 在 50% 的 token 缩减率下保留了 99.1% 的准确率,并且性能优于现有方法,尤其是在较小的模型上。