LLMLingua-2
PulseAugur coverage of LLMLingua-2 — every cluster mentioning LLMLingua-2 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究量化了AI系统中西里尔字母分词的开销
一篇题为《超越每个字母两个字节:西里尔字母AI系统中的分词开销》的新研究论文,量化了像乌克兰语这样代表性不足的西里尔字母语言与英语相比,存在显著的分词开销。研究发现,现代分词器可以将乌克兰语文本的碎片化程度提高121%,高于英语,这会影响成本和上下文容量。研究人员评估了缓解策略,包括使用LLMLingua-2来缩短输入长度,以及训练一个平衡的字节级BPE分词器,这些策略成功降低了分词比例。
-
研究发现:边缘RAG系统可通过自适应压缩节省能源
一项新的研究论文探讨了面向边缘设备的检索增强生成(RAG)系统的自适应压缩技术。该研究在NVIDIA Jetson AGX Thor上进行,证明了根据工作负载和设备遥测数据动态调整压缩率,可以在不影响输出质量的情况下显著降低能耗。研究结果表明,中间压缩级别可以将GPU和SoC的能源使用量降低50%以上,比静态或离线压缩方法提供了更有效的方法。
-
AI模型难以预测文本中的人类注意力,融合技术提供改进
一篇新的研究论文探讨了预测文本中人类注意力的挑战,为“地板”(朴素截断)和“天花板”(对半分神谕)分数设定了基准。研究发现,当前前沿语言模型在这些界限之间的差距中实现了35-53%的性能,而最先进的提示压缩器表现不如随机。然而,五种前沿模型的无权重融合显著提高了性能,并且通过将融合蒸馏到一个8B的开放权重学生模型中,这种增益得以保留。
-
免费自托管网关绕过Claude限制,共享订阅
一位开发者创建了一个免费的自托管网关,旨在规避使用限制并改善Anthropic的Claude模型用户的会话连续性。该工具在GitHub上获得了显著关注,提供了诸如跨多个提供商的自动模型故障转移和团队共享订阅管理等功能。它还包含一个多引擎压缩管道,以减少提示令牌使用量,保留代码和URL,同时包含防止提示膨胀的保护措施。
-
新型中间件将AI编码代理的提示令牌减少高达47%
研究人员开发了一种新型中间件,通过在边缘进行预处理来优化AI编码代理的提示。该系统使用本地Llama 3.2模型将非英语文本翻译成英语,并将提示重写成更紧凑、面向任务的格式。该方法显著减少了高达47%的输入令牌使用量和18.8%的总令牌数,同时在多语言基准测试中保持或提高了编码准确性。
-
Telegraph English 使用结构化符号压缩提示,性能优于 LLMLingua-2
研究人员开发了一种名为 Telegraph English (TE) 的新提示压缩协议,该协议将自然语言重写为使用逻辑符号的结构化方言。与删除标记的方法不同,TE 将输入分解为原子事实,并用符号替换短语,使压缩适应信息密度。在 OpenAI 模型上的 LongBench-v2 评估显示,TE 在 50% 的 token 缩减率下保留了 99.1% 的准确率,并且性能优于现有方法,尤其是在较小的模型上。