实体
LongCodeQA
LongCodeQA
PulseAugur coverage of LongCodeQA — every cluster mentioning LongCodeQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的 LLM 推理技术旨在提高效率和边缘部署 · 跟踪 7 个来源
多篇研究论文介绍了提高大型语言模型 (LLM) 推理效率的新技术。Cascade 通过管理异构请求的延迟预算来优化服务,提高吞吐量并减少 SLO 违规。CubicQuant 提出了一种参数化非均匀量化格式,用于低比特权值的高吞吐量推理。EdgeXpert 和 SHIELD 专注于边缘设备的内存高效 LLM 推理,采用提示式专家重用和分段分层内存架构等技术。ATFlash 提出每 RoPE 波长注意力窗口以在保持精度的同时修剪计算,而 …
-
新的LaMR框架为LLM代理修剪代码上下文
研究人员开发了一个名为LaMR(Latent Multi-Rubric)的新框架,以提高LLM驱动的代码代理的效率。目前的代理经常在无关的代码片段上浪费令牌预算,但LaMR通过将代码相关性分解为两个不同的维度来解决这个问题:语义证据和依赖支持。这种方法可以更精确地修剪上下文,从而在令牌使用量上节省大量成本,并在许多情况下提高代码任务的性能。实验表明,LaMR经常能匹配或超越未修剪的基线,节省高达31%的令牌并提高精确匹配分数。