PulseAugur
实时 15:44:35
实体 waqf

waqf

PulseAugur coverage of waqf — every cluster mentioning waqf across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_27223 ·

    ExLlamaV3、Unsloth Qwen 和 Phi3 代理迎来重大本地 AI 更新

    本周的本地 AI 新闻重点介绍了 ExLlamaV3 推理库的重大更新,提高了在消费级 GPU 上运行量化 Llama 模型时的效率。此外,通过 Unsloth 提供了 Qwen 3.6 模型的新 GGUF 量化版本,使其更容易在本地使用。该集群还展示了一个创新项目,该项目使用 Phi3 模型创建一个能够控制用户主计算机的自主代理。

  2. RESEARCH · CL_23571 ·

    本地AI工具通过新的预测和解码技术提升LLM速度

    本地AI社区的最新更新正在提高推理速度,并为开放权重模型提供实际的基准测试。llama.cpp项目现已支持多令牌预测(MTP),该技术在消费级硬件上使Gemma 26B模型的速度提升了40%。另外,vLLM利用DFlash推测解码,使Gemma 4 26B模型在RTX 5090 GPU上达到了每秒600个令牌的速度。此外,Ollama社区发布了Qwen和DeepSeek编码模型在本地开发任务上的比较基准测试。

  3. RESEARCH · CL_15961 ·

    新方法通过高效的稀疏化、量化和压缩来加速大型语言模型

    研究人员开发了几种新的方法来压缩和优化大型语言模型(LLMs),以提高效率并降低计算成本。SparseForge 通过优化稀疏掩码来专注于高效的半结构化稀疏化,以显著更少的重新训练 token 实现高精度。FASQ 引入了灵活的加速子空间量化,能够在没有校准数据的情况下实现连续的压缩级别,并在商品 GPU 上在准确性和速度方面均优于现有方法。此外,CoSpaDi 使用校准引导的稀疏字典学习进行结构化分解,改善了精度-压缩权衡。另一种方…

  4. RESEARCH · CL_14463 ·

    新研究探讨大语言模型安全、效率和训练优化

    研究人员正在开发新的方法来提高大语言模型(LLMs)的效率和安全性。一种名为“Widening the Gap”的方法利用了异常值注入来破坏LLM量化,证明安全风险已延伸到AWQ和GPTQ等先进量化技术。同时,其他研究则专注于通过自适应量化(XFP)、设备-边缘协作的推测解码(GELATO)以及高效的KV缓存管理(SparKV、Feather、Dooly)来优化LLM推理。此外,新的框架正在涌现,用于分析LLM推理的稳定性(Queue…

  5. RESEARCH · CL_01274 ·

    Hugging Face 推出用于高效 LLM 的先进量化技术

    研究人员正在开发先进的量化技术,以提高大型语言模型 (LLM) 的效率。AutoRound、LATMiX 和 GSQ 等新方法旨在减小模型大小和计算需求,从而能够在功能较弱的硬件上进行部署。这些方法侧重于优化模型权重和激活在较低比特宽度下的表示方式,其中一些方法已达到与更高精度模型相当的准确性。创新包括用于训练后量化的新颖校准策略和用于提高鲁棒性的可学习仿射变换。

  6. RESEARCH · CL_01035 ·

    优化Transformer推理:更快、更便宜的大模型技术

    大型Transformer模型因其巨大的内存占用和计算成本,给推理带来了显著挑战,这些成本随输入长度呈二次方增长。研究人员和从业者正在探索各种优化技术来缓解这些问题。这些方法包括网络压缩策略,如剪枝、量化和知识蒸馏,以及架构改进和高效并行。目标是减少内存使用、计算复杂度和推理延迟,以实现实际的大规模部署。