Llama-3.2-1b-instruct
PulseAugur coverage of Llama-3.2-1b-instruct — every cluster mentioning Llama-3.2-1b-instruct across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
SoftWater 方法优化 LLM 量化以减小内存占用
研究人员开发了一种名为 SoftWater 的新方法,用于量化大型语言模型的 softmax 输出层。该技术将量化视为一个率失真问题,以原始分布和量化分布之间的 KL 散度进行优化。SoftWater 根据类感知分配量化比特,为频繁的低方差类别分配更多精度,为稀有类别分配较少精度,这对于具有 Zipfian 令牌分布的模型尤其有效。该方法优于现有量化器,并在困惑度增加极小的情况下显著减小了模型的内存占用,使得头量化更加实用。
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
AI 模型定价发生重大变化;Z.ai 降低成本,新模型涌现
AI 定价正经历显著变化,其中 Z.ai 显著降低了其 GLM 5.2 的提示和完成价格,为高用量用户提供了大幅节省。MoonshotAI 和 Qwen 等其他提供商也调整了定价,部分价格有所小幅上涨或下跌。Poolside 和 IBM 的新模型正在进入市场,同时 Meta 和 Mistral 提供了经济高效的选项,扩大了可用 AI 服务的范围。
-
ARIADNE 框架支持无需训练即可进行适配器选择
研究人员开发了 ARIADNE,一个新颖的框架,可以在推理时动态选择最合适的适配器,而无需任务标签。这种无需训练且适配器无关的方法使用其训练数据嵌入派生的质心来表示每个适配器,从而能够基于潜在空间中的邻近性进行选择。ARIADNE 与各种参数高效微调 (PEFT) 方法兼容,并且不需要修改现有适配器或训练过程。评估表明,在使用 Llama 3.2 1B Instruct 进行测试时,ARIADNE 在 23 项 NLP 任务上达到了上…
-
大语言模型驱动的编译器加速了Transformer的CUDA推理
研究人员开发了AgentCompile,这是一种利用大语言模型(LLMs)优化CUDA上Transformer推理的新型编译器。 AgentCompile使用大语言模型的输出来作为指导性元数据,以指导专门化和CUDA实现选择的决策。 这种方法已显示出显著的加速效果,对于Qwen3-1.7B、Qwen3-4B和Llama-3.2-1B-Instruct模型,其推理速度分别比PyTorch eager快了平均5.66倍、4.05倍和4.26倍。
-
新研究在多语言、长上下文和推理任务中推进大语言模型效率
研究人员正在开发新方法来提高大语言模型(LLMs)在各种应用中的效率和有效性。Google DeepMind 推出了 ATLAS,一个用于缩放多语言模型的框架,该框架在数据混合和模型大小方面提供了指导,以提高非英语语言的性能。Hugging Face 发布了 LFM2.5-Encoders,针对 CPU 上的快速长上下文推理进行了优化,在文本分类等任务的速度和效率方面优于现有模型。此外,几篇 arXiv 论文探讨了大语言模型解码和推理…
-
BrowserAI 通过 WebGPU 加速实现在本地运行 LLM
BrowserAI 是一个开源项目,它允许大型语言模型直接在网页浏览器中运行,并利用 WebGPU 进行加速。这种方法确保了 100% 的隐私,因为所有处理都在本地进行,消除了服务器成本并启用了离线功能。该 SDK 支持多种引擎和流行模型,并提供文本生成、语音识别、文本转语音和音频源分离等功能。