实体
Qwen/Qwen2.5-3B-Instruct
Qwen/Qwen2.5-3B-Instruct
PulseAugur coverage of Qwen/Qwen2.5-3B-Instruct — every cluster mentioning Qwen/Qwen2.5-3B-Instruct across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM参数详解:模型权重的内存成本
本文解释了大型语言模型中模型参数的概念,澄清参数是模型中学习到的数字,不同于token。文章详细说明了“7B”或“70B”等参数数量如何直接关系到存储模型权重所需的内存。作者通过检查特定模型Qwen/Qwen2.5-3B-Instruct及其参数精度(BF16),演示了如何计算内存使用量,表明每个参数需要2字节的存储空间。
-
下载前检查Hugging Face模型:仓库详情指南
本周的教程重点在于,在不直接访问GPU或API的情况下,理解Hugging Face模型仓库。作者指导读者检查模型的网页,特别是Qwen/Qwen2.5-3B-Instruct,以收集关键信息。提取的关键细节包括模型架构、大小(30亿参数)、是基础模型还是指令微调模型、估计下载大小以及许可条款,所有这些都在下载任何文件之前完成。