KTransformers
PulseAugur coverage of KTransformers — every cluster mentioning KTransformers across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
XingChen-AGI 发布 Xing4.0-29B-A4B,支持 256K 上下文长度
XingChen-AGI 发布了 Xing 系列(前身为 TeleChat)的新大型语言模型 Xing4.0-29B-A4B。该模型拥有 290 亿参数,但每个 token 仅激活 40 亿参数,实现了 256K 的原生上下文长度,可扩展至 512K。值得注意的是,该模型完全在 Ascend NPU 平台上使用 MindSpore 框架进行训练,并针对复杂的工程任务进行了优化,采用了面向代理的架构,并与 Ascend 硬件进行了深度协…
-
用户就 KTransformers 与 llamacpp 在 MoE 优化方面寻求建议
一位 Reddit 用户正在就 KTransformers 和 llamacpp 这两个不同软件库的性能和推理速度寻求建议。该用户特别有兴趣在多 GPU 和 RAM 上使用 FP8 精度优化 Qwen3.8 模型的性能。
-
Z.ai 发布开源 GLM-5.3-Flash 多模态 MoE 模型
Z.ai 发布了 GLM-5.3-Flash,这是一款新的 3200 亿参数的混合专家(MoE)模型,原生支持多模态且开源。该模型采用混合注意力架构,结合了稀疏注意力和线性注意力,能够高效处理 100 万 token 的上下文窗口。Z.ai 声称,GLM-5.3-Flash 在编码和智能体基准测试上的表现优于其前代模型,同时推理成本显著降低,并且在性能上接近 Claude Opus 4.8。
-
FreeToken 使大型 MoE 模型能在单 GPU 上运行
来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 FreeToken,这是一个开源服务引擎,旨在单台工作站 GPU 上运行大型 MoE 模型,显著降低了先进 AI 的硬件门槛。该系统通过采用带宽自适应执行和语义感知缓存来有效管理 CPU 和 GPU 之间的计算,从而解决了现有引擎的局限性。FreeToken 使 753B GLM-5.2 等模型能在消费级硬件上以交互速度运行,使强大的人工智能能力对个人开发者和小团队更加易于获取。
-
KTransformers 更新MoE微调;阿里巴巴下调Qwen3.6价格
KTransformers 发布了 0.7.0 版本,增强了其在专家混合(MoE)微调方面的能力。同时,阿里巴巴集团降低了其 Qwen3.6 模型的定价,使其更易于获得。这些发展凸显了AI模型领域持续的进步和市场调整。
-
2026年笔记本电脑本地编码的5款LLM
作者重点介绍了五款适合在2026年笔记本电脑上本地运行的大型语言模型,并强调较小的量化模型现在能够处理重要的编码任务。Qwen2.5-Coder因其完善度和生态系统被推荐为默认模型,而DeepSeek-R1-Distill-Qwen-14B因其详细的推理能力而成为复杂调试的首选。微软的Phi-4 14B因其高效、结构化的输出而受到关注,Bonsai 27B则被展示为一个通过新颖的低比特量化挑战传统大小-性能权衡的模型。
-
秋晶科技设立华东总部,计划打造万卡级AI算力卡工厂
专注于AI算力卡生产服务的秋晶科技已在杭州钱江世纪城设立其华东区域总部。该公司计划在五年内建成一座万卡级高品质AI算力卡工厂。此次扩张旨在利用当地的产业生态和基础设施,增强其服务区域内企业级AI推理需求的能力。
-
DeepSeek V4 Pro 本地 AI 速度提升 40%;AlphaGo 重写版提供 LLM 见解
一位独立开发者已将 DeepSeek V4 Pro 优化用于本地桌面性能,实现了 40% 的速度提升。同时,使用 KTransformers,DeepSeek V4 Flash 现在可以在拥有 24GB VRAM 的消费级硬件上运行。另外,研究员 Eric Jang 正在使用 Claude Code 等现代工具从头开始重建 DeepMind 的 AlphaGo,为 LLM 原理和 AI 开发提供了新的见解。