glm5.2
PulseAugur coverage of glm5.2 — every cluster mentioning glm5.2 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AMD MI355X GPU 为 Kimi K3 模型提供更优的每美元性能
来自 Wafer.ai 的一篇博文详细介绍了他们如何在 AMD 的 MI355X GPU 上运行 Kimi K3 模型,从而实现了更优的每美元性能。尽管 Kimi K3 拥有 2.8T 的巨大参数量,需要大量的 VRAM,但 MI355X 凭借其每个 GPU 288GB 的 VRAM,证明了其作为 NVIDIA B300 和 B200 GPU 的经济高效替代方案。虽然 NVIDIA 的硬件提供了更高的总吞吐量,但 MI355X 提供了…
-
LoopOps 将其 AI 设计工具与 Claude 进行比较,强调速度和效率
LoopOps 是一个产品智能平台,将其“Figma 设计代理”与 Claude 进行了概念设计能力的比较。该实验旨在评估为一家虚构的耐克电子商务应用程序创建线框图的质量、速度、令牌使用量和易用性。LoopOps 生成的设计速度更快,使用的令牌更少,尽管 Claude 生成的屏幕更多。
-
上海人工智能实验室发布Mobius架构用于科学智能
上海人工智能实验室发布了Intern-S2-Preview-397B,一个用于科学智能的新基础模型。这个拥有3970亿参数的模型采用了新颖的“Mobius”架构,将知识存储与推理分离,从而能够更高效、更灵活地执行科学任务。该模型在分子设计和材料结构生成等领域表现强劲,在特定科学基准测试中超越了之前的万亿参数模型和其他领先的AI系统。
-
GLM5.2 部署在 AMD MI355X 上以实现更便宜的推理 · 已追踪 5 个来源
Wafer.ai 已成功将 GLM5.2 部署在 AMD MI355X 硬件上,实现了 2626 tokens/秒/节点 的吞吐量和 213 tokens/秒 的单流推理速度。此次部署具有成本优势,MI355X GPU 的成本大约比 NVIDIA 的 Blackwell B300 低 2.75 倍。优化工作包括使用 AMD Quark 将 GLM5.2 量化到 MXFP4,并采用 sglang 推理框架,同时对 ROCm 的投机解码进…
-
Fable 5 在 LLM 家具建模对比中领先,优于 GPT 5.5 和 Claude Opus
一位用户对比了包括 GPT 5.5、Fable 5、Opus 4.8、Sonnet 5 和 GLM5.2 在内的多个大型语言模型生成参数化家具模型的能力。Fable 5 生成的模型最准确且最具成本效益,正确实现了连接件并提出了实用的安装方案,尽管在挂钩方向上存在一个小错误。GPT 5.5 速度快且效率高,但未能遵守提示约束,导致连接件无法实现。Opus 4.8 和 Sonnet 5 需要更多迭代才能生成有缺陷的模型,而 GLM5.2 …
-
GLM 5.2 因其性能和深度上下文理解能力而获得赞誉
在 r/LocalLLaMA 子版块的用户正在讨论 GLM 5.2 的性能和能力。一位用户正在收集关于推理速度的数据,并要求其他人分享他们的每秒 token 率、推理引擎和硬件配置。另一位用户对 GLM 5.2 留下了非常积极的印象,强调了它在一个基于 RAG 的圣经学者代理中跨越圣经文本建立深度联系的能力,提供了其他模型未能提供的见解。
-
用户详述了为本地 AI 升级到五块 RTX 6000 Ada GPU 的昂贵路径
一位用户详细介绍了他构建高性能本地 AI 计算设置的广泛而昂贵的旅程。最初的目标是双 RTX 5090 GPU,但用户逐步升级到多块 NVIDIA RTX 6000 Ada Generation GPU,最终达到了五块此类卡的配置。这一迭代过程是由处理更大模型和复杂任务所需的更多 VRAM 和处理能力所驱动的,过程中遇到了散热管理和系统稳定性方面的挑战。
-
用户考虑购买 4x Ascend GX10 GPU 以运行未来的开源 LLM
一位 Reddit r/LocalLLaMA 社区的用户正在考虑购买四块 Ascend GX10 GPU,以运行未来的开源大型语言模型,例如潜在的 "fable 5" 版本。他们引用了其他人使用类似硬件(4x DGX Sparks)运行 GLM5.2 的性能基准,指出在 128k 上下文窗口下,提示处理速度为 400-500 tokens/秒,输出速度约为 15 tokens/秒。尽管承认这速度不算飞快,但用户认为这是可用的,尤其是在…
-
GLM5.2 max 在成本和性能上优于 Claude Sonnet 4.6
一位 Reddit 用户在执行设计规范时,比较了 GLM5.2 max 和 Claude Sonnet 4.6 的性能和成本。用户发现,根据 LLM Arena 的测试,GLM5.2 max 在生成交互式地球仪这一特定任务上,不仅成本更低,而且性能更好。比较突显了显著的成本差异,GLM5.2 max 在输入、缓存输入和输出 token 方面都明显更便宜。
-
用户探讨在多节点CPU集群上运行大型GLM5.2模型
一位用户正在咨询关于在由四台Dell C6525服务器组成的集群上运行大型语言模型(特别是GLM5.2)的可行性。每台服务器配备双AMD EPYC 7702处理器、512GB内存和快速SSD存储,总计2TB内存,并在四个节点上提供显著的内存带宽。用户正在探索集群化这些系统的选项,以提高token速度或加载更大模型(如GLM5.2的Unsloth 4位或8位版本),用于代理编码任务。
-
新模型挑战 GPT-5.5,AI 补贴泡沫或将破裂
记者 Ed Zitron 指出,AI 行业正面临潜在的补贴泡沫,一些公司提供的客户补贴高达其收入的 70 倍。这种不可持续的定价模式引发了对 AI 商业模式长期可行性的根本性问题。另外,据报道,一个新的人工智能模型正致力于使用 245GB 的数据集超越 GPT-5.5,这表明模型能力仍在快速发展。
-
DIY爱好者为本地LLM运行搭建6000美元家庭实验室
一位用户详细介绍了他们为本地运行大型语言模型而定制的家庭实验室计算机的构建和功能。该设备配备了四块NVIDIA RTX 3090 GPU,192GB DDR5内存(超频至5600 MHz),并由经济型主板和CPU驱动。用户花费了约6000美元和40小时进行构建,出于经济原因选择了消费级硬件而非更昂贵的服务器级组件。该设置允许他们运行包括GLM5.2、MiniMax 2.7、Flux2Klein(用于扩散模型)以及Qwen3.6在内的各…
-
建议使用开源AI代理以避免供应商锁定
Agentic AI Foundation的首席技术官Manik Surtani建议工程师通过使用抽象层和像Goose这样的开源代理来减少对专有AI的依赖。他强调,Goose在模型选择方面提供了灵活性,使用户能够适应定价变化、弃用或政府禁令,同时还提供了一个中立的代理框架。GreenPT的Keus强调,开源模型对于数字自主至关重要,无需进行大规模的基础设施更改即可实现自托管、模型切换、审计和分叉,即使是对于先进的编码模型也是如此。
-
社区寻求计算能力以创建 GLM5.2 蒸馏数据集来训练更小的模型
一位 r/LocalLLaMA 子版块的用户正在寻求拥有大量计算资源的人士的帮助,以便从 GLM5.2 创建一个大型蒸馏数据集。目标是生成 70 万到 100 万个示例的数据集,以支持 Qwen3.5 等更小模型的正确训练并提高其性能。此举被视为对 AI 社区的宝贵贡献。
-
工程师使用Ollama进行私有大语言模型任务,避免数据训练
一位软件工程师正试图减少对大语言模型(LLMs)的依赖,但发现它们在某些任务中不可或缺。为了维护隐私并避免其数据被用于训练,他们选择付费使用Ollama,一个开源模型服务。这使他们能够使用glm5.2、kimi-k2.7、Claude和Codex等各种模型,同时保持提示的私密性。