GLM-4.5-Air
PulseAugur coverage of GLM-4.5-Air — every cluster mentioning GLM-4.5-Air across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
用户测试 CMP170HX GPU 以进行本地 LLM 部署
一位用户测试了四张 CMP170HX 显卡,每张显卡配置了 64GB 内存,总计 256GB VRAM。测试重点是运行各种大型语言模型,结果表明较小的模型可以完全装入单张卡,或者如果它们的总 VRAM 使用量保持在 64GB 限额内,则可以同时运行。其性能与 NVIDIA 的 30xx 系列相当,如果使用内存更大的显卡,则有可能实现更高的吞吐量。用户还指出,即使在加载大型模型时,PCIe Gen2 x4 接口也没有显著限制性能,这表明…
-
AI爱好者寻求无审查、智能的LLM用于角色扮演
一位Reddit r/LocalLLaMA的用户正在寻找智能且无审查的大型语言模型推荐,特别是用于色情角色扮演(ERP)。他们目前日常使用的模型Qwen3-235b-a22b-instruct-2507-Q4_K_M.gguf表现良好,但存在一些小的格式问题,有时被认为过于容易被引导到无审查的领域。他们发现其他模型如Qwen 3.6 27b和Minimax 2.7对他们来说过于审查,而GLM 4.5 Air则被认为不够“智能”以进行创意生成。
-
新方程预测LLM在消费级硬件上的推理速度
一位独立研究者开发了一个方程,用于根据模型大小、内存和带宽等参数预测大型语言模型在消费级硬件上的推理速度。该方程源自对LLM行为的四项观察“定律”,允许用户在下载模型之前估算性能。研究还强调,模型放置和量化策略会显著影响速度和质量,表明简单地使用更多比特并非总是最优选择。
-
中国AI模型价格比西方低50倍,性能不输 · 追踪4个来源
2026年AI API定价的比较显示,智谱AI、百度、DeepSeek和阿里巴巴集团等中国供应商提供的成本远低于OpenAI、Anthropic和Google等西方竞争对手。GLM 4.7 Flash等模型免费,而其他模型的价格比西方选项便宜几个数量级,且性能通常相当或更优。文章建议采用从更便宜的模型开始进行原型设计,并将模型复杂性与任务需求相匹配的策略来优化成本。
-
开放权重的大语言模型(LLM)可免费访问但运行成本高昂,给开发者带来挑战
文章认为,虽然开放权重的LLM在技术上可以免费访问,但其巨大的规模常常使其在标准硬件上运行成本过高且难以实现。Qwen、DeepSeek、GLM、Kimi和MiniMax等模型被列为这一趋势的例子,参数数量达到数百亿甚至数万亿。作者认为,焦点应从原始参数数量和开放权重转移到实际部署成本和效率上,将效率定义为能力与运营成本的最佳比率。对开发者而言,这意味着在本地推理时优先选择更小、更易于管理模型,并在为产品选择模型时,将活跃参数和实际延…
-
新的探测器揭示了LLM预测器的隐藏知识和潜在欺骗
研究人员开发了一种方法来探测用于预测的大型语言模型(LLM)的内部表征,以提高其校准和忠实性。通过在中间激活上训练探测器,他们发现这些探测器比模型自身的思维链推理具有更好的校准效果。探测器还可以充当测谎仪,识别推理痕迹何时未能准确反映证据,并且即使在推理隐藏扰动的情况下也能预测预测变化。该技术将探测内部表征确立为审计和校准LLM预测器的实用工具。
-
新方法探究LLM预测准确性和校准性
研究人员开发了新的方法来评估大型语言模型(LLM)的预测能力,解决了数据泄露和校准问题。一种方法Hindcast从特定过去日期回放预测市场,阻止模型访问事件后信息或包含未来结果的训练数据。另一项研究探究LLM的内部表征,以评估其校准性和推理的忠实性。这项研究发现,内部激活为校准提供了更可靠的信号,并可以充当“测谎仪”,揭示预测往往在推理过程开始之前就已经确定。
-
LLM 推理工具 vLLM、llama.cpp、Ollama 在显存限制下的基准测试
vLLM、llama.cpp 和 Ollama 的基准测试比较揭示了性能上的显著差异,尤其是在处理超出可用显存的大型语言模型时。虽然 vLLM 在 24GB 显存内吞吐量表现出色,并发增加时可达 5.4 倍的扩展,但当模型需要超过约 22GB 时则完全失败。相比之下,llama.cpp 和 Ollama 可以通过溢出到系统内存来处理这些更大的模型,尽管速度要慢得多,每秒只有个位数 token。值得注意的是,与 Ollama 的自动方法…
-
本地LLM代理基准测试:框架在RTX 3090上表现优于模型
一项基准研究在RTX 3090 GPU上评估了五个本地LLM模型,重点关注它们在不同编排框架下的性能。研究发现,框架的选择,特别是支持原生工具调用(如LangGraph)的框架,显著影响模型的有效性,其中一个模型在使用合适的代理时,成功率从0%提高到93%。研究还强调了工具遵循的重要性,并测量了每项正确任务的电力成本,确定Qwen3-Coder是本地代理任务的高效模型。
-
DeepSeek-V4 Flash 在笔记本 LLM 对决中击败 GLM-4.5-Air
在 MacBook Pro M5 Max 上的正面比较表明,量化到 2 位数的 2840 亿参数 DeepSeek-V4 Flash 模型,其性能优于量化到 6 位数的 1060 亿参数 GLM-4.5-Air 模型。尽管人们普遍认为更高的精度会带来更好的结果,但 DeepSeek-V4 Flash 在解决推理谜题时速度更快且正确率更高,而 GLM-4.5-Air 在此方面表现不佳。在编码任务、创意写作和常见的脑筋急转弯问题上,两种模…
-
LLM社区呼吁紧急发布80-160B参数模型
r/LocalLLaMA子版块的用户正在表达对80-1600亿参数范围内新的大型语言模型(LLM)的强烈需求。现有模型要么对于拥有高容量但速度较慢的统一内存系统(如Apple设备或AMD Ryzen AI 395)的用户来说太小,要么对于VRAM有限的用户来说太大。社区要求能够有效利用80-128GB RAM或64GB VRAM的系统运行的模型,因为现有选项要么过时,要么不适合他们的硬件配置。
-
LLM 定价变动:Kimi K2.7 涨价,Claude 3.5 Haiku 下架,新增 Gemini 模型 · 追踪 8 个来源
Token Ledger 报告了多家供应商的几项 LLM 定价调整以及模型增减情况。值得注意的是,MoonshotAI 的 Kimi K2.7 Code 的 completions 价格有所上涨,而其 Kimi Latest 和 K2.6 版本的 prompt 价格略有下降。Z.ai 调整了其 GLM 5.2 模型的定价,提供了优惠,并推出了具有高上下文能力的 GLM 5V Turbo。多款模型已从可用列表中移除,包括 Anthrop…
-
AI社区质疑为何缺乏新的100B-120B参数语言模型
r/LocalLLaMA subreddit上的一项讨论突显了社区对100B-120B参数范围内新大型语言模型缺乏的看法。虽然之前存在GPT-OSS-120B、GLM-4.5-Air、Nemotron-3-Super、Qwen3.5-122B和Mistral-Small-4-119B等模型,但社区注意到这些模型现在已经发布数月。当前发布的新模型要么更小(25B-35B),要么更大(200B+),这引发了关于约120B MoE家族是否已…
-
Thaura AI 使用开源 GLM 4.5 Air 模型
Thaura AI 是一家总部位于欧盟的服务商,使用了开源的 GLM 4.5 Air 模型。用户正在询问其本地部署情况,一些用户对 Ollama 的 MichelRosselli/GLM-4.5-Air 等非官方来源表示谨慎,该来源需要下载 72GiB 的大量数据。
-
模型目录新增、价格变动和移除
模型目录新增了模型,包括 StepFun 的 Step 3.7 Flash,该模型以适中的成本提供大上下文生成。Anthropic 发布了两个新的 Claude Opus 4.8 变体:“Fast”版本面向优先考虑速度的企业,“Standard”版本面向高质量输出。DeepSeek 的 V3.2 Speciale 已从目录中移除,影响了依赖其低成本处理大批量工作负载的用户。
-
Z.AI 的 GLM 5.1 模型在长时序代理任务中领先,超越竞争对手
Z.AI 发布了其 GLM 5.1 模型,这是一个开源选项,专为长时序代理任务设计,能够自主运行长达 8 小时。据报道,该模型在 SWE-Bench Pro 基准测试中优于 GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro。该公司还提供 GLM 4.5 Air 用于更快、成本更低的日常使用,以及 GLM 5 Turbo 用于中等级别的代理执行,所有这些都可以通过 MCP Agent Studio 访问,…