GLM-4.7
PulseAugur coverage of GLM-4.7 — every cluster mentioning GLM-4.7 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
通过统一网关在全球范围内访问中文大语言模型
一份新指南详细介绍了开发者如何在中国境外访问Qwen、DeepSeek和GLM等中文大语言模型,并绕过高延迟和区域访问限制等常见问题。该解决方案涉及使用统一的、兼容OpenAI的网关服务,例如TideLink,该服务负责区域路由和故障转移。这种方法允许用户在访问各种模型时保持单一API密钥和请求格式,并为通用任务推荐Qwen 3,为推理推荐DeepSeek-R1,为长篇中文文档推荐GLM-4。
-
中国大语言模型提供成本效益高、专业化的功能,统一的API访问简化了集成
来自阿里巴巴、DeepSeek和智谱等公司的中国大语言模型正成为美国模型强大且经济高效的替代品。这些模型在处理中文文档的RAG、支持工具调用的多语言智能体能力、细致的翻译以及代码生成(尤其是在处理中文注释时)等特定任务方面表现出色。尽管它们功能强大,但由于地区限制和计费问题,访问这些模型可能具有挑战性,但TideLink等服务提供了与OpenAI兼容的统一API,为全球开发者的集成提供了便利。
-
新研究揭示了 token 嵌入中的几何偏差及其对语言模型训练的影响
三篇新的 arXiv 论文探讨了语言模型中 token 嵌入的几何和统计特性。第一篇论文在 token 嵌入表的原点附近发现了一个“短行中心”,它会夸大内在维度估计值,并表明移除该中心可以使 GPT-2、K3 和 GLM-4.7 等模型的维度读数更加一致。第二篇论文引入了“上下文阶梯”概念,描述了嵌入如何随着训练的进展逐步学习更复杂、依赖于上下文的统计特征。第三篇论文开发了一个将 token 预测与表示几何联系起来的统计框架,展示了预…
-
中国AI模型Glm 4瞄准Azure、AWS等美国云平台
据报道,中国AI公司智谱AI正与包括Azure、Amazon Web Services和Google Cloud在内的美国主要云平台洽谈托管其Glm 4模型事宜。此举将标志着中国AI模型首次在美国本土服务上可用,智谱AI的目标是从其部署中获得收入分成。该公司也是OpenAI和Anthropic等知名AI公司的竞争对手。
-
AI评估数据集被发现存在缺陷,颠倒了模型性能结论
一项红队演练揭示了AI模型评估数据集中存在重大缺陷,其中6个所谓的“错误”事实中有4个实际上是真的。这种错误标记颠倒了涉及Qwen3.7 Flash、DeepSeek-V4 Flash和GLM-4.7 Flash模型的实验结论。调查发现,证据格式而非模型本身是性能的主要驱动因素,并且评估流程的每一层,包括地面真实性和模型解释,都可能提供不正确的信息。
-
开发者为15款中国AI模型构建了兼容OpenAI的网关
一位开发者使用单个Python文件、FastAPI和各种中国AI模型创建了一个兼容OpenAI的API网关。该网关允许用户通过统一的兼容OpenAI的端点访问DeepSeek、阿里云的Qwen、智谱AI的Glm 4和月之暗面等提供商的15种不同模型。该架构包括身份验证、速率限制、令牌配额管理、流式响应、缓存和可观测性等功能,开发者强调了这些生产级功能层除了核心转发逻辑之外所需的巨大努力。
-
开发者通过单一API集成4个大语言模型,降低成本并增强功能
一位开发者已成功将多个大语言模型(LLMs)集成到其代码库中,允许根据任务需求进行动态路由。通过使用单一API端点和Python SDK,开发者现在可以在DeepSeek、Qwen、Glm 4和Kimi K3等模型之间切换,每个模型都因其特定优势而被选中,例如成本效益、多语言能力、复杂推理或大上下文窗口。这种方法通过将简单任务导向更便宜的模型,同时为复杂操作保留强大且昂贵的模型,从而显著降低了成本。
-
研究发现,开放权重模型在金融文本理解方面表现出竞争力
一项新研究使用更新后的Financial Touchstone基准测试了开放权重语言模型在金融文本理解方面的能力,该基准包含来自国际年报的近3000个问答对。研究发现,虽然Anthropic的Claude Opus 4.6准确率最高,Google的Gemini 2.5 Pro幻觉率最低,但Kimi K2.6和GLM 5等几款开放权重模型表现出了竞争力。研究还强调,信息检索是一个重要的瓶颈,并指出一些中国模型中的地缘政治内容过滤器可能会…
-
中国公布人工智能、太空和材料科学重大突破
中国宣布在人工智能、太空和材料科学等多个领域取得了一系列重大技术进步。关键进展包括华为的盘古3.0、百度的ERNIE 4.0、阿里巴巴的通义千问2.0、智谱AI的Glm 4以及腾讯的混元模型等新人工智能模型。该国还公布了高端钢材生产和人工智能驱动的实验卫星方面的突破,旨在减少对外国技术的依赖并重塑市场格局。
-
大型语言模型能模拟出合理的患者,但无法代表真实人群
arXiv上发表的一项新研究表明,大型语言模型在被要求模拟心理健康患者时,能够生成个体上合理的病例,但无法代表真实的人群。研究人员测试了GPT-4o mini、Gemini 3 Flash、DeepSeek-V3和GLM-4.7等模型根据人口群体生成患者档案的能力。虽然个体患者模拟在很大程度上符合诊断标准,但聚合后的人群却显示出显著的偏差,包括症状评分虚高、人口统计学差异扭曲以及患者数据再生不稳定。研究人员将这种差异称为“连贯性-保真度分离”。
-
中国 AI 实验室在原生多模态前沿模型训练上出现分歧
中国 AI 实验室正根据原生多模态能力来区分其前沿模型。Moonshot AI 的 Kimi K3 和阿里巴巴的 Qwen3.8-Max 正在采用原生多模态训练,为复杂的代理任务定位。相比之下,DeepSeek V4、智谱 AI 的 Glm 4 和腾讯的 Hunyuan 仍仅支持文本,可能在未来的发展中落后。
-
中国AI实验室在分发之外追求独特策略
来自蚂蚁集团Ling模型部门的一位人士发文,强调了中国主要AI实验室所采用的独特策略。与普遍认为的中国AI行业铁板一块不同,阿里巴巴(Qwen)等公司专注于广泛分发,DeepSeek强调开放架构和即时权重发布,而Moonshot则追求长期架构押注。作者所在的蚂蚁集团实验室,通过其Ling-3.0-flash模型优先考虑为长周期代理循环提供成本效益,尽管他们承认发布顺序不理想,延迟了公众获取权重的时机。
-
LLM 温度 0.0 在长上下文导致高失败率,研究发现
一项于三月份发表的题为“LLM 在文档问答场景中会产生多少幻觉?一项跨越温度、上下文长度和硬件平台的 1720 亿 Token 研究”的最新研究,调查了温度设置对大型语言模型的影响。研究发现,在生产代码中常用的温度设置为 0.0 时,可能会导致不可用响应的显著增加,尤其是在长上下文长度的情况下。例如,在 128K 上下文中,Llama 3.1 8B 模型的温度设置为 0.0 时的失败率为 14.05%,而温度设置为 1.0 时仅为 2…
-
AsymVerify 系统在检测政治规避方面取得高准确率
一篇研究论文详细介绍了 AsymVerify 系统,该系统旨在检测文本中的政治规避,在 SemEval-2026 Task 6 的评估集上取得了 0.85 的 Macro F1 分数。该系统采用了一种不对称置信门控验证方法,根据置信度级别选择性地升级或降级分类,以提高在模糊边界上的准确性。这种方法与单次分类相比显示出显著的优势,并提升了各种大型语言模型的性能。
-
阿里巴巴推出Qwen大语言模型,加剧中国AI竞赛
阿里巴巴集团已推出其Qwen大语言模型,这是中国快速发展的AI领域的一项重要进展。此举使阿里巴巴跻身于百度、腾讯和智谱AI等其他中国主要科技公司之列,这些公司都在开发自己的强大AI模型。Qwen的推出标志着这些科技巨头在中国开发和部署先进AI技术方面展开了竞争。
-
DeepSeek、GLM 和 Qwen:免费API使用的中国LLM对比
三家领先的中国AI实验室,DeepSeek、智谱AI(GLM)和阿里云(Qwen),提供强大的免费LLM API,可满足不同的项目需求。DeepSeek-V2 采用混合专家模型(Mixture-of-Experts)架构,提供最慷慨的免费每日配额,并在长上下文推理方面表现出色,非常适合高流量、成本敏感型项目。GLM-4 是一款密集型Transformer模型,在中文任务和工具调用方面表现优越,适用于面向中国市场的应用。Qwen2.5-…
-
美国初创公司因国内成本高昂转向更便宜的中国AI模型 · 追踪5个来源
由于美国AI开发成本高昂,初创公司越来越多地选择成本较低的中国AI模型。公司发现中国模型能为他们的AI需求提供更经济实惠的替代方案。这一趋势凸显了AI市场中由成本考量驱动的日益增长的全球动态。
-
新工具包评估AI交易代理是否盈利
一项新的研究论文介绍了一个名为TradeLens的诊断工具包,旨在评估大型语言模型(LLM)代理在交易系统中的财务可行性。该工具包分析交易记录、运行时跟踪和部署配置,以确定代理的运营成本是否被其交易利润所抵消。研究发现,将智能转化为利润至关重要,像DeepSeek V3.2和GLM-4.7这样的特定模型分别在新资产选择和交易时机方面表现出独特的失败模式。这项研究将代理评估从性能排名重新定义为对经济可行性的基于跟踪的诊断。
-
Qwen3-Coder 32B 在2026年领先本地AI编码模型
Qwen3-Coder 32B 模型已成为2026年顶级的本地编码助手,其性能可与 Claude Sonnet 4 和 GPT-4o 等云端解决方案相媲美。该模型由阿里巴巴的 Qwen 系列微调,HumanEval 得分为91.4%,可在 RTX 3090 GPU 等消费级硬件上运行,约需20GB显存。对于显存较小的用户,也提供了 Qwen3-Coder 14B 和 8B 等较小版本,提供了可行的本地AI解决方案,优先考虑数据隐私并免…
-
本地大模型实现新能力,可与云端模型相媲美
本地大语言模型(LLM)的格局已发生巨大变化,使得强大的模型可以在消费级硬件上运行。此前,在本地运行能力强的模型速度太慢且不准确,迫使用户依赖在线推理服务商。然而,新的Qwen模型,如Qwen3.6-27B和Qwen-Coder-Next-80B,现在即使在拥有16GB显存的系统上,也能提供与Claude 4.5 Opus等领先的云端模型相媲美的性能和准确性。llama.cpp的实验性路由模式等工具的进步,通过实现动态模型切换和上下文…