一款新的大型语言模型 GigaChat-3.5 Reasoning 已发布。该模型采用 432B-A28B 混合专家(MoE)架构,并配备 Gated DeltaNet 以实现高效的长上下文处理。它使用领域专家进行训练,并蒸馏成单个模型,据报道其推理性能接近 DeepSeek V4 Flash Preview,但使用的 token 数量显著减少。 AI
影响 此次发布为寻求高效长上下文处理和潜在竞争性推理能力的用户提供了一个新选择。
排序理由 前沿实验室发布新模型。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →