PulseAugur
中
实时 18:00:32
实体 Granite-4.0

Granite-4.0

PulseAugur coverage of Granite-4.0 — every cluster mentioning Granite-4.0 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_224663 ·

    Granite 4.2 实现 2.2 倍的微调速度提升

    本文探讨了 Granite 4.2 的性能改进,详细说明了它如何实现比前代产品快 2.2 倍的微调速度。分析深入研究了导致这种效率提升的根本因素,重点关注训练损失、内存利用率和整体性能指标。文章展示了 Granite 4.0 和 Granite 4.2 的基准测试比较,以说明这些收益。

  2. TOOL · CL_213223 ·

    斯坦福论文发现:小型语言模型挑战云端AI主导地位

    斯坦福大学的一项最新研究论文表明,小型语言模型(SLMs)在多项任务上正变得与大型云端前沿模型相媲美。研究发现,可在本地硬件上运行的SLMs在98.6%的聊天任务和62.5%的推理任务中,表现与大型语言模型(LLMs)相当或更优,并且在过去两年中推理能力有了显著提升。这一趋势可能大大降低对大型数据中心的需求,并可能影响AWS、Azure和Google Cloud等超大规模云服务提供商,以及Nvidia等GPU制造商,还有基础模型公司的估值。

  3. COMMENTARY · CL_114849 ·

    LLM、SLM 和前沿模型:理解人工智能语言模型类别

    本文区分了小型语言模型 (SLM)、大型语言模型 (LLM) 和前沿模型 (FM),阐明了它们的角色和应用。LLM 被描述为具有广泛知识和复杂对话能力的通才,通常需要大量的计算资源。SLM 被呈现为高效的专家,能够以更低的成本在文档分类或摘要等专注任务中匹配甚至超越 LLM。前沿模型代表了最先进、功能最强大的类别,其特点是拥有海量参数和卓越的复杂任务推理能力,例如 Claude Sonnet 和 Opus、GPT-5 和 Gemini Pro。

  4. TOOL · CL_82631 ·

    CodeAlchemy 为 AI 训练生成超过 5000 亿个 token 的合成代码

    研究人员开发了 CodeAlchemy,一个用于生成大规模合成代码数据以改进 AI 模型训练的框架。该系统采用了五种策略,包括代码重写、问答、开发者任务、对话交流和执行跟踪,生成了超过 5000 亿个 token 的合成代码和 3500 亿个推理 token。这个庞大的数据集旨在解决当前模型在理解真实世界代码任务方面的局限性,新的基准测试如 DevEval 和 TraceEval 突显了即使是前沿模型在语义理解方面也存在显著差距。

  5. RESEARCH · CL_09211 ·

    IBM 发布 Granite 4.1 LLMs,支持 512K 上下文并采用 Apache 2.0 许可

    IBM 发布了 Granite 4.1 系列大型语言模型,包含 3B、8B 和 30B 参数版本。这些模型通过包含将上下文窗口扩展到 512K 标记的五阶段预训练过程,在约 15 万亿个标记上进行了训练。进一步的优化包括在精选数据上进行监督微调和强化学习。值得注意的是,8B 指令模型取得了与更大的 Granite 4.0 MoE 模型相当的性能,并且所有 Granite 4.1 模型均根据 Apache 2.0 许可提供。