PulseAugur
实时 15:25:44
实体 mooncake

mooncake

PulseAugur coverage of mooncake — every cluster mentioning mooncake across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_209852 ·

    TPU与Mooncake合作进行推理优化

    SemiAnalysis报道称,张量处理单元(TPU)正与开源推理优化库Mooncake合作。此次合作旨在将TPU的能力集成到Mooncake Store中,从而提高生产推理的总拥有成本效益。初步实现将利用TENT在横向扩展网络上进行KVCache DRAM P2P池化,而不是使用ICI/NVLink。

  2. TOOL · CL_206773 ·

    计算、内存和存储领域探索LLM首次响应时间缩减策略

    减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…

  3. RESEARCH · CL_188615 ·

    AI基础设施演进,整合存储以支持LLM推理

    AI基础设施的格局正从仅关注GPU计算转向更一体化的方法,涉及计算、网络、内存和存储。这种演变是由具有长上下文和复杂推理能力的大型语言模型(LLMs)的需求驱动的,其中KV缓存和MoE专家权重等数据的有效管理变得至关重要。Moonshot AI及其Mooncake系统和NVIDIA及其CMX平台等公司正在引领这一趋势,将推理状态视为一等资源,并优化存储以实时参与token生成。

  4. TOOL · CL_183926 ·

    明玕FX100存储解决方案加速视频推理,降低延迟

    明玕的FX100存储解决方案解决了实时视频推理中的延迟瓶颈,这些瓶颈通常由存储和数据路径限制引起,而非GPU计算能力。该系统采用分层KV缓存方法,将热数据放在GPU HBM中,温数据放在本地NVMe上,冷数据放在NVMe-oF阵列上。该策略显著提高了吞吐量,并减少了长上下文工作负载的首次令牌生成时间(TTFT),吞吐量提升高达40%,TTFT提升32%。

  5. TOOL · CL_178265 ·

    新研究通过拓扑感知数据移动优化解耦LLM推理

    一篇新研究论文介绍了一个拓扑感知数据移动系统,旨在优化解耦LLM推理。该系统通过发现互连层级和选择最优传输方法来解决在独立GPU池之间传输KV缓存的挑战。它采用了流水线式逐层传输、面向混合专家模型的NVLink域感知放置以及CXL 3.0内存扩展器,以显著降低传输延迟。

  6. SIGNIFICANT · CL_173979 ·

    Moonshot AI 开源 Kimi K3,估值达 315 亿美元 · 追踪 2 个来源

    Moonshot AI 已完全开源其 Kimi K3 模型,这是一个拥有 2.8T 参数的模型,并公布了其背后的 401 名贡献者。此次发布恰逢公司估值飙升至 315 亿美元,每位员工的价值约为 7 亿人民币。文章详细介绍了联合创始人周昕宇、吴宇鑫、张钰涛以及工程负责人徐欣然和何伟然等关键人物的背景和贡献,强调了他们在模型架构、优化和基础设施等领域的专业知识。

  7. SIGNIFICANT · CL_164703 ·

    Moonshot AI 发布 Kimi K3,拥有 100 万上下文,驱动 Agentic Slides · 跟踪 1 个来源

    Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数和 100 万 token 上下文窗口的新旗舰模型。该模型驱动 Kimi Agentic Slides 工具,该工具可从各种文档格式生成演示文稿,并支持自定义模板。Kimi K3 模型在前端编码基准测试中表现出色,根据 Arena.ai 的数据,在全球排名第一,总体排名第三。Moonshot AI 是一家总部位于北京的公司,成立于 2023 年,已获得巨额融…

  8. TOOL · CL_158968 ·

    秋晶科技设立华东总部,计划打造万卡级AI算力卡工厂

    专注于AI算力卡生产服务的秋晶科技已在杭州钱江世纪城设立其华东区域总部。该公司计划在五年内建成一座万卡级高品质AI算力卡工厂。此次扩张旨在利用当地的产业生态和基础设施,增强其服务区域内企业级AI推理需求的能力。

  9. SIGNIFICANT · CL_55057 ·

    阿里巴巴的Qwen3.5在代理工作负载上达到创纪录的580 tps

    阿里巴巴的Qwen团队在TokenSpeed引擎上为代理工作负载创造了每秒580万亿个token的新纪录。这一显著的性能提升是在几家关键合作伙伴的帮助下实现的。这一成就凸显了AI模型在复杂任务效率方面的进步。

  10. RESEARCH · CL_31391 ·

    摩尔线程联合开源AI开发者社区,共建MUSA GPU生态

    中国GPU制造商摩尔线程召集了一场关于将其MUSA架构与SGLang等关键开源大模型推理框架集成的交流会。此次活动汇集了SGLang、TileLang和Mooncake等项目的核心开发者,标志着国内GPU行业正从硬件规格转向生态系统开发。摩尔线程旨在使其GPU无缝融入大模型部署的主流开源工程流程,强调与开发者的兼容性和易集成性。