PulseAugur
实时 03:04:45
实体 RunPod

RunPod

PulseAugur coverage of RunPod — every cluster mentioning RunPod across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 37
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
关系
时间线
  1. 2026-07-08 product_launch RunPod has opened up more capacity on H100s and RTX 6000 Pros, offering them at discounted rates for a limited time. 来源
  2. 2026-06-24 funding RunPod raised $100 million and achieved a $1 billion valuation. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/2 页 · 共 37 条
  1. TOOL · CL_213992 ·

    用户寻求在RunPod上运行MiniMax H3的性能基准

    一位Reddit用户正在寻求在云GPU提供商RunPod上运行MiniMax H3模型的实际性能基准。他们特别关注在768p分辨率下每小时可以生成多少个16:9的视频。该用户还询问了其他人用于实现更快生成速度的具体GPU配置、INT8量化或块卸载等优化技术以及ComfyUI技巧。

  2. RESEARCH · CL_165339 ·

    新方法无需直接测量即可估算 GPU 上 LLM 推理的能耗

    arXiv 上的一篇新研究论文提出了一种分析方法,用于估算在 NVIDIA H100 等 GPU 上运行的大型语言模型 (LLM) 推理的能耗。该方法旨在提供一种无需直接硬件遥测即可近似估算能源使用量的方法,这对于比较研究和系统设计非常有用。该方法将能耗分解为计算、内存访问和注意力机制等组成部分,并区分了提示预填充和自回归解码阶段。

  3. TOOL · CL_160119 ·

    依赖感知缓存解决了多 LoRA 服务延迟问题

    初创公司为满足特定客户需求而微调大型语言模型时,常常面临不断增长的基础设施成本。一种常见的解决方案是使用多 LoRA 服务,它允许多个微调适配器在单个 GPU 上运行。然而,粗糙的实现会导致 LoRA 权重和 KV 缓存之间的缓存颠簸,从而导致高延迟。通过实现依赖感知缓存管理,将 KV 缓存视为依赖于其特定 LoRA 适配器,可以显著降低延迟。

  4. TOOL · CL_155611 ·

    RunPod MCP 与 Claude 集成获 Stable Diffusion 用户好评

    Reddit r/StableDiffusion 版块的一位用户分享了他们在使用 RunPod 的托管云平台 (MCP) 结合 Claude 时的积极体验。他们强调了 Claude 在设置图像和视频生成、模型训练以及工作流管理容器方面的效率,称其为在 ComfyUI 工作流之上进行批量迭代和脚本执行的快速且有用的工具。

  5. TOOL · CL_151553 ·

    LLM云GPU租赁指南:按模型大小优化成本

    2026年运行大型语言模型(LLM)的最佳云GPU租赁方案取决于具体的模型大小和工作负载,重点在于每美元的token数而非每小时费率。对于较小的模型(7B-13B),推荐使用经济实惠的RTX 4090;而34B模型则适合使用48GB显卡的RTX 6000 Ada或A100 80GB。较大的70B模型可使用A100或H100 GPU,而两个RTX 4090是更具成本效益的替代方案。对于前沿模型或长上下文窗口,H200和B200 GPU提…

  6. TOOL · CL_150643 ·

    RunPod 用户获得 Chrome 扩展程序以获取已保存 Pod 可用性警报

    一位 Reddit 用户开发了一款名为 PodScout 的 Chrome 扩展程序,以解决 RunPod 平台上已保存 Pod 不可用的问题。该工具会在用户保存的 Pod 可用时向用户发出警报,并可以自动启动它们,旨在为训练图像模型用户节省时间并防止环境设置问题。开发者正在寻求经常使用多个已保存 Pod 的其他 RunPod 用户的反馈。

  7. TOOL · CL_145400 ·

    GPU指南:Qwen 2.5和Llama 3模型需要高端硬件

    Qwen 2.5和Llama 3模型系列提供多种尺寸,并为本地部署提供了具体的GPU推荐。对于Qwen 2.5 7B或Llama 3 8B等较小模型,RTX 4060 Ti 16GB足以获得良好性能和量化效果。Qwen 2.5 32B或Llama 3 70B等更大模型需要更强大的硬件,如RTX 4090甚至双RTX 4090,而RTX 5090是最大型号的高端选择。

  8. TOOL · CL_142469 ·

    开发者训练 AI 使用 Qwen3.6 来训练其他 AI 模型

    一位开发者创建了一个 AI 系统,该系统可以训练其他 AI 模型,并使用 Qwen3.6 模型作为主要代理。该代理负责生成完整的训练任务,包括环境、奖励、数据集和超参数,然后这些任务在 GPU 上执行。代理根据其训练的模型性能的提升获得奖励,形成一个嵌套的 AI 训练循环。

  9. TOOL · CL_142327 ·

    MedGemma-1.5-4B 使用 llm-compressor 量化到 INT4

    一份技术指南详细介绍了使用 llm-compressor 库将 Google 的 MedGemma-1.5-4B 医学视觉语言模型量化到 INT4 (W4A16) 的过程。作者遇到了并解决了几个问题,包括 AutoAWQ 的弃用以及与 Gemma3 架构的兼容性问题。该指南提供了设置环境、加载模型、准备校准数据集和运行量化过程的具体步骤,最终将模型的自托管部署大小从 8.6 GB 减少到 5.2 GB。

  10. TOOL · CL_140564 ·

    GPUHedge工具大幅缩短无服务器GPU冷启动延迟

    一款名为GPUHedge的新开源工具已被开发出来,以缓解无服务器GPU提供商的冷启动延迟问题。该工具通过在多个提供商之间推测性地执行请求,取消失败的任务,并选择第一个成功的结果来发挥作用。基准测试表明,GPUHedge可以将p95延迟从116.6秒降低到29.4秒,消除超过60秒的请求,同时还能降低活跃计算成本。

  11. TOOL · CL_142084 ·

    新的IC-LoRA适配器支持从自定义视角重新渲染视频

    一款名为LTX-Video 2.3 22B的新型In-Context LoRA (IC-LoRA) 适配器已发布,它使用户能够从不同摄像机角度重新渲染视频场景。该适配器通过接收一个参考视频和一个特定的摄像机视角提示,然后在保持原始主体和内容的同时生成新的视角。该模型在合成多视图数据上进行了训练,目前已演示用于ComfyUI,并提供用于控制摄像机位置和仰角的特定提示词汇。

  12. TOOL · CL_132644 ·

    RunPod GPU性能差异影响AI训练成本

    Reddit的r/StableDiffusion子版块上一位用户报告称,在使用RunPod的GPU实例时遇到了性能不一致的问题。该用户观察到,即使使用相同的GPU型号(RTX 5090)并在不同日期使用相同的设置,模型训练的每秒迭代次数也存在显著差异。这种不一致性影响了为AI模型开发租用GPU时间的成本效益。

  13. TOOL · CL_132126 ·

    RunPod 限时优惠 H100 和 RTX 6000 Pro GPU

    RunPod 增加了其GPU容量,并限时提供NVIDIA H100 SXM和RTX PRO 6000实例的折扣价格。H100 SXM现价为每小时 $2.99,低于原价 $3.29;RTX PRO 6000现价为每小时 $1.99,低于原价 $2.09。

  14. TOOL · CL_124817 ·

    新工具涌现,简化 ComfyUI 的 AI 图像生成流程

    一款名为 Noofy 的新开源应用程序已被开发出来,旨在简化 ComfyUI 在 AI 图像生成中的使用。Noofy 提供了一个用户友好的仪表板界面,隐藏了 ComfyUI 节点系统的复杂性,允许用户轻松调整提示词、模型和风格等参数。此外,一个名为 rentcompute.net 的新平台已作为 RunPod 的替代品推出,专门面向 ComfyUI 用户,提供 ComfyUI 实例的一键部署,并允许用户列出自己的闲置 GPU。

  15. TOOL · CL_111833 ·

    Google Colab CLI 推出面向终端 AI 代理

    Google 发布了 Google Colaboratory 的新命令行界面 (CLI) 工具,使基于终端的 AI 代理能够访问 GPU 和 TPU。该工具在 Apache-2.0 许可下可用,允许 Claude Code 和 Codex 等代理在无需浏览器或 Jupyter 内核的情况下运行训练和推理任务。虽然它为一次性任务提供了访问加速器的经济高效的方式,但用户必须注意身份验证设置以及空闲会话可能产生费用的可能性。

  16. TOOL · CL_110902 ·

    用户质疑 fal.ai 在“Wan”模型上比 RunPod 速度更快

    一位 Reddit 用户正在询问在 fal.ai 上运行“Wan”模型与在 RunPod 上运行的速度差异。用户注意到 fal.ai 大约需要 60 秒就能生成一个 3 秒的视频,而尝试在 RunPod H100 实例上运行相同的模型则花费了更长的时间,大约 500 秒。他们想了解这种差异是由于 fal.ai 平台的优化,还是他们在 RunPod 上的设置有误。

  17. SIGNIFICANT · CL_110171 ·

    Alibaba 的 Qwen3.6-35B-A3B 模型在 24GB GPU 上提供高效的 35B 知识

    Alibaba 的 Qwen 团队发布的 Qwen3.6-35B-A3B 模型采用了稀疏专家混合(MoE)架构,使其能够以 3B 参数模型的效率运行,同时保留 35B 参数模型的知识。这种设计显著降低了显存需求,使其有可能通过量化在单个 24GB GPU 上运行,尽管由于 KV 缓存增长,长上下文长度仍然可能对内存造成压力。该模型根据 Apache 2.0 许可发布,可用于不受限制的商业用途,并可以使用 Ollama 进行本地设置,提…

  18. SIGNIFICANT · CL_110172 ·

    阿里巴巴的 Qwen3-Coder-Next 在 SWE-bench 上达到 70.6%,采用高效 MoE 架构

    Qwen3-Coder-Next 模型是阿里巴巴 Qwen 团队推出的一个拥有 800 亿参数的混合专家(Mixture-of-Experts)模型,在 SWE-bench Verified 基准测试中取得了 70.6% 的成绩,展示了令人印象深刻的效率,每次推理仅激活约 30 亿参数。这使其能够提供与前沿编码助手相当的性能,同时所需的硬件资源与 70 亿参数模型相似。该模型支持 256K 上下文窗口,适用于复杂的编码任务,并且可以使…

  19. RESEARCH · CL_109083 ·

    RunPod 融资 1 亿美元,AI 云服务估值达 10 亿美元

    RunPod 是一家专注于 AI 计算能力租赁的云初创公司,已获得 1 亿美元融资,估值达到 10 亿美元。这标志着该公司在不到两年的时间内估值增长了十倍。据报道,RunPod 还拒绝了超过 5 亿美元的收购要约。

  20. TOOL · CL_104500 ·

    智谱AI的GLM-5.2模型已部署在无服务器GPU上

    智谱AI发布了GLM-5.2,一个拥有7000亿参数的混合专家模型(MoE),在复杂推理和软件工程任务方面表现出色,据报道在某些基准测试中能媲美甚至超越Claude 3.5 Sonnet和GPT-4o等专有模型。由于其庞大的权重和上下文窗口,部署这个大型模型需要一个8x NVIDIA H200 GPU集群,这带来了显著的基础设施挑战。文章详细介绍了在无服务器GPU平台Modal上部署GLM-5.2的案例研究,强调了FP8量化在内存效率…