4090
PulseAugur coverage of 4090 — every cluster mentioning 4090 across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
使用 vLLM 自托管 LLM,云 GPU 成本节省 45%
本指南详细介绍了 2026 年在云 GPU 上使用 vLLM 自托管 LLM 的生产设置,旨在降低自主 AI 代理系统的成本。作者强调了 vLLM 相对于 TGI、SGLang 和 Ollama 等替代方案的优势,重点介绍了其 OpenAI 兼容 API、原生前缀缓存和结构化输出功能。讨论的关键技术包括用于高效 KV 缓存管理的 PagedAttention 和用于更快推理的 EAGLE-3 投机解码,成本分析表明 RunPod Co…
-
Claude AI 诊断出持续存在的 NVIDIA 4090 显卡缺陷
一位用户报告称,Anthropic 的 Claude AI 成功诊断并提供了一个解决方案,解决了其 NVIDIA 4090 显卡上一个持续存在的问题。在多年尝试故障排除均未成功后,该用户转向 Claude,Claude 识别出了问题并生成了代码来创建一个解决方案。此事件凸显了 Claude 在协助进行复杂的硬件诊断和问题解决方面的潜力。
-
Stable Diffusion 用户报告使用新的 H3 Ref2V 模型生成的图像偏暗
一位 Reddit 用户分享了他们使用新的 AI 模型 H3 Ref2V 的体验,并指出了一些图像生成问题。该用户报告称,尽管使用了包括 NVIDIA 4090 GPU 和 64GB RAM 在内的高端配置,但该模型在某些镜头中生成的图像过于黑暗。帖子还提到了具体的技��参数,如 0.9mp 分辨率、er_sde、beta 版本和 25 步,这表明 Stable Diffusion 社区关注技术细节。
-
NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍
一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。
-
MiniMax H3用户寻求VAE优化以加快视频生成速度
Reddit的r/StableDiffusion板块的一位用户正寻求优化MiniMax H3(一款视频生成模型)的生成速度。性能分析表明,变分自编码器(VAE)解码过程占总生成时间的约43%,在高端RTX 4090 GPU上,每15秒视频的生成时间约为5.5分钟。用户已尝试了几种优化方法,包括使用fp8mix VAE和不同的时间分块策略,但改进甚微。他们正在询问是否有可能使用与WanGP设置兼容的更快的VAE,更新CUDA和PyTor…
-
讨论适用于有限硬件的 MiniMax H3 视频 upscale 工作流程
Reddit 上的用户正在讨论使用 MiniMax H3 生成的视频进行 upscale 的工作流程,特别是针对拥有 RTX 4090 等有限硬件的用户。一位用户分享了一个利用 LTX 2.5 x2 upscaler 的工作流程,该工作流程改编了之前的解决方案,以解决帧数限制和内存不足错误。此工作流程旨在提供免费的本地 upscale 解决方案,尽管有人指出其质量尚未达到 Topaz 等商业工具的水平。
-
DeepSeek V4 使用自定义推理引擎在单块 RTX 4090 上高效运行
一位用户成功地在单块 RTX 4090 显卡上实现了 DeepSeek V4 的 flash Q2 量化,并使用了 64 GB RAM。该设置避免了使用 llama.cpp 或 vllm 等常见推理引擎,实现了大约每秒 8 个 token 的速度,由于专家利用需要磁盘读取,速度偶尔会降至每秒 5 个 token。该用户计划发布有关其自定义 ML 编译器和推理引擎 Blaze 的详细信息,该引擎实现了这种高效部署。
-
Glimmer LLM 在 5090 GPU 上实现 233.4 tps,达到 256k 上下文
一款名为 Glimmer 的新模型展示了令人印象深刻的性能,在配备 Dflash 的 5090 GPU 上实现了 233.4 tps。用户报告称,Glimmer 可以在 24GB VRAM 上轻松达到 256k 的上下文窗口,这是 Qwen 等模型难以实现的壮举。这一发展在本地 LLM 社区中引起了极大的兴奋。
-
Kandinsky 5 开放权重需要用户集成,而非仅仅关闭问题
虽然 Kandinsky 5 存储库中的几个运行时问题已被关闭,但这并不保证模型可以在本地运行。该模型的开放权重性质将集成负担转移给了用户,需要仔细考虑特定的管道、操作系统、CUDA 可见性、库版本和内存限制。用户应在尝试完全推理之前进行冒烟测试,以验证其特定配置,而不是仅仅依赖已关闭的问题票据。
-
AI 视频生成 GPU 选择:RTX 5080 对比 3090 对比 Pro 4000
一位 Reddit 用户正在寻求用于 AI 视频生成的 GPU 推荐,不包括 4090 和 5090 型号。他们正在考虑 RTX 5080 16GB、RTX 3090 24GB 和 RTX PRO 4000 Blackwell 24GB,并将选择的显卡与 64GB DDR4 内存搭配。
-
消费级GPU在122B模型上实现高LLM速度,运行速度达37 t/s
Reddit的r/LocalLLaMA子版块上一位用户分享了在消费级硬件上运行大型语言模型的令人印象深刻的基准测试。他们使用Nvidia RTX 4090和RTX 5060 Ti,并将部分层卸载到64GB系统内存,在350亿参数模型(35b a3b)上实现了每秒206个token。更值得注意的是,在类似条件下,一个1220亿参数模型(barium-122)的运行速度达到了每秒37个token,超出了用户的乐观预期。
-
AI爱好者寻求GPU升级建议以运行大型模型
一位用户在 r/LocalLLaMA 子版块上寻求关于升级其GPU设置以适应更大AI模型的建议,特别提到了 DeepSeek V4。他们正在考虑在其现有的双3090配置中添加两块每块配备48GB内存的修改版4090、两块A6000或两块5090。该用户正在寻找关于混合设置的见解,以及哪种选择最能让他们运行需要超过100GB文件空间的模型。
-
元力觉醒发布 DM0.5 具身智能模型,训练数据达 15 万小时
元力觉醒(Force Field Intelligence)发布了其新一代具身智能基础模型 DM0.5,该模型接受了 15 万小时数据的训练。DM0.5 旨在通过整合真实世界场景和开发者平台来解决具身智能领域的数据瓶颈问题。该模型拥有更大的参数规模、更多的数据量以及上下文抽象层和具身思维链任务等架构创新,在 Zero-Shot 泛化能力和微调效率方面取得了显著提升。
-
ai-toolkit 分支加速 Stable Diffusion 训练和渲染
ai-toolkit 的一个优化分支已发布,引入了 transformer quants 的缓存以缩短模型训练的启动时间。此次更新还支持使用本地 ComfyUI 服务器进行更快、更可控的示例图像渲染。这些优化,特别是缓存和本地服务器集成,可以显著缩短渲染时间,一位用户报告称在 4090 GPU 上渲染时间从两分钟缩短到一分钟以内。
-
ComfyUI 获得运行时量化,加速 AI 图像生成
新开发的名为 QuantFunc 的 ComfyUI 节点能够实现 AI 模型的运行时 4 位量化,显著加快推理速度。这使得用户无需预量化模型检查点即可即时应用量化,在 RTX 4090 上使用 Ideogram 4 等模型时速度约提升 4 倍。此外,还发布了 Boogu-Image-0.1-Turbo 模型的 INT8 量化新版本,针对 ComfyUI 进行了优化,以减少 VRAM 使用并提高加载速度,需要自定义节点以在某些 GPU…
-
Eval-awareness direction detects framing, not sandbagging in Llama-3.1
研究人员调查了模型对其正在被评估的意识是否直接导致其表现不佳,这种现象被称为“沙袋效应”(sandbagging)。研究使用了一个欺骗检测工具包,并在 Llama-3.1-8B-Instruct 上进行测试,发现“评估意识”(eval-awareness)方向主要检测的是评估框架本身,而不是因果性地驱动沙袋效应行为。虽然该方向在识别评估情境方面被证明是有效的,但它并未预测或导致沙袋效应的个体实例,这表明这种意识并非故意压低能力行为的直接原因。
-
DiffusionGemma 26B 在 4090 上速度虽快,但准确性和上下文理解能力欠佳
一位 Reddit 用户分享了他们在 4090 GPU 上运行 DiffusionGemma 26B 模型的经验,速度介于每秒 290-700 个 token 之间。然而,他们发现该模型仅限单用户使用,准确性不如标准的 Gemma 模型,并且容易出现上下文遗忘。该用户总结认为,该模型不值得投入精力,因为通过 llama.cpp 运行的常规 26B 模型提供了更好的性能和准确性。
-
Google发布DiffusionGemma,文本生成速度提升4倍的模型
Google发布了DiffusionGemma,一个拥有260亿参数的新型MoE模型,它利用扩散模型进行文本生成,速度比传统的自回归模型快四倍。这种方法并行处理token,类似于图像生成,从而实现更快的推理和更低的内存需求,使其可以在4090 GPU等消费级硬件上本地执行。虽然DiffusionGemma在速度和双向注意力带来的自纠正能力方面表现出色,但目前在质量上落后于标准的Gemma模型,将其定位为面向速度敏感型应用的实验性模型。
-
AI 模型训练的 GPU 租用成本飙升
用于 AI 模型训练的 GPU 租用价格已大幅上涨,目前 4090 的日租金约为 5 美元。以前,租用 GPU 的成本相当于几年内的购买价格,而现在只需几个月。即使是 5070 Ti 等性能较弱的 GPU,租金也异常高昂。
-
AI GPU需求激增,B300价格攀升;旧芯片以旧换新失败
B300等高性能AI GPU需求激增,据报道,一家华东科技巨头计划采购超过10000台,导致价格大幅上涨。与此同时,一家国内制造商先前的旧AI芯片“以旧换新”计划因软件和生态系统成熟度不足而未能获得关注。大型科技公司正在放宽供应商要求,目前主要要求履约保证金和竞业协议,因为市场正从买方市场转向卖方市场。