5090
PulseAugur coverage of 5090 — every cluster mentioning 5090 across labs, papers, and developer communities, ranked by signal.
- 2026-08-27 product_launch The NVIDIA RTX 5090 graphics card has been officially priced at $5090. 来源
11 天有情绪数据
-
NInfer 分叉将 LLM 上下文提升至 555k,采用 4 位 KV 缓存
NInfer 项目的一个分叉已被开发出来,为大型语言模型的上下文长度和内存管理带来了显著的改进。该分叉采用自定义的 4 位 KV 缓存,可在不损失质量的情况下将 VRAM 使用量减少 45%,并通过 LongBench 和 AIME 等基准测试得到验证。它还将 Qwen 等模型的上下文窗口扩展到 555k token 以上,并预计在高 端 GPU 上可达 800 万 token。该项目增强了多级前缀重用,并实现了一个强大的主机 KV …
-
企业需求推高 DGX Spark 和 5090 价格
高端计算组件 DGX Spark 的价格正在上涨,这与 5090 出现的类似趋势相呼应。成本的飙升归因于大型企业的显著需求,引发了对二手硬件未来可用性和可负担性的猜测。
-
NInfer 将本地 LLM 性能在 5090 GPU 上提升至 220 tokens/sec
Reddit r/LocalLLaMA 版块的一位用户分享了他们使用 NInfer 和 5090 GPU 运行 270 亿参数模型的积极体验。他们报告称吞吐量显著提高,平均速度为每秒 170-220 个 token,这比他们使用 llama.cpp 的体验快了一倍多。该用户详细介绍了他们的具体设置,包括使用的命令以及模型服务、上下文长度和量化等各种参数。
-
NVIDIA RTX 5090 定价 5090 美元,引发用户担忧
NVIDIA RTX 5090 显卡已正式定价 5090 美元,大幅上涨,导致一些用户重新考虑其硬件选择。一位用户指出,以 5090 的价格,他们可以选择配备 256GB RAM 的 M5 Ultra Mac Studio。这一定价引起了那些希望构建或升级系统以进行本地大型语言模型 (LLM) 推理的用户担忧。
-
Gigabyte Aorus Master 16 OLED 游戏笔记本电脑配备 RTX 5090,降价 800 美元至 3,599 美元
一款 Gigabyte Aorus Master 16 游戏笔记本电脑,配备 OLED 显示屏、Intel Arrow Lake CPU 和 RTX 5090 移动 GPU,售价为 3,599 美元,比原价便宜 800 美元。这款高性能笔记本电脑配备 32GB RAM、2TB SSD,以及 Wi-Fi 7 和 Thunderbolt 5 等高级连接选项。它旨在提供顶级游戏体验,RTX 5090 GPU 能够以高帧率和高分辨率运行要求严苛的游戏。
-
DFlash2 在 Qwen3.8 27B 上显示速度提升但内存使用增加
一位用户在 RTX 5090 GPU 上使用 Qwen3.8 27B 模型测试了 DFlash2,这是一种加速大型语言模型推理的新方法。虽然 DFlash2 显示出速度提升,尤其是在代码生成方面,在短时间内可达 200 tokens/秒,但它也比 MTP 等先前方法更占用内存。用户指出,内存使用量的增加限制了上下文窗口的大小,尽管性能有所提高,但可能使其在特定用例中不太实用。
-
Genie世界模型在单块消费级GPU上以16FPS运行720p
一个名为“Genie”的新世界模型已被演示,它能够在单块消费级GPU上以720p分辨率和16帧每秒的速度运行。该模型使用19GB显存,使得拥有高端个人硬件的用户可以访问。该项目似乎是一项开源工作,并提供了arXiv论文的链接。
-
Qwen3.8-27B 模型使用 NInfer 引擎在单张 RTX 5090 上达到 880 tok/s
一位用户在使用单张 RTX 5090 GPU 运行 Qwen3.8-27B 模型时取得了令人印象深刻的性能,在 4 位 NVFP4 量化和完整的 262k 上下文下达到了每秒 880 个 token。该速度是通过使用 NInfer 引擎实现的,用户报告称其比 llama.cpp 等其他引擎快得多。基准测试结果表明,这款 NVFP4 量化模型在 HumanEval+ 和 AIME 等任务上的表现与整数量化版本相当,同时速度却显著更快。
-
Minimax H3 在 DGX Spark 上实现高效视频生成,用户寻求替代方案
一位 Reddit 用户分享了他们在 DGX Spark 上运行 Minimax H3 模型,并实现了令人印象深刻的速度和成本效益的视频生成体验。他们报告称,通过优化,生成一个 5 秒的视频片段仅需 203 秒,成本仅为每段 0.00135 美元。尽管取得了这些积极成果,但用户指出其他人建议不要在 DGX Spark 上进行视频生成,并正在寻求关于是否存在更优价格/性能选项的意见,特别是询问 5090 GPU 在相同设置下的性能。
-
GPU性能预测:到2030年比5090快3倍?
Reddit的r/LocalLLaMA论坛上的一场讨论推测了未来GPU性能的增长。根据自2009年以来平均50%的代际飞跃,参与者预测到2030年GPU的性能将是5090的三倍。讨论探讨了各种情景,包括最佳情况(每代提升70%,约2029年)、历史平均水平(每代提升50.3%,约2030-2031年)、现代平均水平(每代提升46.1%,约2032年)和最坏情况(每代提升30%,约2038年)的性能增长。
-
AI一天内在本地生成完整《星际迷航》剧集
一位用户使用MiniMax H3模型在5090显卡上,在一天内于本地创建了一集完整的《星际迷航:下一代》。该项目生成了原生对话和音频,无需依赖单独的文本转语音或唇形同步流程。创作者分享了该过程的见解,强调了提示结构和模型内部生成对于角色一致性的重要性。
-
Muse Glimmer 30B 模型在 RTX 5090 上达到 253 t/s 优化性能
Reddit r/LocalLLaMA 子版块的一位用户分享了 Muse Glimmer 30B 模型令人印象深刻的性能基准测试,在 RTX 5090 GPU 上实现了每秒 253 个 token。该速度是通过使用特定的量化方法 (UD-Q5_K_M) 和一个将 DFlash draft argmax 从 CPU 移至 GPU 的 draft PR (#26842) 实现的,从而解决了瓶颈问题。用户指出,此优化与 Meta 公布的速度…
-
Glimmer LLM 在 5090 GPU 上实现 233.4 tps,达到 256k 上下文
一款名为 Glimmer 的新模型展示了令人印象深刻的性能,在配备 Dflash 的 5090 GPU 上实现了 233.4 tps。用户报告称,Glimmer 可以在 24GB VRAM 上轻松达到 256k 的上下文窗口,这是 Qwen 等模型难以实现的壮举。这一发展在本地 LLM 社区中引起了极大的兴奋。
-
H3 Turbo LoRA 在 RTX 5090 上实现快速 0.5MP 视频生成
一位 Reddit 用户分享了他们使用 Stable Diffusion 的 H3 Turbo LoRA 的经验,在 RTX 5090 GPU 上,仅用 29 秒就成功生成了 5 秒的 0.5 兆像素视频。该用户提供了技巧和设置,供他人参考和复制这些结果,并指出该 LoRA 仍处于开发阶段,但能够快速生成高质量的输出。他们还提到正在测试一个与该 LoRA 结合使用的新 lightx2v 节点。
-
用户使用本地硬件上的 MiniMax H3 R2V 创建短片
一位用户使用 MiniMax H3 R2V 模型在本地的 5090 显卡上创建了一个短片。该过程包括为角色、对象和环境生成可重用的参考,然后使用 H3 R2V 结合特定动作和摄像机移动的提示来制作单个场景。用户还为电影的时长生成了一个 Suno 分数,并对最终视频进行了升级,并指出整个工作流程都在移动设备上管理。
-
RTX 5090 降低功率限制可将推理性能损失降至最低
r/LocalLLaMA 上的一位用户分享了关于为 AI 推理降低 NVIDIA RTX 5090 显卡功率限制的发现。通过将功率限制降低到 480W,该显卡在解码方面仅出现约 2.1% 的可忽略不计的性能下降,在预填充方面下降约 8.8%,同时显著降低了噪音、热量输出和功耗。对于关心其推理机器运行环境的用户来说,这种优化被认为是一项值得的权衡。
-
用户寻求关于高端 GPU 工作站双电源设置的建议
Reddit 的 r/LocalLLaMA 论坛上一名用户正在寻求关于为高端工作站配置双电源单元(PSU)设置的建议。该用户计划安装多块强大的 GPU,如 RTX Pro 6000 和 5090,以及 Threadripper Pro 9975WX CPU,这需要大约 2,400W 的巨大功率。由于无法获得 240V 电源,用户正在考虑使用两个 1600W 的 MSI MPG 电源,每个电源连接到一个专用的 15A 电路和一个 190…
-
Krea2 用户寻求 RTX 5090 配置的 VRAM 优化技巧
一位 Reddit 用户正在就如何在 RTX 5090 显卡上优化 Krea2(一种扩散模型)的配置寻求建议。他们遇到了 VRAM 限制,需要为每次生成从磁盘重新加载文本编码器,这减慢了过程。用户正在寻求关于量化文本编码器、允许模型和文本编码器同时驻留在 VRAM 中的替代配置以及 Krea2 特定的其他 VRAM 节省技术的建议。
-
AI 视频生成 GPU 选择:RTX 5080 对比 3090 对比 Pro 4000
一位 Reddit 用户正在寻求用于 AI 视频生成的 GPU 推荐,不包括 4090 和 5090 型号。他们正在考虑 RTX 5080 16GB、RTX 3090 24GB 和 RTX PRO 4000 Blackwell 24GB,并将选择的显卡与 64GB DDR4 内存搭配。
-
用户升级本地 LLM 硬件,发现初始设置已足够
一位用户分享了他们为在本地运行大型语言模型而升级硬件的经历,最初购买了一块 RTX 5090 来运行 27B 模型和进行微调。随后,他们又购买了两块 RTX 6000 Pro 以应对更大的模型,但最终发现他们最初的 5090 对于大多数日常任务已经足够,于是他们将多余的计算能力借出去了。然后,该用户向社区询问了他们日常使用 LLM 模型的情况。