RTX 5090
PulseAugur coverage of RTX 5090 — every cluster mentioning RTX 5090 across labs, papers, and developer communities, ranked by signal.
- instance of Tom's Hardware 90%
- instance of Nvidia GeForce RTX 5070 Ti 90%
- uses Intel Core Ultra 9 290HX Plus 90%
- used by Razer 90%
- competes with RTX 5080 70%
- competes with RTX 5070 70%
- used by DDR5 SDRAM 70%
- used by ASUS 70%
- used by GDDR7 SDRAM 70%
- used by StableDiffusion 70%
- used by Gemma 4 70%
- instance of Intel Core Ultra 9 285K 70%
- 2026-08-05 product_launch Nvidia is reportedly canceling orders for the RTX 5090 graphics card due to a price increase, with Asus being blamed for not fulfilling orders at the original price. 来源
- 2026-06-01 product_launch NVIDIA launched the RTX 5090 graphics card. 来源
- 2026-05-15 product_launch Nvidia may increase the price of the upcoming RTX 5090 graphics card. 来源
24 天有情绪数据
-
自托管 LLM:盈亏平衡取决于工作负载比例,而非仅仅是数量
自托管大型语言模型 (LLM) 本身并不比使用 API 更便宜,其盈亏平衡点取决于特定的工作负载比例,而不是固定的 token 数量。消费级 GPU 上的生产实例每月成本约为 850 美元,其中人工成本是最大的组成部分。自托管的决定应考虑成本扩展、数据隐私和网络延迟等因素,而采用混合方法,将本地模型用于大批量或受监管流量,API 用于复杂推理,通常是最有效的策略。
-
Qwen3.8-27B 模型在单张 RTX 5090 上实现 451K KV-cache
一位用户成功地在单张 RTX 5090 GPU 上配置了具备视觉能力和 451K token KV-cache 的 Qwen3.8-27B 模型。该设置利用 vLLM 和特定的 NVFP4 量化,即使在功率限制为 400W 的情况下,平均速度也能达到每秒 120 个 token。此配置在编码任务上表现准确,并支持最多三个并行会话。
-
LLaMA 用户讨论英特尔/AMD GPU 用于推理而非英伟达
r/LocalLLaMA subreddit 上的一位用户正在寻求关于使用非英伟达 GPU 进行本地大型语言模型推理的建议。他们目前拥有 RTX Pro 6000 和 RTX 5090 显卡,并考虑通过增加 GPU 来扩展他们的服务器,特别关注英特尔和 AMD 选项,因为它们每美元的显存更高。用户正在询问在这些替代硬件平台上与成熟的英伟达/CUDA 生态系统相比,推理性能的经验和比较。
-
BuyWhere MCP 为 Telegram 比价和 Slack 交易提醒机器人提供支持
本系列教程演示了如何使用 BuyWhere MCP (Market Comparison Platform) API 构建机器人。第一篇文章详细介绍了如何创建一个 Telegram 机器人,该机器人可以比较不同市场的商品价格,为用户提供最佳可用交易和跨市场选项。第二篇文章解释了如何构建一个 Slack 机器人,该机器人利用对 BuyWhere API 的计划性检查,在特定商品价格低于设定的阈值时提醒用户。
-
AI 本地生成王者基多拉新闻广播
一位用户使用 MiniMax H3 和 ComfyUI 中的 FLUX 关键帧在本地设置中创建了一个包含王者基多拉的2分钟新闻广播。整个制作过程,包括所有声音和音效,均由 AI 模型生成。用户详细介绍了他们的过程,并强调了模型在长时间静默时出现胡言乱语以及主体比例和生物设计在不同镜头之间不一致等挑战。
-
使用BuyWhere MCP协议构建Discord购物机器人
本教程演示了如何使用BuyWhere MCP协议构建一个Discord购物机器人。该机器人允许用户直接在Discord中查询产品价格并找到最佳交易,无需进行网络抓取。开发人员可以使用Node.js或Python,利用BuyWhere API密钥和Discord的开发者门户集成此功能。
-
Stable Diffusion 用户优化多 GPU 设置以获得更高分辨率
一位 Reddit 用户分享了一种优化 Stable Diffusion 多 GPU 设置的技术,特别是针对 MiniMax H3 用户。该方法涉及将一个 GPU 完全专用于激活权重,这可以显著增加用于更高分辨率和更长视频生成的 VRAM 容量,同时对性能影响最小。这种方法可以更有效地利用硬件,有可能在消费级 GPU 上实现更高质量的输出。
-
MiniMax AI 与 ComfyUI 启动 H3 挑战赛,提供 GPU 奖品
MiniMax AI 与 ComfyUI 正在合作举办 H3 挑战赛,这是一个为期两周的活动,参赛者有机会赢得 Nvidia RTX 5090 或 5060 Ti 显卡。该挑战赛于 8 月 20 日开始,至 9 月 1 日结束,鼓励创作者构建并提交使用 H3 框架的项目。获胜者将在 9 月 2 日的直播活动中公布。
-
Gigabyte Aorus Master 16 OLED 游戏笔记本电脑配备 RTX 5090,降价 800 美元至 3,599 美元
一款 Gigabyte Aorus Master 16 游戏笔记本电脑,配备 OLED 显示屏、Intel Arrow Lake CPU 和 RTX 5090 移动 GPU,售价为 3,599 美元,比原价便宜 800 美元。这款高性能笔记本电脑配备 32GB RAM、2TB SSD,以及 Wi-Fi 7 和 Thunderbolt 5 等高级连接选项。它旨在提供顶级游戏体验,RTX 5090 GPU 能够以高帧率和高分辨率运行要求严苛的游戏。
-
旧款V100 GPU通过软件运行Qwen 3.8,性能媲美RTX 5090
一位开发者成功地在四块2017年的NVIDIA V100 GPU上运行了使用NVFP4量化的Qwen 3.8模型,实现了与现代RTX 5090相当的性能。这一壮举值得注意,因为NVFP4是为更新的NVIDIA Blackwell架构设计的,而V100缺乏对模型使用的FP4和FP8格式的原生支持。开发者通过创建名为QPN的软件翻译器实现了这一点,该翻译器允许V100高效地处理模型,在解码吞吐量和得到正确答案的时间上与RTX 5090相当。
-
VoroTracing实现实时光线追踪速度,超越光栅化
研究人员开发了VoroTracing,一种新颖的可微分Voronoi光线追踪技术,实现了实时渲染速度,超越了传统的光栅化方法。这种新方法分析遍历长度和内存局部性等因素来优化场景表示和GPU执行。在Mip-NeRF 360等基准测试中,VoroTracing的吞吐量显著高于现有的基于光线的方法,甚至优于3D高斯泼溅,同时支持景深和滚动快门等复杂效果,而无需专门的光栅化。
-
GameStop顾客因数百台坏掉的游戏机净赚超过10,000美元店内积分
据报道,一位名叫Josh的GameStop顾客通过交易数百台坏掉的游戏机,包括PlayStation、Xbox和Nintendo Switch,获得了超过10,000美元的店内积分。该顾客利用了GameStop的政策,即用物品兑换店内积分比获得现金更有价值。虽然有人批评该顾客没有在eBay等平台单独出售这些游戏机,但文章指出,与单独销售相比,以旧换新提供了便利并节省了精力。
-
估算本地 LLM 成本:硬件摊销 vs. 云定价
估算本地大型语言模型 (LLM) 的每 token 成本需要计算硬件摊销、电力消耗和运营开销。主要挑战在于硬件成本的固定性,如果利用率低,自托管可能会非常昂贵。例如,一张 RTX 5090 在 36 个月内摊销,其每 token 成本贡献显著,尤其是在使用量较低的情况下,与云 API 定价相比。
-
Asus 发布配备顶级组件的 15,000 美元 ROG Edition 20 游戏 PC
Asus 发布了一款定制游戏 PC 配置 ROG Edition 20,旨在展示高端组件,注重美学和高级功能。该配置包含多个屏幕、大量的铜制散热器和开放式机箱,总价约为 15,000 美元。其组件,包括 RTX 5090 GPU 和 3000W PSU,面向拥有大量可支配收入的用户,如富有的收藏家或早期加密货币投资者。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
Qwen3.8-27B 模型默认设置引发关于推理努力和速度的争论
Qwen3.8-27B 模型以高推理努力的默认设置发布,引发了社区对其性能和配置的讨论。早期报告指出,此默认设置可能导致推理时间显著变慢,一位用户生成简单 SVG 图像就等待了 21 分钟。将推理努力调整为较低设置或禁用它可大幅提高速度,使模型更适合交互式使用。同时,模型速度和上下文窗口的优化工作正在进行中,新的存储库和硬件解决方案正在涌现,以增强其在消费级 GPU 和专用硬件上的性能。
-
用户详述雄心勃勃的200GB显存多GPU设置
一位用户在r/LocalLLaMA子论坛上详细介绍了一个复杂的、旨在实现200GB显存的多GPU设置。该计划包括组合使用一块RTX PRO 6000(96GB)、一块RTX 5090(32GB)、一块RTX PRO 5000(48GB)和一块RTX PRO 4000(24GB)。这种配置需要仔细的电源管理和专用适配器才能装入1300W电源。
-
自动化流程将漫画章节转换为动画书
一位用户开发了一个自动化流程,可将PDF漫画章节转换为带有动态和声音的动画书。该系统基于ComfyUI和MiniMax H3构建,可自动检测和分割漫画格,使用本地视觉模型生成动态提示和语音,然后将片段组装成可扫描的网络书籍。该过程可以在单块RTX 5090 GPU上免费完成,或在云GPU上完成,每章约花费1.96美元。
-
RTX 5090 用户为 Qwen3.8.27b 模型寻求最佳操作系统
一位拥有高端 AI 设置的用户,包括 RTX 5090 GPU 和 96GB RAM,正在寻求关于运行 Qwen3.8.27b 模型的最佳操作系统和推理服务器的建议。该用户正在考虑从 Windows 11 切换到 Linux,特别是 Ubuntu,以最大限度地提高模型的性能,因为他听说社区普遍认为 Windows 可能不是最佳环境。他正在寻找与任一操作系统兼容的推理服务器的推荐,以获得最佳结果。
-
阿里巴巴的Qwen3.8-27B模型在RTX 5090上达到206 tok/s
阿里巴巴的Qwen团队发布了Qwen3.8-27B,这是一个开源的小型模型,取得了令人印象深刻的性能指标。该模型在使用NVFP4和DSpark优化的情况下,在单块RTX 5090 GPU上解码速度达到每秒206.1个token。此次发布还包括SGLang的Day-0支持,SGLang是一个促进模型高效执行的项目。