RTX 3090
PulseAugur coverage of RTX 3090 — every cluster mentioning RTX 3090 across labs, papers, and developer communities, ranked by signal.
- used by CodeLlama 34B 90%
- used by Qwen 2.5 32B 90%
- instance of RTX 4090 70%
- used by Qwen3.6-27B 70%
- used by vLLM 70%
- used by Gemma 70%
- used by Qwen3.6 35B-A3B 70%
- used by Multi Token Prediction 70%
- used by Qwen-3.6 27B 70%
- competes with GeForce RTX 3060 70%
- used by r/LocalLLaMA 70%
- competes with Nvidia GeForce RTX 5070 Ti 70%
20 天有情绪数据
-
AI 爱好者寻求多 GPU 设置以进行本地模型推理的建议
r/LocalLLaMA 子版块的一位用户正在寻求有关配置多 GPU 以进行 AI 模型推理的建议。他们目前正在使用 RTX 3090,并考虑添加第二块 GPU,例如 3070,但面临当前主板设置的物理空间限制。用户正在探索替代解决方案,包括外部 GPU 配置和使用 NVMe 存储来存放模型数据。
-
AI PC 组建者在 RTX 3090 显卡失败后寻求新显卡
一位为公司应用构建预算型 AI PC 的用户在使用 llama.cpp 进行约一小时的测试后,两块 RTX 3090 GPU 在负载下均出现硬件故障。该用户现在正在寻求价格相似的新 GPU 推荐,考虑选项包括两块 RTX 5060 Ti、一块 AMD Radeon R9700 或一块 Asrock Arc Pro B70,重点关注 24/7 运行的可靠性以及未来扩展的可能性。
-
LM Studio 更新导致 RTX 3090 性能下降;切换 CUDA 运行时可解决问题
一位用户在更新 LM Studio 后,本地大模型设置的性能显著下降,其 RTX 3090 的处理速度从每秒 60-70 个 token 降至每秒 12-18 个 token。问题追溯到尽管设置显示最大卸载量,但只有 54 层被卸载到 GPU。通过将运行时从 CUDA12 切换到 CUDA 或 Vulkan,问题得以解决,其中 CUDA 性能略好。用户注意到 CUDA12 似乎强制进行了 CPU 卸载。
-
Muse Glimmer 支持在消费级 GPU 上进行本地 AI 编码代理开发
Muse Glimmer 是一款新的开源工具,支持在本地开发 AI 编码代理。它利用了 llama.cpp、DFlash 推测解码和 Raspberry Pi 等技术。该工具设计用于在消费级 GPU(如 RTX 3090)上运行,使个人电脑也能实现代理式 AI。
-
Stable Diffusion 用户优化多 GPU 设置以获得更高分辨率
一位 Reddit 用户分享了一种优化 Stable Diffusion 多 GPU 设置的技术,特别是针对 MiniMax H3 用户。该方法涉及将一个 GPU 完全专用于激活权重,这可以显著增加用于更高分辨率和更长视频生成的 VRAM 容量,同时对性能影响最小。这种方法可以更有效地利用硬件,有可能在消费级 GPU 上实现更高质量的输出。
-
AI艺术家寻求GPU建议:RTX 3090 对比 5060 Ti 用于图像生成
一位Reddit用户正在寻求建议,关于在拥有24GB显存的RTX 3090和拥有16GB显存的新款5060 Ti之间选择,用于使用ComfyUI进行AI图像生成。他们目前使用的AMD RX 7900 GRE和32GB系统内存生成速度缓慢,并想知道多少内存对于未来的AI任务才足够。
-
用户寻求关于双 RTX 3090 本地运行 Qwen3.8-27B 模型性能的建议
一位 Reddit 用户正在寻求关于在 Windows 10 系统上使用双 RTX 3090 GPU 本地运行 Qwen3.8-27B 模型性能的建议。他们遇到的 token 生成速度为 50-65 tokens/秒,并对他们的设置(包括 80GB RAM 和特定的 llama.cpp 构建)是否正常表示疑问。用户提供了有关其硬件、软件配置以及运行模型的确切命令的详细信息,希望获得有关潜在优化或故障排除步骤的指导。
-
StableDiffusion用户分享Minimax inpainting工作流程以进行头部操作
一位Reddit用户分享了使用inpainting和Minimax来改变图像中头部的方法,特别适用于包含多个人的复杂场景。该方法涉及手动遮罩而非自动分割以获得更好的控制。该技术由Discord上的用户Nekodificador和Ablejones开发。
-
开发者详解在双RTX 3090上设置Qwen3.8-27B
一位开发者详细介绍了在没有NVLink的双RTX 3090配置上运行Qwen3.8-27B模型所需的广泛故障排除工作。使用vLLM和SGLang的初步尝试遇到了重大问题,包括编译错误、依赖冲突和模型加载失败,尤其是在量化检查点方面。通过将CUDA 13.0与SGLang 0.5.17匹配并应用特定的无NVLink和内存相关补丁,终于取得了突破。进一步的优化包括使用DSpark进行推测解码,这显著提高了令牌生成速度。
-
Qwen3.8-27B 模型接近前沿性能,可与 DeepSeek V4 和 GPT-5.6 Luna MAX 媲美
Artificial Analysis 发布了其 Qwen3.8-27B 模型的基准测试结果,显示其性能可与 DeepSeek V4 和 GPT-5.6 Luna MAX 相媲美。这表明 Qwen3.8-27B 是一个能力很强的模型,接近前沿性能水平。基准测试还强调,这类先进模型现在可以在消费级硬件上运行,例如 RTX 3090,使其更易于获取。
-
使用 DeepSeek Harness 和 Unsloth 在本地运行 Qwen 3.8-27B
一份技术指南详细介绍了如何在配备 RTX 3090 显卡的 Windows 11 机器上本地运行 Qwen 3.8-27B 代码模型。该设置利用 DeepSeek Harness 进行代理编排,并利用 Unsloth Engine 进行优化推理,从而实现 100% 私有、低延迟的软件工程代理。该指南强调 RTX 3090 的 24GB VRAM 非常适合托管此类规模的模型,特别是使用一种平衡性能和内存使用的动态量化格式。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
Qwen3.8-27B 模型通过新优化在 RTX 3090 上推至 138 tps · 跟踪 4 个来源
一位用户显著优化了 Qwen3.8-27B 模型在 RTX 3090 GPU 上的推理性能,实现了大幅的性能提升。通过一系列优化,包括 FP8 KV 缓存、模型头部的 INT8 量化以及 DFlash2 和查找增强等先进的草稿技术,用户将单请求吞吐量推至 138 tps,并发吞吐量推至 900 tps 以上。这些改进还极大地降低了对话中后续轮次的延迟,并将上下文长度支持到 262k tokens,同时保持了模型质量。
-
二手GPU购买指南:优先考虑本地LLM推理的显存
在购买用于本地LLM推理的二手GPU时,应将显存容量置于所有其他规格之上,因为内存不足将导致模型完全无法运行。显存带宽是第二重要的因素,而核心数量和其他功能则重要性大大降低。请考虑GPU的驱动程序支持周期,因为随着时间的推移,较旧的显卡可能与较新的CUDA工具包和推理软件不兼容。NVIDIA RTX 3090因其24 GB GDDR6X显存和NVLink连接器而备受关注,尽管后者在推理中的实用性有限。
-
Frontiers 模型在消费级硬件上以 100 万 token 上下文本地运行
一位 Mastodon 用户分享了在 RTX 3090 或 DGX 等硬件上本地运行“Frontiers 模型”并具有 100 万 token 上下文窗口的能力。这种能力被强调为“wahnsinnig”(疯狂/惊人)。该帖子还提到了 Frontiers in Psychology 和 MOD St Athan,尽管从这段摘录来看,它们与模型本地执行的具体联系尚不清楚。
-
Muse Glimmer LLM 可装入单块 RTX 3090,支持 256k 上下文
Muse Glimmer 大型语言模型已被发现可舒适地装入单块 RTX 3090 显卡,支持具有 DFlash 和 mmproj 等完整功能的 256k 上下文窗口。此性能值得注意,因为 Qwen3.6-27B 和 Gemma-4-31B 等其他模型在此硬件上难以实现类似的上下文长度。Muse Glimmer 还展示了令人印象深刻的速度,以大约 1400 tokens/秒 的速度处理提示,并以 64-124 tokens/秒 的速度生…
-
用户通过KVarN量化在17GB模型上实现100万上下文窗口
Reddit的r/LocalLLaMA论坛上一位用户报告称,他成功加载了一个拥有100万token上下文窗口的大型语言模型,在24GB显存的显卡上使用了约17GB显存。这是通过一个基于Qwen的350亿参数模型实现的,使用了KVarN 4位量化方法来处理KV缓存。该用户能够从文本的各个部分提取信息,表明上下文窗口是功能性的,并且没有损坏。
-
俄罗斯GPU租赁与购买:AI任务成本分析
在俄罗斯,为AI任务选择租赁还是购买GPU的决定在很大程度上取决于使用模式和成本分析。虽然一些供应商提供Tesla A100和RTX 4090等各种型号的按小时计费,但价格因供应商和地点而异。专家们对于购买硬件的盈亏平衡点意见不一,一些人认为每周使用40小时后购买是可行的,而另一些人则认为只有在日流量和上下文长度巨大的工业规模运营下才合理。
-
千元以下本地LLM最佳GPU:RTX 3090 对比 RTX 5080
对于预算在千元以下、希望在本地运行大型语言模型的用户,推荐使用二手RTX 3090,因为它拥有24GB显存,这对于处理CodeLlama 34B和Qwen 2.5 32B等模型至关重要。另外,对于那些优先考虑带保修的新硬件和较低功耗的用户,RTX 5070 Ti提供了极佳的性价比,能够高效运行7B到13B的模型。RTX 5080则被列为高端新选择,可在7B-13B模型范围内实现最大的推理速度。
-
爱好者详述强大本地AI集群的多年构建过程
一位用户详细介绍了他们构建强大本地AI集群的多年进展,从2023年9月的一台配备两块GPU的游戏机开始,到2026年1月最终升级为拥有四块RTX 6000 Pro Max Q和四块RTX 3090的配置。进行此次大规模构建的动机是为了在本地运行AI模型、保护数据隐私以及促进学习。用户遇到了许多挑战,包括PCIE问题、电源供应问题以及一次差点引发火灾的事故,最终得出结论,虽然云解决方案更具成本效益,但此次构建满足了他们作为爱好者的需求和…