Vulkan
PulseAugur coverage of Vulkan — every cluster mentioning Vulkan across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
WebGPU 解锁浏览器 GPU 算力,实现大规模并行计算
WebGPU 是一项新的 Web API,它允许开发者直接从浏览器利用图形处理单元(GPU)的大规模并行处理能力。与仅限于渲染且需要复杂变通方法才能进行通用计算的前身 WebGL 不同,WebGPU 能够直接在数千个线程上执行任意数学代码。这一转变预计将显著提高 Web 应用程序中 AI 推理、媒体处理和复杂模拟等任务的性能,弥合传统 CPU 密集型 Web 开发与现代 GPU 硬件能力之间的差距。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
Llama.cpp ROCm 7.14 基准测试显示 Radeon 780M 性能有所提升
一位 Reddit 用户对 llama.cpp 在 ROCm 7.14 下的性能进行了基准测试,并指出其引入了对 Radeon 780M iGPU 的支持。基准测试将 ROCm 与 Vulkan 在各种 Qwen 模型上进行了比较,结果显示 ROCm 在密集模型上提供了显著的速度提升,尤其是在更高的上下文长度下。然而,用户也遇到了 ROCm 的稳定性问题,需要调整特定的内核参数,这表明可能与某些环境变量存在不兼容性。
-
Liquid AI 发布紧凑型代理模型;Mistral 推出安全分类器
Liquid AI 发布了 LFM2.5-2.6B,一个针对代理框架和工具交互优化的紧凑型纯文本模型,具有大上下文窗口和多语言支持。虽然不推荐用于复杂编码,但其小巧的尺寸和高效的 GGUF 格式使其适用于本地部署以及路由、提取和 RAG 等任务。Mistral 还推出了 Shieldstral 1.0 3B,一个多模态安全分类器,它使用自然语言策略来评估提示、模型响应和图像。
-
Triton驱动程序为QEMU模拟器带来DirectX 11支持
一款名为Triton的新驱动程序已被开发出来,为通用的模拟器和虚拟化软件QEMU带来DirectX 11兼容性。该驱动程序旨在实现跨macOS、iOS、Microsoft Windows和Linux等各种操作系统的更广泛图形支持。Triton旨在通过MoltenVK在Apple平台上将DirectX 11调用转换为Vulkan,一个现代图形API。
-
AI照片增强器:放大器与生成模型
用于增强照片的AI工具可分为放大器和生成模型,尽管营销常模糊此区别。放大器通过数学方式重建现有像素以提高清晰度和降低噪点,忠实于原始图像内容。然而,生成模型会在信息缺失处创建新细节,这可能导致用户误将虚构元素当作现实。用户理解此区别至关重要,因为生成模型会改变面部特征或添加不存在的细节,而放大器旨在保留原始图像的完整性。
-
QuarkStar 引擎可在 16GB 机器上运行大型语言模型
一款名为 QuarkStar 的新型推理引擎已被开发出来,其灵感来源于 DwarfStar,但针对低配置硬件进行了优化。它使得 Qwen3.6-35B-A3B 和 KAT-Coder-V2.5-Dev 等大型语言模型能够在内存仅为 16GB 的机器上运行,在 Linux 上使用 Vulkan,在 Apple Silicon 上使用 Metal。该引擎还支持 SSD 流式传输,以运行超出可用内存的模型,旨在无需昂贵的硬件即可实现强大的本地 AI。
-
用户在使用 llama.cpp Vulkan 时遇到 DSv4 Flash 模型循环
Reddit 的 r/LocalLLaMA 版块的一位用户在使用 Q8 量化和 llama.cpp Vulkan 实现时,遇到了 DSv4 Flash 模型出现的“毁灭循环”。该模型陷入重复输出循环,无法生成有意义的文本。用户正在寻求建议,询问是否需要直接从 GitHub 构建最新版本,因为他们目前使用的是 AUR 的旧版本。他们提供了启动命令和系统规格,包括双 7900XTX GPU(48GB 显存)、9800X3D CPU 和 1…
-
新的 C#/.NET 引擎 TensorSharp 性能媲美 llama.cpp
TensorSharp 是一款新的 GGUF 模型推理引擎,作为纯 C#/.NET 替代品出现,可与 llama.cpp 等成熟的 C/C++ 引擎相媲美。由 zhongkaifu 开发,它提供了广泛的模型和后端支持,包括 CUDA、Metal 和 Vulkan,以及分页 KV 缓存和连续批处理等功能。基准测试表明,TensorSharp 的性能与 llama.cpp 相当,在某些场景下 TensorSharp 速度更快,而在其他场景…
-
Moonshot 发布 Kimi K3 权重;Thinking Machines 发布 Inkling-Small
Moonshot 发布了 Kimi K3 的权重,这是一个拥有 2.8 万亿参数的庞大 MoE 模型,并附有技术报告。该模型专为长远编码和大型上下文任务设计,以其先进的架构而闻名,但由于其规模庞大,目前不适合家庭使用。与此同时,Thinking Machines 推出了 Inkling-Small,这是一个拥有 2760 亿总参数和 120 亿激活参数的较小 MoE 模型,提供多模态能力和 100 万个 token 的上下文窗口,尽管…
-
Valve资助将RADV Vulkan驱动移植到Windows,运行Counter-Strike 2
Valve正在资助一个项目,将开源的Linux RADV Radeon Vulkan驱动移植到Windows。此项目由Collabora的承包商负责,旨在为Windows用户提供更稳定、性能更优的图形驱动选项。该移植项目已成功运行Counter-Strike 2,展示了其在改善跨平台游戏开发和调试方面的潜力。
-
llama.cpp 发布多个更新,改进性能和构建
llama.cpp 项目发布了多个更新,包括 b10567 版本,该版本为 macOS、Linux、Android 和 Windows 提供了 CI 改进和各种构建选项。之前的版本如 b10566 和 b10549 分别引入了版本升级和张量分割功能。其他更新解决了 b10539 中的 Vulkan 量化计算、b10545 和 b10538 中的 Metal 性能优化以及 b10536 中的服务器端模型加载等具体问题。b10537 版本…
-
使用Vulkan后端简化边缘设备上的ML推理
PostSlate的一名软件工程师详细介绍了他们在生产边缘设备上实现厂商无关的机器学习推理的经验。为了实现跨NVIDIA、AMD和Apple Silicon等各种硬件的广泛兼容性,他们选择了ncnn的Vulkan后端,该后端绕过了CUDA等厂商特定的解决方案。这种方法显著缩短了诸如面部检测和嵌入等任务的推理时间,并通过利用现有的Vulkan驱动程序简化了部署。
-
LLM 推理引擎通过新技术和优化实现重大速度提升 · 跟踪 4 个来源
多个项目正在增强本地 LLM 推理引擎的性能。Kernel Acceleration (VK) 开发了三个引擎(VKAE、VKUE、VKIE),通过多令牌预测等技术将令牌生成速度提高到每秒 601 个令牌,并在 Fast Gemma 挑战赛中被验证为第一名。Llama.cpp 为 GLM-5.2 引入了推测解码,并为 Vulkan 增加了量化连接支持,而 vLLM 则增加了对 Inkling 模型系列的支持,并改进了其 CUDA 图实…
-
新研究优化跨不同GPU和硬件的LLM推理
研究人员正在开发新的方法来优化跨不同硬件的大型语言模型(LLM)推理和训练。Meganeura旨在通过Vulkan和Metal实现便携式GPU训练和推理,并展示出与供应商特定解决方案相比具有竞争力的性能。Celty通过共同设计GPU内核和SIMT微架构以实现稀疏矩阵-稀疏向量工作负载,专注于高效的双稀疏LLM推理。此外,一种新的分析方法无需直接测量即可估算GPU上LLM推理的能耗,有助于可持续性分析。
-
Nvidia RTX Spark N1X原型Surface Laptop Ultra初显潜力,面临驱动问题
一款据称搭载未发布的Nvidia RTX Spark N1X片上系统(SoC)的Microsoft Surface Laptop Ultra原型机,已由一位科技爱好者进行了初步测试。该N1X SoC专为AI任务设计,据称其性能可与桌面版RTX 4070或移动版RTX 5070媲美,并支持高达128GB的统一内存。然而,该原型机出现了显著的驱动和电源管理问题,导致部分应用程序性能不一致甚至崩溃,表明在可能发布之前还需要进一步开发。
-
AI 模型在 2010 年硬件上运行,展示了在老旧系统上的可访问性
某用户成功在老旧硬件上运行了 Ollama 和 Stable Diffusion 等 AI 模型,具体配置为 2010 年的 Intel Core i5-650 处理器和 8 GB 内存。该用户使用 Ollama 达到了 5.5 tokens/s 的速度,并使用 Stable Diffusion 1.5 在 125.62 秒内生成了一张 512x768 的图像。他们还测试了 Google 的 Gemma 3 4B 模型,发现它作为一个…
-
Mozilla 发布 Llamafile 0.10.4,实现单文件 LLM 打包
Mozilla 发布了 Llamafile 0.10.4,这是其工具的一个新版本,旨在通过将大型语言模型 (LLM) 打包成单个、跨平台的 文件来简化其使用。此更新包括一个名为 Transcribefile 的新组件,该组件基于 Transcribe.cpp 项目构建,并整合了其 Llama.cpp 上游的更新。Llamafile 0.10.4 的增强功能还包括对 Vulkan API 和 AMD ROCm 加速的改进,增加了 HTT…
-
新的AI运行时操作系统在通用硬件上编排模型
一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。
-
新的 R 包 `cayleyR` 使用图论解决排列难题
研究人员开发了 `cayleyR`,这是一个 R 包,旨在通过分析 Cayley 图中的循环交集来解决排列难题。该包采用迭代双向搜索算法,从初始状态和目标状态生成循环,并通过它们的交集找到路径。它专门针对 TopSpin(n,k) 谜题,利用对称群 Sn 的 Cayley 图表示的状态空间。该实现集成了 C++ 进行状态存储,并提供可选的 Vulkan GPU 加速,该软件现已在 CRAN 上提供。