WebGPU
PulseAugur coverage of WebGPU — every cluster mentioning WebGPU across labs, papers, and developer communities, ranked by signal.
- developed by World Wide Web Consortium 100%
- founded by Apple Inc. 100%
- uses ONNX Runtime Web 90%
- used by ONNX Runtime Web 90%
- uses WebAssembly 80%
- used by WebAssembly 70%
- uses WebGPU Shading Language 70%
- competes with WebGL 70%
- used by WebGL 70%
- used by PrismML 70%
- used by Javascript 70%
- used by WebRTC 70%
8 天有情绪数据
-
EmbeddingGemma-2 模型通过 WebGPU 在浏览器本地运行
embeddingGemma-2 模型现在可以直接在 WebGPU 技术支持的网页浏览器中运行。这使得模型可以在本地执行,用户无需下载模型或依赖云服务。演示可在 Hugging Face Spaces 上找到,展示了该模型生成浏览器内嵌件的能力。
-
开发者创建本地Chrome扩展程序以过滤YouTube信息流
一位开发者创建了一个Chrome扩展程序,该程序利用一个在浏览器中本地运行的小型模型直接过滤YouTube内容。该扩展程序无需服务器或API密钥,允许用户隐藏特定视频类别或遵循自定义规则,还包括一个检查文本是否存在提示注入的功能。该模型opendecider-nano可以通过WebGPU或WASM运行,性能基准测试表明标题分析的处理时间效率很高。
-
Gitframes 通过 WebGPU 实现视频渲染以进行代码可视化
Gitframes 是一款新工具,它通过 WebGPU 实现视频渲染,允许用户可视化代码执行。该项目旨在为 Web 平台带来与代码相关的可视化的视频渲染功能。
-
新的Windfoil算法提供实时、可微分矢量图形
研究人员开发了Windfoil,一种新的、对GPU友好的实时和可微分矢量图形算法。该算法以闭式方程形式评估二次贝塞尔曲线的盒式滤波缠绕数,从而能够在包括网页浏览器在内的各种环境中进行高效渲染。Windfoil在保真度和性能方面已证明与Skia和Slug等现有系统相当或更优,并且其优化能力在重建质量和成本方面优于DiffVG和Bézier Splatting。
-
新的 WebGPU LLM 引擎已针对 llama.cpp 进行数值精度验证
一个基于 WebGPU 的新型 LLM 推理引擎 quipullm 已被开发出来,并与成熟的 llama.cpp 库进行了严格的验证。该引擎完全用 WGSL 和 JavaScript 从头编写,直接在浏览器中运行,并支持标准的 GGUF 文件。验证侧重于数值精度而非主观文本质量,使用了合成模型,并将 token ID、最后一个 token 的 logits 和贪婪续写与 llama.cpp 的输出进行比较。这种方法可以检测到细微的错误…
-
微型 1.6MB 模型以每权重 1.375 比特运行 Connect Four
Precisit 开发了一个 1.6 MB 的模型,其 Connect Four 表现与 7.8 MB 的 int8 版本相当。这个新模型采用了 Sherry 的 3:4 三进制格式,实现了每权重 1.375 比特,并通过 WebGPU 在浏览器中高效运行。研究表明,使用此格式进行训练对于最佳性能至关重要,因为训练后转换会显著降低模型的性能。
-
Ternary Bonsai 2 (27B) 发布,可在浏览器中本地运行
Ternary Bonsai 2,一个拥有270亿参数的语言模型,已在 Hugging Face 上发布。该模型源自 Qwen3.8-27B,并采用三元权重,使其大小小于6GB,比其 FP16 版本小9倍,同时保持了98.2%的智能水平。该模型能够使用 WebGPU 在网页浏览器中本地运行。
-
基于浏览器的洪水数字孪生使用设备端 AI
一位开发者创建了一个英国河流的实时数字孪生,该孪生完全在网页浏览器中运行。该模拟利用 WebGPU 进行渲染,并集成了设备端 AI,展示了基于浏览器的计算能力的进步。
-
浏览器 LLM 推理引擎 Three-LLM 利用 WebGPU 进行本地执行
Ben Houston 开发了 Three-LLM,一个基于 WebGPU 的推理引擎,允许大型语言模型 (LLM) 在 Web 浏览器内本地运行。该项目利用 Three.js 及其 WebGPU 功能直接在用户的 GPU 上执行 LLM 推理,支持 GPT-2、SmolLM2、Phi、Qwen 和 Llama 架构等各种模型。已实施了重要的性能优化,包括减少命令提交和重用提示前缀,这带来了显著的速度提升,例如 TinyStories…
-
AI 新闻集锦:Codex 安全漏洞、WebGPU 语法高亮器和 DeepMind 的基因组图谱 · 跟踪 3 个来源
一位安全研究员发现,代码生成人工智能模型 Codex 可能在未经用户明确许可的情况下发出任意网络请求。另外,一个基于 WebGPU 的新型语法高亮器已被开发出来,它不区分语言且体积非常小。在其他 AI 新闻中,Google DeepMind 发布了基因组图谱,展示了人工智能的积极应用。
-
WebGPU 支持在浏览器中本地运行大语言模型
通过使用 WebGPU(一种利用设备图形处理单元 (GPU) 进行计算的 Web 标准),直接在 Web 浏览器中运行大语言模型 (LLM) 正在成为可能。像 @mlc-ai/web-llm 这样的库通过优化 LLM 在 WebGPU 上的执行来促进这一点,使得 Qwen3.5-2B-q4f16_1-MLC 等模型能够本地运行。这种方法通过将数据保留在用户设备上增强了隐私性,尽管在硬件限制和针对消费级 GPU 的模型优化方面仍存在挑战。
-
Hugging Face 发布 200 多个用于本地 AI 的 WebGPU 内核
Hugging Face 推出了 @huggingface/kernels 库,该库支持直接从 Hugging Face Hub 使用 200 多个优化的 WebGPU 内核进行本地 AI 应用。这些内核涵盖了重要的机器学习操作,并作为独立的、版本化的软件包发布,具有明确的接口、正确性测试和基准测试用例。为了促进社区参与,Hugging Face 还推出了 Fleet,一个基于浏览器的基准测试工具,用于众包来自不同硬件的性能和正确性数…
-
AI 创意工作室架构:Next.js、WebGPU、Node.js 混合模型
本文概述了一个全栈 AI 创意工作室的架构,超越了传统的单体式 Web 开发模式。它提出了一种混合式、分布式系统,利用 Next.js、WebGPU 和 Node.js 来处理实时生成媒体工作流的需求。该方法涉及将任务分解为专门的代理(worker agents),类似于微服务,它们通过共识机制进行通信和协调,以产生稳健的输出并避免幻觉。
-
生成式AI媒体管道面临新的安全威胁
生成式AI媒体管道,特别是那些使用基于节点的画布和客户端WebGPU的管道,容易受到资源耗尽和拒绝服务攻击。与传统的Web服务不同,这些管道涉及持续的计算负载和非线性的资源成本,包括内存放大、推理延迟瓶颈和带宽饱和。保护这些系统需要超越简单的请求计数器的专业滥用预防策略,重点关注计算稀缺性和代理循环风险。
-
高分辨率画布渲染的 WebGPU 导出引擎详解
本文详细介绍了创建一个基于 WebGPU 的导出引擎,该引擎旨在将高分辨率画布渲染为 MP4、SVG 和 PDF 等格式。它解决了 Web 开发中一个普遍存在的挑战,即交互式可视化在进行高保真存档导出时面临性能瓶颈。该引擎通过采用确定性虚拟时间线和多线程组合等技术,专注于空间保真度和时间连贯性,而非帧延迟,从而弥合了这一差距。
-
AI 计费系统必须适应动态、GPU 密集型工作负载
为 GPU 密集型 AI 工作负载构建健壮的计费系统对其商业可行性至关重要。这些系统必须将不稳定的计算成本转化为确定的财务单位,因为未经优化的管道可能导致资源迅速耗尽。与传统的 API 调用计费不同,AI 工作负载计费需要一个动态的、依赖于状态的模型,该模型考虑了基于节点的图中的非线性、并行计算。
-
Vercel 开源 vgpu WebGPU 库,用于 AI Agent Shaders
Vercel 已开源 vgpu,这是一个旨在简化 WebGPU Shaders 开发和部署的 TypeScript 库。该库允许开发者编写一次 Shaders,并在不同环境(包括浏览器、无头 Node.js 和 CI 测试)中运行。Vgpu 将 WebGPU Shading Language (WGSL) 文件视为可导入的模块,自动处理绑定声明并优化 Shaders 代码以实现紧凑的体积。该项目采用 MIT 许可,可在 npm 上获得…
-
生成式AI媒体资产管理需要新架构
与传统内容管理系统相比,在生成式AI应用中管理媒体资产带来了独特的挑战。生成式工作流会产生动态的、算法派生的媒体,例如中间张量和各种图像格式,这些媒体会迅速耗尽存储并超出成本预测。为此,需要从静态文件存储转向分布式、边缘优化的架构,将资产视为计算图的投影,类似于Web开发中的记忆化哈希映射。
-
AI 模型现在使用 ONNX Runtime Web 直接在浏览器中运行
ONNX Runtime Web 使得背景移除和特征提取等复杂的 AI 任务可以直接在网页浏览器中执行。这种客户端处理消除了对强大后端服务器的需求,降低了与将敏感数据发送到云端相关的延迟、带宽消耗和隐私担忧。该架构利用 ONNX 实现模型互操作性,利用 ONNX Runtime Web 作为编译为 WebAssembly 的执行引擎,并利用 WebGL 和 WebGPU 等浏览器硬件加速 API 进行高效计算。
-
Spline 发布重大更新,支持 WebGPU 渲染和 AI 代理
Spline 推出了全新的第二版,标志着浏览器中 3D 模型设计的重大转变。此次更新包含一个基于 WebGPU 的渲染引擎以提高性能,以及先进的建模工具和新的毛发系统。它还集成了内部 AI 代理,并通过 MCP 服务器支持 ChatGPT 等外部工具,旨在简化流程并实现场景的程序化控制,以获得更稳定、更专业的设计体验。