PulseAugur
实时 08:16:03
实体 ONNX Runtime

ONNX Runtime

PulseAugur coverage of ONNX Runtime — every cluster mentioning ONNX Runtime across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 23 条
  1. TOOL · CL_183519 ·

    TormentNexus 将 Go 和 TypeScript 结合到模块化单体中以实现 AI

    TormentNexus 采用模块化单体架构,结合使用 Go 实现后端性能和 TypeScript 实现 AI 功能,以达到低于 10 毫秒的响应时间。该方法通过在 Go 进程中使用 V8 等嵌入式 JavaScript 运行时执行 AI 逻辑,避免了微服务的延迟和复杂性。该系统由 35 个以上的内部包组成,通过直接函数调用进行通信,在没有网络开销的情况下保持清晰的边界。

  2. TOOL · CL_181249 ·

    Ragleap推出RAG库,专注于狭窄范围

    Ragleap已推出其RAG库,强调刻意专注于狭窄范围而非广泛的功能对等。该库优先考虑检索增强生成,在其初始版本中明确排除了代理工具调用和多步编排,以确保核心功能得到良好执行。主要功能包括混合密集和稀疏检索、仅CPU交叉编码器重排序、对多个向量后端的支持以及对各种文件格式和媒体类型的强大摄取能力。

  3. TOOL · CL_168479 ·

    随着云依赖性下降,离线听写应用应运而生

    作者详细介绍了他们如何构建了一个名为 DictaFlow 的离线听写应用程序,该程序可以在 Windows 笔记本电脑、Mac 和 iPhone 等设备上本地运行语音识别模型。这与 Wispr Flow 等仍需要互联网连接才能进行听写的服务形成了对比。文章强调,现代硬件和开源模型(如 NVIDIA 的 Parakeet TDT 0.6B v3 和 OpenAI 的 Whisper)现在可以在不依赖云服务器的情况下执行转录,使得离线听写…

  4. TOOL · CL_160429 ·

    SQLite 扩展 sqlite-vec 提供无依赖的 AI 内存栈

    一款名为 sqlite-vec 的新 SQLite 扩展正在使开发人员能够构建复杂性显著降低、性能得到改善的 AI 内存栈。该扩展允许将向量搜索功能直接集成到 SQLite 数据库中,从而无需使用 Pinecone、Weaviate 或 ChromaDB 等独立且通常资源密集型的向量数据库服务。基准测试表明,与这些云服务相比,sqlite-vec 可以实现更快的索引构建时间和更低的查询延迟,使其成为本地 AI 代理和需要嵌入式、无依赖…

  5. RESEARCH · CL_158795 ·

    StrokeSeg2 框架简化临床 AI 部署

    研究人员开发了 StrokeSeg2,这是一个轻量级、模块化的 C++/Qt 框架,旨在使基于深度学习的脑病灶分割在临床研究中更易于访问。该框架通过知识蒸馏进行架构压缩和使用 ONNX Runtime 进行推理优化,将 nnU-Net 等资源密集型管道改编为可移植应用程序。这种方法显著减小了模型的大小和能耗,使其能够在没有外部依赖的情况下部署在标准的临床工作站上。

  6. RESEARCH · CL_158693 ·

    C++ RLHF 奖励评分引擎在 CPU 上优于 PyTorch

    一项新的研究调查了人类反馈强化学习 (RLHF) 管道中奖励评分的速度,发现基于 ONNX Runtime 构建的自定义 C++ 推理引擎在 CPU 上的性能明显优于标准的 PyTorch 实现。虽然 C++ 引擎在 GPU 上的性能也优于 PyTorch 和 FastAPI,但比 torch.compile 略慢。研究强调,批处理策略是性能的关键因素,其重要性往往超过语言或运行时的选择。

  7. TOOL · CL_171266 ·

    新的C++引擎加速了CPU上的RLHF奖励评分

    研究人员开发了一种新的C++推理引擎,使用ONNX Runtime进行人类反馈强化学习(RLHF)管道中的奖励模型评分。该引擎在CPU和GPU上与PyTorch eager模式、torch.compile和FastAPI进行了基准测试。C++引擎在CPU上表现出卓越的性能,优于所有基线,而在GPU上,torch.compile取得了更快的速度。研究还强调,批处理策略,特别是长度感知分桶,对吞吐量有显著影响,尤其是在GPU上。

  8. TOOL · CL_150899 ·

    使用 Kubernetes 为多 GPU 工作负载扩展 Triton 推理服务器

    本文提供了一份在 Kubernetes 环境中跨多个 GPU 扩展 Triton 推理服务器的手册。它解决了在繁重流量下于单个 GPU 上运行多个生产模型所面临的挑战。该指南详细介绍了实例组、动态批处理和其他优化性能和效率的技术。

  9. RESEARCH · CL_141273 ·

    工业机器视觉边缘推理框架基准测试 · 跟踪 2 个来源

    一篇新的研究论文对四种流行框架——PyTorch、ONNX Runtime、OpenVINO 和 TensorRT——在工业机器视觉边缘设备上的深度学习推理性能进行了基准测试。研究发现,OpenVINO 在 CPU 上提供了最快的推理时间,而 TensorRT 在 GPU 上效率最高。然而,在评估基于 Transformer 的视觉模型时,TensorRT 的性能并未优于 PyTorch。

  10. TOOL · CL_134908 ·

    通过 Vulkan 在 GPU 上运行神经网络:库、编译器或自定义引擎

    本文概述了使用 Vulkan API 在 GPU 上运行已训练神经网络的三种方法。它建议集成现有的库,如 TensorFlow Lite 或 ONNX Runtime,通过 ML 编译器(如 IREE 或 TVM)编译模型,或使用计算着色器开发自定义推理引擎以实现深度 Vulkan 集成。

  11. TOOL · CL_123093 ·

    新的安卓应用 VisionAId 使用设备端 AI 帮助视障人士

    研究人员开发了 VisionAId,这是一款安卓应用程序,旨在通过将标准智能手机转变为实时视觉助手来帮助视障人士。该系统利用六个设备端深度学习模型执行深度估计、物体和人脸识别以及定制的纸币检测器等任务,所有这些都通过 ONNX Runtime 离线运行。它还包含一个可选的云端大型语言模型 Google Gemini Flash,用于增强场景描述和物体标记。一个关键功能是其少样本学习能力,用于个性化物体检索,允许用户拍摄特定物品的照片,…

  12. TOOL · CL_112417 ·

    Kuma 项目将 PyTorch 模型编译为通过 WebGPU 在浏览器中执行

    一个名为 Kuma 的新项目旨在将 PyTorch 模型编译为独立的 WebGPU 可执行文件。这种方法将允许模型直接在浏览器中运行,而无需 Python 或服务器端运行时。该项目的创建者正在就架构决策征求反馈,例如嵌入后端内核以及与 ONNX Runtime 等现有解决方案相比,它是否解决了实际的部署需求。

  13. RESEARCH · CL_103811 ·

    PaddleOCR 在 Hugging Face 上发布支持 50 种语言的 PP-OCRv6

    PaddleOCR 已在 Hugging Face 上发布了 PP-OCRv6,这是一套更新的通用 OCR 模型。新一代模型提高了文本检测和识别的准确性,模型参数量从 150 万到 3450 万不等。小型和中型模型支持包括中文、英文和日文在内的 50 种语言,旨在为多语言 OCR 任务提供统一的解决方案。PP-OCRv6 专注于以高效的模型尺寸提供准确、结构化的文本输出,适用于各种部署场景。

  14. TOOL · CL_102768 ·

    Microsoft Presidio 因新功能在 GitHub 上获得关注

    Microsoft Presidio 是一款用于检测和保护敏感信息的开源工具,在 GitHub 上获得了显著关注,星标数已超过 9,390。该项目的最新更新包括增加了 ONNX Runtime 后端、新的特定国家/地区数据识别器,以及改进了对 Mastercard 和国际化电子邮件等实体的现有检测能力。

  15. TOOL · CL_77363 ·

    AI LOD 框架通过距离感知模型精度优化游戏动画

    研究人员引入了一个名为 AI Level of Detail (AI LOD) 的新颖框架,用于优化游戏中的实时人类运动预测。该方法根据 NPC 离玩家摄像机的距离动态调整机器学习模型的精度,类似于图形细节会根据远处物体而降低。通过为 AI 模型采用不同的量化级别(FP32、FP16、INT8),该系统旨在在显著降低计算负载的同时保持视觉保真度。使用运动捕捉数据的初步评估表明,这种距离感知的精度选择是增强 AI 驱动角色动画的可行策略。

  16. TOOL · CL_73311 ·

    ONNX Runtime 在仅 CPU 的语音基准测试中优于 HF Transformers

    一项在仅 CPU 硬件上对 Parakeet TDT 0.6B 模型进行 ONNX Runtime、Hugging Face Transformers 和 GGUF 的基准测试显示,ONNX Runtime 的推理速度比 Hugging Face Transformers 快 37%。这种性能提升归因于 ONNX Runtime 的算子融合和 AVX2 优化,但代价是内存使用量更高。GGUF 提供了一种更节省内存的解决方案,但推理时间…

  17. TOOL · CL_72388 ·

    Python 项目实现本地、GPU 加速的 AI 背景移除

    一个名为 bg-vanish-mcp 的新开源项目已发布,支持 AI 助手在本地进行图像背景移除。该工具利用 Python、通过 ONNX Runtime 的 DirectML API 以及 U2NET 模型,在 Windows 上实现 GPU 加速,为云服务提供了更快、更私密的替代方案。该项目可通过 PyPI 获取,其代码可在 GitHub 上找到,允许用户将离线背景移除功能集成到其 AI 工作流程中。

  18. TOOL · CL_68934 ·

    Meta 的 EnCodec 获得可移植 C++ 实现

    Meta 的 EnCodec 音频编解码器已开发出 C++ 实现版本,旨在实现可移植性和高性能,无需外部机器学习运行时。该项目可在 GitHub 上找到,将模型权重直接编译到二进制文件中,以便于集成到 CMake 项目中。开发者正在寻求对该实现的反馈,据称其性能与 ONNX Runtime 相当或更优。

  19. TOOL · CL_66475 ·

    基于浏览器的实时变声器作为MVP发布

    一位开发者创建了一个完全在网页浏览器中运行的实时变声器。该工具利用WebAssembly、ONNX Runtime和WebGPU实现其功能。创建者已将其发布为最小可行产品,并正在寻求社区反馈以供未来开发。

  20. TOOL · CL_53659 ·

    新框架应对工业边缘 AI 部署挑战

    本文介绍了一个旨在改进工业嵌入式平台上边缘 AI 应用部署的新系统框架。它认为,将 AI 部署视为一个系统问题,而不仅仅是模型打包练习,对于成功至关重要。所提出的框架分为五个层级,从硬件到运营,并与 Android、NVIDIA Jetson、ONNX Runtime 和 TensorRT 等现有技术集成,以提高在真实工业环境中的可复现性、可诊断性和可靠性。