ONNX
PulseAugur coverage of ONNX — every cluster mentioning ONNX across labs, papers, and developer communities, ranked by signal.
- used by WebGPU 90%
- used by DJ software 90%
- used by tensorrt 70%
- used by qdrant 70%
- used by graphics processing unit 70%
- used by Raspberry Pi 5 70%
- used by NVIDIA Jetson Orin Nano 8GB 70%
- used by Audio Developer Conference 70%
- used by Anmol Mishra 70%
- affiliated with tensorrt 60%
- used by Int8 60%
- instance of Apache Software License 2.0 60%
6 天有情绪数据
-
Burn 0.22.0 版本发布,加速构建,简化集成
Burn 的最新版本 0.22.0 引入了旨在简化应用程序开发和加速编译时间的重大改进。主要变化包括从用户 API 中移除后端类型参数,允许通过设备选择执行,这使得在测试中重建速度提高了 15 倍。此次更新还通过自适应内存管理和更智能的自动调优增强了 CPU 和 GPU 上的执行性能,并增加了对 LoRA 和 QLoRA 模型适配、ONNX 导出以及扩展的远程计算能力的支持。
-
WritersLogic Inc.凭借新颖方法赢得PAN 2026检测任务
WritersLogic Inc.展示了其在CLEF 2026上的三个PAN共享任务的系统,重点关注分布偏移下的特征鲁棒性。他们的方法优先考虑生成过程而非内容,在推理轨迹检测中获得第一名,在安全分类中获得第三名。对于Voight-Kampff生成式AI检测任务,包括DeBERTa-v2和LightGBM在内的模型的校准集成取得了优异成绩。该团队还开发了一个多作者写作风格分析系统,但平台问题阻止了其正式评估。
-
指南:在 CPU 上运行 AI 文本嵌入,而不是昂贵的 GPU
一份指南建议,在昂贵的 GPU 硬件上运行文本嵌入模型是对资源的低效利用。“SRE RAG FinOps 蓝图”建议将嵌入任务卸载到 CPU,利用 ONNX 和 AVX-512 等优化来加快推理速度。它还推荐了 Matryoshka Truncation 和 QInt8 Quantization 等技术,以减少内存使用量并提高 CPU 在嵌入方面的性能。
-
INT8 量化可移植性研究揭示硬件间的不一致性
一项新研究挑战了 INT8 量化在不同硬件平台之间可普遍用于人工智能推理的假设。研究人员发现,INT8 的加速效果在很大程度上取决于特定的 CPU 指令集,某些硬件甚至出现了性能下降而非加速。此外,INT8 的输出在不同平台之间并不一致,当量化比例不是硬件原生支持时,会导致准确性下降。研究得出结论,对于确定性和准确性至关重要的嵌入式和汽车应用而言,“一次量化,随处部署”的方法并不可靠。
-
新研究探讨VLA模型效率和延迟权衡 · 跟踪2个来源
两篇新研究论文探讨了视觉-语言-动作(VLA)模型的效率和性能。第一篇论文分析了SmolVLA,展示了ONNX等部署优化如何显著降低延迟,但可能会影响任务成功率,尤其是在空间任务中。第二篇论文研究了高效VLA模型的设计,发现动作头初始化对性能至关重要,并且当前的扩展实践在准确性方面可能会带来边际效益递减的延迟。
-
新工具通过量化分析简化AI模型部署
一篇新论文介绍了一种量化分析工具(Quantization Analysis Tool),旨在优化AI模型在资源受限设备上的部署。该工具基于ONNX框架构建,提供逐层敏感性分析以及权重和激活分布的可视化,以指导精度选择。实验表明,该工具提高了量化后的准确性,通过帮助开发人员平衡模型大小、延迟和准确性,从而实现更高效的实际部署。
-
开发者用本地 Ollama 取代云 LLM 以节省成本
一位开发者已将其 RAG 聊天机器人的云端生成组件替换为本地 LLM,具体来说是运行 qwen2.5-coder:32b 模型的 Ollama。此举的动机是节省成本和保护隐私,用云 API 费用换取潜在的质量和延迟权衡。该设置包括使用 ONNX 和 BM25 的本地检索系统、运行 Ollama 的 GPU 服务器以及通过自定义模型上下文协议 (MCP) 服务器进行通信的 VS Code。这种新架构还使得在 VS Code 中能够使用 …
-
迪拜初创公司拥抱设备端AI以实现数据主权,应对云监控担忧
迪拜的初创公司正越来越多地采用设备端AI,以遵守阿联酋即将于2026年生效的数据主权法律。这一转变的驱动因素是对云监控的担忧以及保护企业数据隐私的需求。该方法涉及使用本地优先的自主代理、ONNX等量化模型以及Qdrant等本地向量数据库,以确保安全执行和数据主权。
-
H3DNAS 框架通过 ONNX 压缩 3D 点云模型以适应边缘硬件
研究人员开发了 H3DNAS,一个新颖的框架,旨在压缩 3D 点云模型以部署在 NVIDIA Jetson Orin Nano 等边缘硬件上。与需要原始源代码的现有方法不同,H3DNAS 直接在 ONNX 二进制文件上运行,使其适用于通过常见渠道分发的模型。该框架引入了通道依赖图来建立理论压缩上限,并采用包括通道选择和结构突变的双阶段分层搜索。该方法在 PointNet 和 PointNet++ 等模型中成功地显著减少了参数,同时几乎…
-
新的 H3DNAS 框架在 ONNX 二进制文件上压缩 3D 点云模型
研究人员开发了 H3DNAS,一个新颖的 3D 点云模型压缩框架,可以直接在 ONNX 二进制文件上运行,无需原始源代码。该方法通过在分布式 ONNX 文件上进行压缩,解决了在 NVIDIA Jetson Orin Nano 等边缘硬件上部署模型的局限性。H3DNAS 利用通道依赖图和两阶段分层搜索来减少模型参数,并在精度损失最小的情况下提高推理速度。
-
ComfyUI 专用 MiniMax-H3 VAE 速度提升高达 1.7 倍
ComfyUI 现已推出 MiniMax-H3 变分自编码器 (VAE) 的新实现,并使用 TensorRT 进行了优化。此版本旨在显著提高处理速度,据报道比之前的实现快 1.7 倍。
-
使用 ONNX 和 TensorRT 通过 NVIDIA Triton 部署 YOLOv8
本文详细介绍了如何使用 NVIDIA Triton 推理服务器部署 YOLOv8 对象检测模型。文章解释了将 YOLOv8 的 ONNX 格式转换为 TensorRT(一种高性能推理优化器)的过程,然后通过 Triton 的原生 TensorRT 后端进行部署。该指南特别强调了使用 Triton Control 来简化为高效模型部署创建特定目标 TensorRT 计划的过程。
-
Hugging Face 发布售价 399 美元的开源 Microduck 机器人,采用 RL 训练
Hugging Face 的机器人团队 Pollen Robotics 推出了 Microduck,这是一款开源的 25 厘米双足机器人,现已开放预订,售价 399 美元。该机器人专为动态运动和自我恢复而设计,其所有行为均在物理模拟器中使用强化学习进行训练。训练环境、奖励函数和从模拟到现实的迁移方法均在 GitHub 上公开提供,用户可以训练和定制机器人的动作。
-
ExLlamaSharp v1.2.1-beta 添加了 OpenAI 兼容 API 和 EXL3 推理
Kortexio 发布了 ExLlamaSharp v1.2.1-beta,这是一个支持 NVIDIA GPU 的 Windows 本地 LLM 服务器。此 beta 版本引入了 OpenAI 兼容的 API 端点、Blazor 管理界面以及增强的 EXL3 推理功能。主要更新包括 LoRA 适配器的实时 CRUD 操作、多 GPU 支持和 ONNX 嵌入,但建议在生产环境中使用稳定的 v1.1.1 安装。
-
AWS、NVIDIA 和 Heidi Health 将 ASR 推理成本降低 75%
AWS、NVIDIA 和 Heidi Health 合作,在 Amazon EC2 实例上将自动语音识别 (ASR) 推理成本降低了 75%。通过实施 NVIDIA MPS 和 NVIDIA Triton 推理服务器,他们实现了所需 GPU 实例数量的 75% 的降低,从 16 个减少到 4 个,同时保持了亚秒级延迟。这种优化解决了 ASR 中每个请求的 GPU 利用率低的问题,而传统的 CUDA 时间切片会导致大量硬件容量闲置。
-
ONNX模型跨两个应用和三个处理器部署演示
本文提供了一个实用的指南,介绍如何在多个应用程序和硬件配置中部署单个ONNX情感模型。文章详细介绍了使用Windows ML进行的一次实践演练,展示了一个模型如何在不同处理器上使用,突出了ONNX格式的灵活性和效率。
-
AI框架助力植物病害诊断和水果分类
研究人员开发了用于农业应用的高级AI框架,重点关注植物病害诊断和水果分类。第一项研究介绍了H²MAF,该框架将EfficientNet-B3和ConvNeXt-Tiny等视觉模型与Gemma 4 E4B和Qwen3.5 4B等多模态大语言模型(MLLMs)融合,以提供可解释的植物病害诊断和风险评估。第二项研究提出了一种使用TinyCLIP的轻量级视觉-语言框架,用于早期绿色水果分类,并针对NVIDIA Jetson硬件上的边缘部署进行了优化。
-
新的ONNX-Net系统实现了通用的神经架构表示
研究人员开发了ONNX-Net,这是一种创建神经架构通用表示的新方法,旨在克服现有方法受限于特定搜索空间的局限性。该系统利用ONNX文件以统一格式表示各种神经网络,从而允许单个性能预测器跨不同架构进行泛化。基于文本的编码可以容纳任意的层类型和参数,从而能够通过强大的零样本性能即时评估架构。
-
新的 SAMpLE 框架将机器学习模型集成到 SystemC-AMS 虚拟原型中
研究人员开发了 SAMpLE,一个开源框架,将机器学习模型集成到 SystemC-AMS 虚拟原型中。该框架允许机器学习模型作为一流的时序数据流组件运行,简化了它们在仿真中的集成。SAMpLE 提供两个执行后端:一个用于在 C++ 中对轻量级模型进行在线训练,另一个用于执行外部开发且无需手动集成的模型。它利用 ONNX 进行模型交换,从而在一个统一且可复现的仿真环境中评估各种基于机器学习的解决方案。
-
AI 模型现在使用 ONNX Runtime Web 直接在浏览器中运行
ONNX Runtime Web 使得背景移除和特征提取等复杂的 AI 任务可以直接在网页浏览器中执行。这种客户端处理消除了对强大后端服务器的需求,降低了与将敏感数据发送到云端相关的延迟、带宽消耗和隐私担忧。该架构利用 ONNX 实现模型互操作性,利用 ONNX Runtime Web 作为编译为 WebAssembly 的执行引擎,并利用 WebGL 和 WebGPU 等浏览器硬件加速 API 进行高效计算。