PulseAugur
实时 10:03:03
实体 tensorrt

tensorrt

PulseAugur coverage of tensorrt — every cluster mentioning tensorrt across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 25 条
  1. TOOL · CL_206551 ·

    低成本AI系统在边缘设备上检测织物缺陷

    研究人员开发了一个两阶段织物缺陷检测系统,专为在NVIDIA Jetson Nano等边缘设备上进行低成本部署而设计。该系统使用轻量级自编码器进行初步筛选,然后使用YOLOv5n模型仅对标记的帧进行更详细的分析。与单阶段检测器相比,这种级联方法旨在降低计算成本并提高推理速度,尽管研究指出JPEG解码等数据路径开销会显著影响整体加速效果。研究结果表明,虽然级联方法具有潜在的效率提升,但要实现速度优势,必须仔细考虑整个数据管道。

  2. TOOL · CL_206068 ·

    AI管道通过提高准确性来加强童工检测

    研究人员开发了一个实时边缘视觉管道,旨在通过检测儿童和估计他们的年龄来协助打击童工。该系统作为研究原型构建,显著改进了先前的检测方法,在儿童年龄估计方面实现了更高的平均精度和更低的平均绝对误差。该管道在现场试点中展示了检测产量和身份整合方面的实质性进展,同时还记录了数据保护和人类监督方面的挑战和必要保障措施。

  3. TOOL · CL_198245 ·

    Nvidia Jetson DLA 核心在实时流水线中实现近乎零开销的分类

    研究人员开发了一种新颖的五步方法,用于在 NVIDIA Jetson DLA 核心上部署分类模型,克服了严格的算子约束和量化不兼容性带来的挑战。该方法通过允许在 GPU 上并行执行检测模型,在 DLA 上并行执行分类模型,从而在实时检测流水线中实现近乎零的开销。该方法已在双头人员属性分类器上得到验证,证明了在不增加额外成本的情况下显著提高了性能。

  4. TOOL · CL_183686 ·

    Ollama v0.32.6 提升 Qwen 3.5 在 Apple Silicon 上的速度,改进 OpenAI 兼容性 · 跟踪 4 个来源

    Ollama 发布了 0.32.6 版本,通过 MLX 引擎和推测性解码显著提高了 Qwen 3.5 模型在 Apple Silicon Mac 上的性能。此次更新还通过对 /v1/chat/completions 端点的流式格式进行对齐,增强了与 OpenAI API 的兼容性。此外,KataGo 和 llama.cpp 等其他相关项目也收到了错误修复,KataGo 解决了 TensorRT 问题,llama.cpp 解决了 Vul…

  5. TOOL · CL_174318 ·

    PixOOD pipeline 针对自动驾驶汽车的实时异常分割进行了优化

    研究人员开发了一个高效的异常分割管道 PixOOD,专为在自动驾驶汽车和铁路系统中的嵌入式硬件上进行实时部署而设计。这种新方法优化了原始 PixOOD 方法的 Neyman-Pearson 评分阶段,并利用了硬件加速的 TensorRT 编译。优化后的管道实现了显著更快的速度,在桌面 NVIDIA RTX 4060 GPU 上达到 182 FPS,在 NVIDIA Jetson AGX Orin 嵌入式平台上达到 75 FPS,使得先…

  6. TOOL · CL_171933 ·

    轻量级AI模型识别猛禽物种,保障风力涡轮机安全

    研究人员开发了一个轻量级图像分类系统,用于在边缘设备上识别猛禽物种,专门用于风力涡轮机碰撞缓解。该系统利用知识蒸馏,以一个大型DINOv2-L模型作为教师,训练MobileNetV4、ViT-Small和EfficientNet-B0等小型模型。通过将数据集扩展到12,500多张图像,特别是增加了白尾海雕的图像数量,该系统显著提高了该物种的召回率并减少了误分类错误。当使用TensorRT部署在NVIDIA Jetson Orin Na…

  7. TOOL · CL_158379 ·

    NVIDIA TensorRT 增加了构建监控和取消功能

    NVIDIA 为其 TensorRT 引擎引入了新功能,允许用户直接通过 Python 或 C++ 接口监控和取消长时间运行的引擎构建。此增强功能为大型模型部署提供了更大的控制力,从而简化了开发和优化过程。

  8. TOOL · CL_141754 ·

    NanoVSR:面向边缘设备的实时视频超分辨率技术发布

    研究人员开发了NanoVSR,一种专为边缘设备优化的新型视频超分辨率架构。这种全卷积模型利用结构重参数化技术,使其能够与TensorRT等硬件加速器兼容,从而在没有显式光流或Transformer组件的情况下实现实时性能。在REDS4基准测试中,NanoVSR在恢复质量和计算效率之间取得了良好的平衡,并在NVIDIA Jetson Orin NX 16GB等硬件上实现了高帧率。

  9. RESEARCH · CL_141273 ·

    工业机器视觉边缘推理框架基准测试 · 跟踪 2 个来源

    一篇新的研究论文对四种流行框架——PyTorch、ONNX Runtime、OpenVINO 和 TensorRT——在工业机器视觉边缘设备上的深度学习推理性能进行了基准测试。研究发现,OpenVINO 在 CPU 上提供了最快的推理时间,而 TensorRT 在 GPU 上效率最高。然而,在评估基于 Transformer 的视觉模型时,TensorRT 的性能并未优于 PyTorch。

  10. RESEARCH · CL_128471 ·

    新模型通过整合视觉和状态来增强机器人操作能力

    研究人员开发了几种新方法,通过更好地整合视觉信息与机器人的状态和动作来提高机器人操作能力。例如,GeoProp 是一种轻量级适配器,通过将机器人状态投影到图像平面并注入空间先验来对齐本体感觉和视觉。RoboDojo 提供了一个统一的模拟和真实基准,用于评估通用机器人操作策略在各种任务中的表现。DSWAM 引入了一种双系统方法,将世界动作模型执行器与视觉语言规划器相结合,以实现细粒度操作,而 DynaWM 使用专门针对动态物体操作的基于…

  11. TOOL · CL_108041 ·

    Transformer模型增强了自动驾驶车队的安全

    研究人员开发了AIMformer,一个基于Transformer的框架,用于实时检测车队中的不当行为。该系统利用多头自注意力机制分析车辆内部的时间动态以及车辆之间的时空相关性。AIMformer针对边缘部署进行了优化,实现了亚毫秒级的推理延迟,并采用以精度为中心的损失函数,以最大限度地减少安全关键应用中的误报。

  12. TOOL · CL_93196 ·

    新的RAMS系统为边缘AI感知适配YOLOv8层级

    研究人员开发了RAMS,一种专为嵌入式边缘感知系统设计的新型运行时控制器。RAMS根据实时设备资源监控和检测条件,在YOLOv8模型的不同层级之间动态切换。这种自适应方法旨在优化推理延迟和检测质量之间的平衡,尤其是在资源受限的环境中,例如在Raspberry Pi 5和NVIDIA Jetson Orin平台上。

  13. RESEARCH · CL_83909 ·

    NVIDIA推出Halos OS以认证Robotaxi安全性

    NVIDIA推出了Halos操作系统(OS),以增强自动驾驶汽车的安全性,特别是Robotaxi。这款新的OS基于NVIDIA DRIVE Hyperion平台构建,为人工智能驱动的车辆提供了经过认证的基础,解决了感知、决策和故障隔离方面的挑战。Halos OS包括符合ISO 26262 ASIL D标准的、经过安全认证的操作系统Halos Core,以及提供传感器和车辆集成标准化接口的Halos SDK,旨在加速Robotaxi车队…

  14. TOOL · CL_79860 ·

    LogNEO框架使用GPT-Neo进行实时日志异常检测

    研究人员开发了LogNEO,一个使用EleutherAI的GPT-Neo模型检测系统日志中异常的新框架。该系统采用了一种新颖的强化学习方法,并结合了位置感知奖励机制和交叉熵正则化。LogNEO在标准基准测试中取得了高F1分数,在召回率方面优于先前最先进的方法,并且已在生产环境中得到验证,具有低延迟和高吞吐量。

  15. TOOL · CL_60490 ·

    Together AI 构建了世界上最快的语音转文本堆栈

    Together AI 开发了一个高效的语音转文本系统,其速度显著优于现有模型。他们的方法解决了音频数据处理的独特挑战,音频数据比文本大得多,并且需要大量的预处理。通过优化从 CPU 预处理到 GPU 执行的整个数据路径,Together AI 在流式和离线转录任务上都实现了创纪录的低延迟和高吞吐量。

  16. TOOL · CL_53659 ·

    新框架应对工业边缘 AI 部署挑战

    本文介绍了一个旨在改进工业嵌入式平台上边缘 AI 应用部署的新系统框架。它认为,将 AI 部署视为一个系统问题,而不仅仅是模型打包练习,对于成功至关重要。所提出的框架分为五个层级,从硬件到运营,并与 Android、NVIDIA Jetson、ONNX Runtime 和 TensorRT 等现有技术集成,以提高在真实工业环境中的可复现性、可诊断性和可靠性。

  17. TOOL · CL_64237 ·

    DEMON引擎使扩散模型能够实时作为乐器进行控制

    研究人员开发了DEMON,一个实时扩散引擎,允许用户像控制乐器一样控制去噪过程。该系统能够对各种参数进行现场表演调整,在消费级GPU上达到每秒12.3次解码器完成的速度。DEMON利用了新颖的机制,如每槽异构去噪调度和共享可变状态,从而实现对扩散过程的响应式控制。

  18. TOOL · CL_37252 ·

    AI视频推理通过优化流水线而非模型,速度提升3倍

    研究人员开发了一种无需更改模型本身即可显著加速计算机视觉模型视频推理的方法。通过优化帧读取、模型推理和结果可视化等流水线环节,他们实现了三倍的速度提升。该方法利用多线程并行化帧解码、推理和图像写入等任务,确保GPU得到更有效的利用。优化后的方法旨在降低推理速度对帧解码或图像保存等最慢环节的依赖性。

  19. RESEARCH · CL_30131 ·

    新框架优化多GPU系统上的LLM推理能耗

    研究人员开发了EnergyLens,一个旨在优化大型语言模型(LLM)在多GPU系统上推理过程中的能耗的框架。该工具解决了预测和减少LLM能耗的挑战,这对于可持续性和数据中心的高效运营至关重要。EnergyLens利用一个基于einsum的接口和一个经验驱动的通信能耗模型来捕捉复杂的LLM规范和多GPU行为,实现了低预测误差,并揭示了不同配置之间显著的能耗差异。

  20. RESEARCH · CL_21806 ·

    新的卫星系统利用人工智能在严格约束下进行实时野火检测

    研究人员开发了一种用于卫星的实时野火检测系统,该系统设计用于在严格的在轨约束下运行。该系统采用一种轻量级的密集表示学习方法,特别是DenseMAE,来处理热红外图像并将火灾识别为小的异常。这种方法在模型占用空间小和推理时间快的情况下实现了高精度,在极端类别不平衡的挑战性条件下优于传统方法。