PulseAugur
中
实时 17:36:10
实体 tensorrt

tensorrt

PulseAugur coverage of tensorrt — every cluster mentioning tensorrt across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
37
90 天内 37
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 41 条
  1. TOOL · CL_283438 ·

    为AI工程师解析Nvidia GPU术语

    本文为AI工程师定义了必不可少的GPU术语,涵盖了从CUDA核心到NVLink的概念。文章解释了这些NVIDIA GPU概念如何影响模型拟合、执行速度和可扩展性。该文旨在使AI专业人士掌握相关知识,以了解和优化其机器学习工作负载的GPU性能。

  2. TOOL · CL_278489 ·

    ComfyUI 视频放大器更新,支持低显存系统

    ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT 工具的新版本已发布,特别针对拥有 6GB 或 8GB 显存的用户。1.6.0 版本引入了 DisTorch2 DiT 加载器节点和 Phase 2 VRAM 控制,旨在减少 Diffusion Transformer 处理过程中的显存峰值。此次更新为低显存系统提供了更大的批处理大小灵活性,但可能会略微降低图像质量。

  3. TOOL · CL_272967 ·

    ComfyUI 工具更新稳定低端 GPU 显存

    ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT 工具发布了新版本,专门解决了 Diffusion Transformer (DiT) 处理过程中显存使用峰值的问题。此次更新版本号为 1.5.7,旨在稳定显存消耗,使其对拥有 6GB 或 8GB 显存的用户更加友好。这些改进通过允许更高的批处理大小和更高效的处理,使所有用户受益,即使是在拥有更大显存容量的系统上。

  4. TOOL · CL_259254 ·

    Ultralytics YOLO Evolution: From YOLOv5 to YOLO27 Detailed in New Paper

    一篇全面的论文回顾了 Ultralytics 的 YOLO 物体检测模型的演变,详细介绍了从 YOLOv5 到最新的 YOLO27 的进步。YOLO27 引入了双架构策略,其中紧凑型版本使用简化的 CNN,而大型版本则采用 Transformer 解码器进行无 NMS 检测。该论文涵盖了架构变更、在 COCO 上的基准测试结果以及跨各行业的部署考量,同时还讨论了 YOLO 系统的未来挑战和方向。

  5. TOOL · CL_259253 ·

    VPEngine框架将机器人视觉推理速度提升3倍

    研究人员开发了VPEngine,一个旨在优化机器人视觉任务GPU使用的新型框架。该系统利用共享的基础模型提取图像表示,然后将其高效地分发给多个并行运行的专用任务头。这种方法避免了冗余计算和内存开销,与顺序模型执行相比,速度最高可提升3倍。VPEngine是开源的,用Python编写,并带有ROS2 C++绑定,已在NVIDIA Jetson Orin AGX上展示了实时性能。

  6. TOOL · CL_255003 ·

    TokenMask简化视觉Transformer分割,提升效率

    研究人员开发了TokenMask,一种在Token空间直接操作的视觉Transformer分割新方法,无需进行密集的空间特征图重建。该方法简化了计算结构,降低了内存和计算需求,同时保持了具有竞争力的准确性。通过在NVIDIA Jetson AGX Orin等硬件上使用TensorRT实现更快的推理,TokenMask提高了效率和速度,尤其适用于嵌入式视觉系统。

  7. TOOL · CL_254864 ·

    AI框架赋能边缘硬件实时水果检测

    研究人员开发了一个用于嵌入式硬件(特别是NVIDIA Jetson Orin Nano Super)上实时水果检测和视频分析的框架。该系统利用在各种水果数据集上训练的轻量级YOLO26s检测器,并使用PyTorch和TensorRT进行优化以实现高效部署。时间分析使用APPLE MOTS进行多目标跟踪和唯一水果计数,并集成到NVIDIA DeepStream管道中。该框架实现了高帧率,并证明了基于边缘的水果监测的可行性,尽管性能会因采…

  8. TOOL · CL_254783 ·

    新型“woma”基础模型树立内窥镜检查实时标准

    研究人员开发了“woma”,一种用于胃肠内窥镜检查的实时基础模型,该模型在约一百万帧内窥镜图像上进行了无标签训练。该模型可以针对特定任务进行微调,例如息肉检测和病变标记。“woma”模型表现出高水平的性能,以高精度发现了 96% 的息肉,并在 92% 的帧中正确命名了解剖学标志。值得注意的是,它在单个工作站 GPU 上运行速度约为每秒 100 帧,在速度和效率方面均优于 PyTorch、ONNX Runtime 和 TensorRT 等流行框架。

  9. TOOL · CL_248481 ·

    在一块GPU上运行多个AI模型:挑战与考量

    本文探讨了在单个GPU上运行多个AI模型的挑战,重点关注潜在的冲突和性能下降。文章强调了在将工作负载整合到一块硬件上时,需要考虑的模型干扰、系统稳定性和效率等关键问题。旨在指导用户优化其多模型GPU部署。

  10. TOOL · CL_240596 ·

    LLM推理服务器共享GPU内存以服务数百名用户

    通过将大型语言模型的模型权重加载到GPU内存中一次,并跨所有请求共享它们,可以实现用单个GPU同时服务数百名用户。推理服务器管理此过程,利用连续批处理等技术来优化GPU利用率。虽然模型权重是只读的并且可以共享,但每个请求的状态,特别是KV缓存,是复制的,并最终限制了并发级别。

  11. COMMENTARY · CL_237416 ·

    任务编译器概念将人工智能开发从模型转向意图

    一个名为“任务编译器”的新概念提出,将人工智能开发从以模型为中心转向以任务为中心。这种方法将允许开发人员定义期望的结果和约束,例如准确性和延迟,然后由编译器自动确定最佳模型和实现策略。该系统的核心将是“任务中间表示”(Task IR),它将人类意图转换为结构化格式,使编译器能够为NVIDIA Jetson Orin等特定硬件目标搜索和优化合适的模型。

  12. TOOL · CL_232071 ·

    ComfyUI 专用 MiniMax-H3 VAE 速度提升高达 1.7 倍

    ComfyUI 现已推出 MiniMax-H3 变分自编码器 (VAE) 的新实现,并使用 TensorRT 进行了优化。此版本旨在显著提高处理速度,据报道比之前的实现快 1.7 倍。

  13. TOOL · CL_227910 ·

    使用 ONNX 和 TensorRT 通过 NVIDIA Triton 部署 YOLOv8

    本文详细介绍了如何使用 NVIDIA Triton 推理服务器部署 YOLOv8 对象检测模型。文章解释了将 YOLOv8 的 ONNX 格式转换为 TensorRT(一种高性能推理优化器)的过程,然后通过 Triton 的原生 TensorRT 后端进行部署。该指南特别强调了使用 Triton Control 来简化为高效模型部署创建特定目标 TensorRT 计划的过程。

  14. TOOL · CL_226564 ·

    开源SeedVR2+TensorRT Studio提供更快的本地视频升频

    一款名为SeedVR2+TensorRT Studio的新的开源应用程序已发布,提供本地、GPU加速的视频修复和升频功能。该工具利用SeedVR2和TensorRT实现更快的处理速度,尤其是在NVIDIA RTX GPU上,并包含在完全渲染前预览结果和恢复中断渲染等功能。一个示例演示了在NVIDIA RTX 5090上,将一个8秒的片段升频至2K大约需要8分钟。

  15. TOOL · CL_222176 ·

    AWS、NVIDIA 和 Heidi Health 将 ASR 推理成本降低 75%

    AWS、NVIDIA 和 Heidi Health 合作,在 Amazon EC2 实例上将自动语音识别 (ASR) 推理成本降低了 75%。通过实施 NVIDIA MPS 和 NVIDIA Triton 推理服务器,他们实现了所需 GPU 实例数量的 75% 的降低,从 16 个减少到 4 个,同时保持了亚秒级延迟。这种优化解决了 ASR 中每个请求的 GPU 利用率低的问题,而传统的 CUDA 时间切片会导致大量硬件容量闲置。

  16. RESEARCH · CL_221276 ·

    AI框架助力植物病害诊断和水果分类

    研究人员开发了用于农业应用的高级AI框架,重点关注植物病害诊断和水果分类。第一项研究介绍了H²MAF,该框架将EfficientNet-B3和ConvNeXt-Tiny等视觉模型与Gemma 4 E4B和Qwen3.5 4B等多模态大语言模型(MLLMs)融合,以提供可解释的植物病害诊断和风险评估。第二项研究提出了一种使用TinyCLIP的轻量级视觉-语言框架,用于早期绿色水果分类,并针对NVIDIA Jetson硬件上的边缘部署进行了优化。

  17. TOOL · CL_206551 ·

    低成本AI系统在边缘设备上检测织物缺陷

    研究人员开发了一个两阶段织物缺陷检测系统,专为在NVIDIA Jetson Nano等边缘设备上进行低成本部署而设计。该系统使用轻量级自编码器进行初步筛选,然后使用YOLOv5n模型仅对标记的帧进行更详细的分析。与单阶段检测器相比,这种级联方法旨在降低计算成本并提高推理速度,尽管研究指出JPEG解码等数据路径开销会显著影响整体加速效果。研究结果表明,虽然级联方法具有潜在的效率提升,但要实现速度优势,必须仔细考虑整个数据管道。

  18. TOOL · CL_206068 ·

    AI管道通过提高准确性来加强童工检测

    研究人员开发了一个实时边缘视觉管道,旨在通过检测儿童和估计他们的年龄来协助打击童工。该系统作为研究原型构建,显著改进了先前的检测方法,在儿童年龄估计方面实现了更高的平均精度和更低的平均绝对误差。该管道在现场试点中展示了检测产量和身份整合方面的实质性进展,同时还记录了数据保护和人类监督方面的挑战和必要保障措施。

  19. TOOL · CL_198245 ·

    Nvidia Jetson DLA 核心在实时流水线中实现近乎零开销的分类

    研究人员开发了一种新颖的五步方法,用于在 NVIDIA Jetson DLA 核心上部署分类模型,克服了严格的算子约束和量化不兼容性带来的挑战。该方法通过允许在 GPU 上并行执行检测模型,在 DLA 上并行执行分类模型,从而在实时检测流水线中实现近乎零的开销。该方法已在双头人员属性分类器上得到验证,证明了在不增加额外成本的情况下显著提高了性能。

  20. TOOL · CL_183686 ·

    Ollama v0.32.6 提升 Qwen 3.5 在 Apple Silicon 上的速度,改进 OpenAI 兼容性 · 跟踪 4 个来源

    Ollama 发布了 0.32.6 版本,通过 MLX 引擎和推测性解码显著提高了 Qwen 3.5 模型在 Apple Silicon Mac 上的性能。此次更新还通过对 /v1/chat/completions 端点的流式格式进行对齐,增强了与 OpenAI API 的兼容性。此外,KataGo 和 llama.cpp 等其他相关项目也收到了错误修复,KataGo 解决了 TensorRT 问题,llama.cpp 解决了 Vul…