ONNX
PulseAugur coverage of ONNX — every cluster mentioning ONNX across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
-
中诚华隆发布HL200推理芯片及10240颗GPU集群
中诚华隆发布了其新款HL200推理芯片以及超节点智能计算集群解决方案。HL200芯片支持低精度推理,提供具有竞争力的性能和能效,旨在满足日益增长的高效AI推理需求,特别是针对大型语言模型和AI代理。配套的集群解决方案专为大规模可扩展性而设计,支持多达10240颗GPU,旨在为大规模AI部署提供一个强大且经济高效的基础。
-
AI驱动的图书推荐器利用封面图提供建议
一位软件工程师开发了一个名为 By-Its-Cover 的图书推荐系统,该系统利用 AI 根据书籍封面进行推荐。该系统采用 CLIP 嵌入技术,既能对书籍封面进行语义搜索,又能通过协同过滤模型提供个性化推荐。用户可以通过搜索书籍或通过评分提供反馈与系统互动,这些反馈会异步地将新书籍添加到数据库并优化个性化推荐。
-
开源LLM路由器提供透明、节省成本的模型选择
一个名为OmnisRouter的新型开源、自托管LLM路由器已被开发出来,旨在提供AI模型使用中的透明度和成本节约。这个代理工具集成了OpenAI、Anthropic和Gemini API,允许用户维护自己的提供商密钥。OmnisRouter会选择能够处理给定请求的最具成本效益的模型,并在每个响应中附带一张详细的收据,概述所选模型、其成本和置信度级别。路由决策由一个小型ONNX模型做出,该模型嵌入提示并将其映射到意图集群,确保昂贵的尖…
-
NVIDIA TRTMC 简化 Hugging Face 到 C++ 推理
NVIDIA 推出了 TensorRT Model Connect (TRTMC) 的公开预览版,这是一个开源工具,旨在简化将 Hugging Face 或本地检查点转换为原生 C++ TensorRT 推理的过程。此过程无需中间 ONNX 导出步骤,直接生成可集成到 C++ 服务、嵌入式应用程序或机器人堆栈中的版本化构件。该工具是在 OpenAI Codex 代理的协助下开发的,旨在简化机器人、汽车和医疗设备等各个行业需要设备端推理…
-
开发者构建本地AI检索系统以降低token成本
一位开发者创建了一个本地优先的检索系统,用于高效地回答来自大型markdown文件知识库中的问题。该系统使用带有FTS5的SQLite进行快速关键字搜索和精确过滤,并结合本地ONNX嵌入进行语义排名。通过避免处理整个文件,这种方法将每个答案的token成本从数千个显著降低到几百个。
-
FastThaiG2P系统实现快速泰语语音合成
研究人员开发了FastThaiG2P,一种用于快速泰语字母到音素转换的新型系统。该系统实现了每句话低于毫秒级的延迟,使其在文本到语音管道中效率极高。该方法利用了PyThaiNLP分词词典和规范化规则,词汇外(OOV)率低。FastThaiG2P已集成到StyleTTS 2模型中,能够以4倍实时因子发声清晰可懂的泰语语音。
-
Nvidia Jetson DLA 核心在实时流水线中实现近乎零开销的分类
研究人员开发了一种新颖的五步方法,用于在 NVIDIA Jetson DLA 核心上部署分类模型,克服了严格的算子约束和量化不兼容性带来的挑战。该方法通过允许在 GPU 上并行执行检测模型,在 DLA 上并行执行分类模型,从而在实时检测流水线中实现近乎零的开销。该方法已在双头人员属性分类器上得到验证,证明了在不增加额外成本的情况下显著提高了性能。
-
Liquid AI 发布 LFM2.5-2.6B:支持128K上下文的设备端智能体模型
Liquid AI 发布了 LFM2.5-2.6B,这是一款开源权重、专为移动和边缘设备设计的设备端智能体模型。该模型拥有26.9亿参数,128,000个token的上下文窗口,并且无需依赖云API即可执行多步任务,包括规划和工具调用。Liquid AI 报告称,LFM2.5-2.6B 在指令遵循和工具使用基准测试中,与远大于自身的模型相比,表现具有竞争力,同时在各种硬件上保持了低内存使用和快速解码速度。
-
Opt.Gear 模型为设备端 AI 提供 4.9 倍的推理速度提升
研究人员推出 Opt.Gear,这是一种针对设备端部署和实时推理进行了优化的新型基础模型。该模型采用混合架构,结合了卷积和局部-全局注意力机制,显著减少了 KV 缓存内存,与同等规模的模型相比,在 NPU 上的预填充和解码速度提高了 4.9 倍。Opt.Gear 在 2T 标记语料库的精选 0.5T 标记子集上进行了训练,具有高度的数据效率。该模型以开放权重和适用于各种平台的部署二进制文件形式发布,包括 ONNX、Qualcomm N…
-
设备端AI瓶颈从推理转移到输入处理
优化设备端AI模型的开发者通常专注于推理时间,但一位开发者发现这并非主要瓶颈。实际性能问题在于输入处理,尤其是在低端设备上。这一意外发现促使人们探索非常规的变通方法,以提高应用程序速度并实现更广泛的AI民主化。
-
DT Engineering 使用 ONNX 重建实时竞价管道
本系列文章分为两部分,详细介绍了 DT Engineering 如何使用 ONNX 重建其实时竞价管道。文章解释了采用 ONNX 的基本原理,重点关注其在简化模型部署和提高性能方面的能力。第二部分具体概述了管道的构建,强调了实现拍卖速度效率的 MLOps 考量。
-
Kmemo 2.0 语义缓存弥补性能差距,可与 GPTCache 媲美
Kmemo 2.0,一个用于 LLM 调用的语义缓存,已发布,解决了之前确定的两个不足之处。第一个不足之处是关于其验证器模型的有效性,现已量化:它阻止了初始守卫遗漏的大量近乎匹配和释义。第二个不足之处是与自建基线的比较,现已更新为包含与 GPTCache 的比较。虽然 Kmemo 的词汇链最初表现强劲,但 GPTCache 的 ONNX 交叉编码器在减少误报方面被证明更有效,尽管代价是拒绝了更多真实的改写。
-
规范知识结构 (CKS) 旨在为大型语言模型的知识带来类似 Git 的版本控制
一个名为规范知识结构 (CKS) 的新知识管理系统已被开发出来,以解决与大型语言模型 (LLM) 相关的基础设施问题,例如不可靠的事实和消失的来源。CKS 旨在为知识提供一个类似 Git 的系统,支持版本历史、矛盾检测和沙盒实验。它与 FastEmbed 等工具集成以进行离线语义搜索,并采用结构化约束来确保知识的一致性,从而能够安全地进行知识图谱的实验和修改。
-
使用Vulkan后端简化边缘设备上的ML推理
PostSlate的一名软件工程师详细介绍了他们在生产边缘设备上实现厂商无关的机器学习推理的经验。为了实现跨NVIDIA、AMD和Apple Silicon等各种硬件的广泛兼容性,他们选择了ncnn的Vulkan后端,该后端绕过了CUDA等厂商特定的解决方案。这种方法显著缩短了诸如面部检测和嵌入等任务的推理时间,并通过利用现有的Vulkan驱动程序简化了部署。
-
新数据集和模型增强了对视障行人的人工智能导航
研究人员开发了一个新的语义分割框架,旨在改善视障行人的辅助导航。该框架利用了一个名为 SENSATION-DS 的新数据集,该数据集包含胸高视角的行人图像,并具有九个与导航相关的类别分类。研究评估了五种分割架构,发现 UPerNet-MobileNetV3 实现了最高平均交并比,而 DeepLabV3Plus-MobileNetV3 在混淆道路与人行道方面表现出最低的错误率,并在智能手机上提供了实用的运行时性能。
-
Visionary 应用简化了 macOS 上的 AI 数据集创建
Visionary 是一款新的、本地运行的 macOS 应用程序,旨在简化为 AI 模型构建和策划训练数据集的过程。它整合了多个现有工具的功能,提供近乎重复项检测、按人物或分辨率对图像进行分组以及标签管理等功能。该应用程序与各种字幕模型集成,并支持与 kohya 和 diffusers 等流行训练框架兼容的导出格式。
-
Cohere增强阿拉伯语AI,扩展模型支持,并强调社区贡献
Cohere宣布了多项旨在提高AI能力,特别是针对资源匮乏语言的更新和合作伙伴关系。该公司正与HUMAIN合作推进阿拉伯语AI,并发布了一款名为listen-habibi的新工具,该工具使用Cohere的阿拉伯语转录模型将各种来源的阿拉伯语语音转录为文本。此外,Cohere还扩展了对Ruby的支持,支持CPU、CUDA和Metal执行,以及字幕和词级时间戳选项。该公司还强调了社区贡献,指出其模型在Hugging Face上提供了GGU…
-
生产级 RAG 系统:数据索引与检索实用指南
本指南详细介绍了在生产环境中部署检索增强生成(RAG)系统的工程挑战和最佳实践。它涵盖了关键方面,例如使用高级分块策略进行数据索引、选择支持混合搜索和元数据过滤的合适向量存储,以及通过多阶段管道优化检索,包括重新排序和查询转换技术(如 HyDE 和 Multi-Query)。该指南还涉及了用于延迟、成本和安全性的 LLM 集成注意事项。
-
通过量化和剪枝提高脑电图癫痫检测模型的效率
研究人员开发了使深度神经网络更有效地从脑电图数据中检测癫痫发作的方法。他们探索了将卷积神经网络(CNN)转换为脉冲神经网络、剪枝脑电图通道以及使用INT8量化。这些技术将模型大小减少了高达73%,并将推理速度提高了2.8倍,同时保持或略微提高了癫痫检测的曲线下面积(AUC)。
-
发布PrismShine工具以根据证据验证LLM代理的答案
一款名为PrismShine的新工具已发布,旨在解决现有LLM代理幻觉检查器的局限性。与仅评估最终输出的工具不同,PrismShine分析运行时证据,在生成之前或之后识别错误的根本原因,例如检索为空或工具失败。该开源工具可通过pip install获取,旨在提供针对所提供证据的可审计验证,使其区别于提示注入防火墙和代理运行时。