LocateAnything-3B
PulseAugur coverage of LocateAnything-3B — every cluster mentioning LocateAnything-3B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Om AI 获得融资,开源边缘原生 VLX-Seek 1.5 模型
Om AI 已获得数亿元人民币融资,并开源了其 VLX-Seek 1.5 模型,将其定位为“边缘原生”物理应用人工智能领域的领导者。这种方法优先考虑低延迟、降低功耗和部署在设备上的成本效益,与 NVIDIA 和 Google 等竞争对手的云中心模型形成对比。VLX-Seek 1.5 模型,特别是其 3B 参数版本,在物体检测和空间推理的基准测试中,与更大的模型相比表现出卓越的性能,凸显了其流式多模态架构在现实场景中的有效性。
-
Om AI联慧获融资,开源边缘AI模型
Om AI联慧已获得数亿元人民币的新一轮融资,由前海母基金领投。该公司还宣布开源其原生于边缘的多模态模型VLX-Seek 1.5,据称该模型在同等参数量下性能超越Nvidia的核心模型。这笔资金将用于推进VLX模型开发,并加速物理AI应用的商业化,重点关注边缘解决方案。
-
研究人员寻求arXiv推荐以支持其Locate-SAM2计算机视觉论文
两位独立研究员正在为其关于名为Locate-SAM2的新型计算机视觉系统的论文寻求推荐。该系统通过一个轻量级适配器连接NVIDIA的LocateAnything-3B和Meta的SAM 2.1,旨在确定选择的定位器是否会影响模块化文本到掩码(text-to-mask)流程中的掩码质量。他们的工作在RefCOCO数据集上展示了具有竞争力的性能,达到了0.772 mIoU,并包含了详细的比较、消融研究以及失败案例分析。
-
微软 Build 大会发布新 AI 模型和硬件,面临数据中心批评
微软的 Build 大会展示了新硬件、开源 AI 模型和令人印象深刻的进展。然而,他们关于扩展数据中心的说法受到了批评。此次活动还突出了 LM Studio 在 iPhone 上的集成以及 NVIDIA 的新 LocateAnything-3B 模型用于图像生成,尽管存在许可限制。
-
Nvidia 的 LocateAnything-3B 模型将寿司误识别为甜食
Nvidia 的 LocateAnything-3B 模型,专为物体检测和定位而设计,在其演示视频中被观察到将寿司误识别为甜食。这一奇怪的错误被 r/LocalLLaMA subreddit 的用户注意到,他们觉得这个错误很有趣,并表明了该模型目前的局限性。该模型可在 Hugging Face 上获取,供进一步检查。