Very Large Array
PulseAugur coverage of Very Large Array — every cluster mentioning Very Large Array across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
明略科技与海康机器人携手推出商用机器人具身智能
明略科技与海康机器人正合作将具身智能集成到商用服务机器人中。他们在2026世界机器人大会上展示了解决方案,专注于在餐饮、物流和安防等场景的复杂环境中自主完成任务。明略科技旨在为机器人配备AI“大脑”,利用其在VLM/VLA方面的专业知识以及海康机器人的硬件能力,实现独立的多步操作。
-
新方法微调机器人以实现多任务操作
研究人员开发了一种新颖的自监督方法,用于微调视觉语言动作(VLA)模型以执行机器人操作任务。该方法从 VLA 自身的零样本交互中生成额外的训练数据,使其能够从专家数据中学习新技能,同时保留其原始的指令遵循能力。在真实的 ALOHA 机器人和 RoboTwin 模拟基准上的实验表明,该方法能够实现具有更高样本效率的鲁棒多任务策略。
-
星纪时代CEO:世界模型将驱动下一代具身智能
星纪时代CEO陈建宇提出,具身智能将从视觉-语言-动作(VLA)模型转向世界模型。VLA专注于模仿人类行为,而世界模型旨在理解和预测物理世界的动态,从而实现机器人更强的泛化能力。陈建宇强调,这种由视频预测驱动的方法为机器人应对新任务和与复杂环境互动提供了更坚实的基础,超越了单纯的模仿。
-
新框架将通用人工智能模型适配到人形机器人控制
研究人员开发了人形适应框架(HAF),这是一个旨在将通用视觉-语言-动作(VLA)模型适配到复杂人形机器人任务的新颖系统。HAF包含两个主要组件:HAF-VLA,它将全身动作生成分解为分层阶段,以保持运动学依赖性;以及HAF-Steer,一个在紧凑的潜在空间中有效优化策略的强化学习流程。这种方法避免了直接修改大型VLA骨干网络,从而实现了更安全、计算效率更高的实际部署,并提高了运动操纵任务的协调性。
-
具身智能面临新瓶颈,企业构建持续学习系统 · 追踪1个来源
具身智能领域正面临新的瓶颈,因为各种技术方法正在收敛到相似的核心问题上。企业正在努力解决如何有效地将数据、模型理解和行动执行整合到一个持续学习的循环中。这涉及到弥合数据与模型、视觉理解与物理动作、以及模拟与现实应用之间的差距,需要系统性的方法,而不是孤立的模型改进。
-
科大讯飞成立新机器人公司,以“具身认知”挑战VLA模型
科大讯飞成立了安徽妖猫智能科技有限公司,专注于开发机器人的“大脑”。该公司由科学家潘家领衔,提出了一种新的具身智能方法,超越了现有的视觉-语言-动作(VLA)模型。他们提出的“Embodied-Omni”模型强调“本体认知”和“联合生成”,以解决在预测未来状态和准确执行动作方面的局限性。
-
光鉴科技发布具身AI视觉感知解决方案
光鉴科技推出了一款新的具身AI视觉感知解决方案,旨在增强机器人理解和与物理世界交互的能力。该解决方案利用AI驱动的双目视觉技术,集成了智能感知算法和高效计算架构,支持环境感知、空间理解、导航和精确操作等核心机器人功能。该系统旨在应对复杂环境、多样化任务和有限的板载计算能力带来的挑战,从而加速具身AI的产业化和广泛应用。
-
普渡机器人以“一个大脑,多种形态”AI战略引领全球市场 · 跟踪1个来源
普渡机器人已成为商用服务机器人市场的全球领导者,已在85个国家和16个行业部署了超过13万台设备。该公司的“一个大脑,多种形态”战略围绕其自主研发的具身AI大模型PuduFM及其操作系统PuduAgent展开。PuduFM集成了物理直觉模型(PIM)、视觉语言对齐系统(VLA)和仿真引擎(World Model),使机器人能够从真实世界数据和虚拟训练中学习,促进不同机器人形态和任务之间的经验迁移。这种方法旨在克服传统机器人需要任务特定…
-
新的 UniTac 框架让机器人获得“触觉想象力”· ECCV 2026
研究人员开发了 UniTac,一个将触觉传感与视觉-语言-动作 (VLA) 模型集成的机器人新框架。该系统允许机器人在物理接触前预测物体的触觉属性,从而能够更精细地操控易碎或柔性物品。UniTac 统一了多样化的触觉传感器数据,使机器人能够“想象”触觉并改进其交互策略,这是推进具身人工智能的关键一步。
-
机器人空间表征失真而非物理知识阻碍通用性:新研究
中山大学和 X-Era AI Lab 的研究人员发现,机器人在新环境中操作失败的主要原因并非缺乏物理理解,而是空间表征不匹配。他们的工作发表在 CVPR 2026 和 ACM MM 2026 的论文中,表明当前的视觉-语言-动作 (VLA) 模型在通用性方面遇到的困难源于空间建模不准确,而非物理推理或动作控制的缺陷。通过引入仅需少量可学习参数的轻量级适配框架,如特征 Token 调制 (FTM) 和特征线性适配 (FLA),该团队在各…
-
原力灵机发布DW0.5具身世界模型,降低机器人训练成本 · 1 source tracked
原力灵机 (Force Intelligence) 发布了 DW0.5,一个旨在充当具身人工智能中视觉-语言-动作 (VLA) 模型教练的世界模型。这个新框架集成到 DFOL 2.0 中,旨在通过在虚拟环境中模拟场景来减少对真实机器人数据的需求。DW0.5 可以预测未来状态,生成成功和失败的动作轨迹,并提供有价值的反馈信号,从而估计将真实世界数据的训练成本降低 60%,总体成本降低 40%。该模型在各种基准测试和复杂任务中表现强劲,在…
-
新模型和框架推动具身AI能力发展
研究人员正在开发先进的模型和框架,以实现更具能力的具身人工智能。一种方法是Athena-Brain-8B,一个为设备端机器人大脑设计的8B LLM,展现出强大的通用智能和具身交互能力,并能给出简洁的响应。另一篇论文探讨了Edmund Berkeley和David L. Heiserman的历史工作,将其视为一个未被充分探索的具身智能架构,将逻辑与硬件和时间扩展行为联系起来。此外,一个1.5B的开源VLA模型MiniCPM-Robot,…
-
RoboDojo基准揭示AI机器人与人类表现的巨大差距
一项名为RoboDojo的新基准已发布,用于评估具身智能,包含42个模拟任务和18个真实世界机器人任务。该基准突显了当前AI模型与人类表现之间存在的巨大差距,在模拟环境中,最佳模型成功率仅为8.80%,在真实机器人上为12.8%,而人类的成功率分别为76.03%和100%。RoboDojo旨在为具身智能提供标准化和全面的评估,涵盖泛化能力、记忆、精度、长时序执行和开放式语义理解。
-
机器学习职位要求要求广泛的专业知识,这几乎是不可能的
Reddit 上 r/MachineLearning 版块的一篇帖子强调了机器学习行业中职位要求日益增长和专业化明显的趋势。作者对招聘启事中列出的、在不同领域如 LLMs、机器人、传感器融合、CUDA 编程,甚至顶级学术出版物方面,要求拥有压倒性数量的深度专业知识感到震惊。这种所需技能的广度,被比作需要掌握多个不同学术学科的专业知识,这让作者质疑公司到底期望招聘谁。
-
WAIC 2026:世界模型为AGI展开辩论,超越数据拟合迈向因果理解 · 追踪1个来源
世界模型(WM)的概念正从学术理念演变为产业焦点,WAIC 2026将探讨其在实现通用人工智能(AGI)和克服具身AI局限性方面的作用。李飞飞等专家将WM分为渲染器、模拟器和规划器,同时承认该术语目前被过度使用以及行业缺乏统一方法。WAIC 2026的讨论将涉及数据拟合(如VLA)与因果理解(如牛顿模型)之间的辩论,重点关注WM如何使AI能够掌握潜在的物理定律,从而在现实世界中实现更鲁棒的执行。
-
Self-Variable Robotics unveils X-Tokenizer for embodied AI action segmentation
Zibianliang (Self-Variable) Robotics has introduced X-Tokenizer, a novel cross-modal embodied action tokenizer designed to improve the semantic understanding between visual-language models (VLMs) and robot action expert…
-
机器人领域面临“数据鸿沟”,需工程与数据融合
加州大学伯克利分校教授Ken Goldberg指出,与大型语言模型相比,机器人领域存在显著的“数据鸿沟”。他提到,当前机器人操作数据相当于人类阅读几年的量,而大型语言模型则相当于10万年。Goldberg认为,尽管规模法则推动了大型语言模型的进步,但对于具身人工智能而言,仅仅依赖数据可能是一种误导。他提出,将传统的工程原理(如鲁棒的系统架构和物理建模)与数据驱动的方法(如视觉-语言-动作(VLA)模型)相结合,对于推动机器人技术的发展至关重要。
-
理想汽车目标通过自研AI芯片和模型实现特斯拉FSD V14同等水平
理想汽车正在开发其自动驾驶能力,以匹配特斯拉的FSD V14,重点关注安全、效率和舒适性,以及识别特殊车辆和交通警察信号等高级功能。该公司正在整合视觉-语言-动作(VLA)和世界模型方法,强调语言模型在L3/L4自动驾驶中实现类人推理的关键作用。理想汽车还在大力投资自研AI基础设施,包括Mach M100芯片和强大的数据系统,目标是在其车辆内建立集中的AI计算中心,以提高效率和任务隔离性。
-
Reflective VLA 通过行动后果提高具身AI的泛化能力
研究人员推出了一种新颖的视觉-语言-行动(VLA)模型方法Reflective VLA,旨在提高具身控制任务的泛化能力。与仅依赖当前观察的反应式模型不同,Reflective VLA 整合了观察-行动-后果三元组的历史记录。这种上下文使模型能够更好地理解机器人校准和驱动偏差等部署特定因素。在标准和分布偏移环境中的实验表明,Reflective VLA 显著提高了成功率,尤其是在具有挑战性的跨环境泛化场景下。
-
新论文揭示视觉语言模型缺乏主体性和知识保留能力
两篇新研究论文指出了当前视觉语言模型(VLMs)的局限性,特别是在微调后保留知识的能力以及在视觉推理中缺乏“主体性”方面。第一篇论文《视觉-语言-动作模型是否了解基础知识?》引入了Act2Answer协议,通过让具身VLA模型通过动作选择答案来评估它们,结果显示它们在简单概念上表现良好,但在比其源VLMs更丰富的语义类别上却表现不佳。第二篇论文《主体性:视觉推理中系统性的主体性缺失》认为,VLMs受限于缺乏主体性,导致它们充当被动的语…