英伟达引领合作,构建物理AI基础NVIDIA Leads Collaboration Building Foundation For Physical

环球医讯 / AI与医疗健康来源:quantumzeitgeist.com美国 - 英语2026-10-08 14:35:51 - 阅读时长5分钟 - 2071字
英伟达(NVIDIA)领衔一个由35家机构组成的合作团队,发布了首个开放数据集Open-H-Embodiment,旨在加速医疗机器人领域物理AI的发展。该数据集包含778小时来自手术机器人、超声和结肠镜检查过程的训练数据,同时推出了两个开源模型,其中GR00T-H被描述为首个用于手术机器人任务的策略模型,已在SutureBot基准测试中成功完成全流程缝合。此外,基于英伟达Cosmos Predict 2.5 2B基础的Cosmos-H-Surgical-Simulator可从运动学动作生成物理逼真的手术视频,极大地提高了训练数据生成效率,600次模拟仅需40分钟,而传统实验需要两天。
健康医疗机器人物理AI手术机器人数据集GR00T-H视觉语言行动模型模拟器开源英伟达
英伟达引领合作,构建物理AI基础

英伟达(NVIDIA)正在引领一项合作,该合作产出了Open-H-Embodiment——第一个旨在加速医疗机器人领域物理AI发展的开放数据集。考虑到现有的医疗AI主要关注数据解读而非“行动”,该计划解决了一个关键需求:需要包含具身、动力学和控制方面的标准化机器人数据。该数据集由涵盖约翰·霍普金斯大学和慕尼黑工业大学等35个组织的社区共同构建,包含778小时来自手术机器人、超声和结肠镜检查过程的训练数据。与Open-H-Embodiment一同发布的还有两个基于宽松开源许可的新模型,其中包括GR00T-H,它被描述为首个用于手术机器人任务的策略模型,该模型基于约600小时的新数据进行训练。

Open-H-Embodiment数据集:社区协作与数据组成

一个全新的、庞大的数据集正在挑战医疗机器人的局限性,它优先关注物理行动而非单纯的感知。Open-H-Embodiment由涵盖35个组织的合作团队公布,解决了该领域的一个关键缺口:现有数据集主要关注信号解读,忽略了医疗场景中物理行动和交互的关键要素。该计划认识到,医疗领域需要能够执行任务的机器人,这就需要包含具身、接触动力学和闭环控制的数据,而以往的标准化资源中缺乏这些元素。该项目由指导委员会发起,成员包括约翰·霍普金斯大学的Axel Krieger教授、慕尼黑工业大学的Nassir Navab教授和英伟达的Mahdi Azizian博士,并迅速发展成一项全球性努力,旨在构建一个用于推进医疗机器人物理AI的大规模数据集。

研究人员使用了多种机器人平台,包括CMR Surgical、Rob Surgical和Tuodao的商业系统,以及dVRK、Franka和Kuka等研究机器人,确保了广泛的适用性。这个全面的数据集旨在促进AI自主性和世界基础模型的发展,而不仅仅是一个数据存储库。作者解释,医疗AI主要是基于感知的,侧重于解释信号并对病理/解剖结构进行分类或分割,这突显了向更主动、更具具身智能的转变。

GR00T-H:用于手术机器人的视觉语言行动模型

长期以来,真正自主的手术机器人的发展一直受到基于感知AI的阻碍,这种系统擅长解读图像,但缺乏物理行动的能力。现有数据集缺乏同步的机器人运动、力和视觉输入数据,因此不足以开发这些复杂任务所需的“物理AI”。现在,英伟达推出了GR00T-H,这是一个专门为弥合这一差距而设计的视觉-语言-行动模型,代表着向更具灵巧性和精确性的机器人手术迈出的重要一步。开发者为了克服这些障碍,实施了四项关键的架构选择,包括“独特具身投影器”——一种可学习的组件,用于规范不同机器人系统的动作空间。团队还采用了“状态丢弃(100%)”,在操作过程中有意去除本体感觉输入,以建立学习偏差,最终提升在真实场景中的性能。

GR00T-H的有效性已得到证明:一个原型在SutureBot基准测试中成功完成了全流程的端到端缝合,展示了强大的长程灵巧性。这一成就凸显了该模型从简单的预编程动作向更复杂、适应性更强的手术程序迈进的潜力。GR00T-H与Cosmos-H-Surgical-Simulator的开发标志着一种转变,即向构建能够在手术环境这一严苛条件下进行推理和适应的基础模型迈进,使机器人系统能够灵巧地行动而不仅仅是观察。

医疗AI主要是基于感知的,侧重于解读信号并对病理/解剖结构进行分类或分割。然而,医疗涉及“行动”,因此过去那些静态的、仅包含感知的数据集——缺乏具身、接触动力学和闭环控制——是不够的。

Cosmos-H-Surgical-Simulator:基于物理的合成数据生成

英伟达的Cosmos-H-Surgical-Simulator正在解决医疗机器人领域的一个关键瓶颈:创建逼真的训练数据。传统手术模拟器难以准确复现真实手术过程的复杂性,包括软组织的表现、反射,甚至血液和烟雾的存在,这限制了它们在训练AI系统方面的有效性。该模拟器是一个世界基础模型,通过直接从运动学动作生成物理逼真的手术视频来克服这些限制,有效地弥合了模拟与现实之间的差距。基于英伟达Cosmos Predict 2.5 2B基础构建的Cosmos-H-Surgical-Simulator从数据中隐式学习组织变形和工具交互,相比传统方法具有显著优势。这种方法允许创建合成视频-动作对,从而在真实世界数据稀缺的情况下扩充数据集。

效率提升显著:团队报告称,600次模拟仅花费40分钟,而等效的实验台实验则需要两天。该模型的开发涉及在Open-H-Embodiment数据集上进行微调,该数据集涵盖9种机器人和32个数据集,使用了64块A100 GPU,耗时约10,000 GPU小时。它在一个统一的44维动作空间中运行,简化了训练过程。据开发者称,该模拟器的能力不仅仅局限于视觉保真度;它被设计成一个物理模拟器,从数据中学习以产生逼真的交互。这一进展有望加速开发用于手术机器人的更强大、更可靠的AI系统,可能实现日益自主的手术程序。

【全文结束】

猜你喜欢
  • 美国人在2026年如何重新思考健康美国人在2026年如何重新思考健康
  • 育空地区医疗系统快速采用AI工具面临一些阻力育空地区医疗系统快速采用AI工具面临一些阻力
  • 美国卫生与公众服务部加强AI使用以打击医疗欺诈美国卫生与公众服务部加强AI使用以打击医疗欺诈
  • 纽约法案将禁止AI聊天机器人冒充提供者提供医疗建议纽约法案将禁止AI聊天机器人冒充提供者提供医疗建议
  • 肠癌:为什么如今诊断不再是死刑判决肠癌:为什么如今诊断不再是死刑判决
  • 美国保险公司和医院转向新AI,应对收费与支付之间的古老博弈美国保险公司和医院转向新AI,应对收费与支付之间的古老博弈
  • 背后的科学:医学中的人工智能背后的科学:医学中的人工智能
  • 耶鲁纽黑文健康系统公布2026年创新奖获奖者耶鲁纽黑文健康系统公布2026年创新奖获奖者
  • 精准医学中异质生物医学数据整合的挑战:AI模型与应用精准医学中异质生物医学数据整合的挑战:AI模型与应用
  • 美国医疗保健公司和医学研究人员需要了解的意大利新人工智能法美国医疗保健公司和医学研究人员需要了解的意大利新人工智能法
热点资讯
全站热点
全站热文