全球AI领导者英伟达正式开源了15TB的NVIDIA Physical AI Dataset超大规模训练数据集,包含超过32万条机器人训练轨迹、1000多个通用场景描述以及SimReady预训练集合。
该数据集专为实体机器人和自动驾驶研发设计,同时即将推出端到端自动驾驶专用数据,涵盖美国1000多个城市及欧洲20多个国家的多样化交通场景片段,为AI训练提供真实道路环境支持。

开源地址:https://huggingface.co/collections/nvidia/physical-ai-67c643edbb024053dcbcd6d8

Physical AI Dataset包含 NVIDIA 用于训练、测试和验证物理 AI 的真实世界与合成数据精选集,广泛应用于NVIDIA Cosmos 世界模型开发平台、NVIDIA DRIVE AV 自动驾驶软件栈、NVIDIA Isaac 机器人开发平台以及NVIDIA Metropolis 智能城市框架。

该数据集能显著提升 AI 模型的训练效率——在预训练阶段,丰富的数据可增强模型鲁棒性;在后训练阶段,开发者可利用额外数据优化模型,使其更适配特定场景。

由于构建一个涵盖多样化场景、精准反映现实物理规律的数据集需要巨大的时间和标注成本,这已成为大多数开发者的关键瓶颈。而 Physical AI Dataset 的开放,将帮助开发者突破这一限制,加速 AI 应用的落地。


对学术机构和小型企业而言,组建车队采集自动驾驶训练数据不仅成本高昂(通常90%的采集数据因过于常规而被废弃),在可行性上也面临巨大挑战。然而,商业级AI模型的开发恰恰需要这种海量数据支撑——例如:

  • NVIDIA Isaac GR00T机器人模型依赖数千小时视频进行后训练

  • NVIDIA DRIVE AV端到端模型需要数万小时驾驶数据


数据集核心优势:

  • 规模与质量并重:包含数千小时多摄像头视频,提供前所未有的地理覆盖和场景多样性

  • 安全研究突破:支持异常检测和模型泛化评估,直接助力NVIDIA Halos全栈自动驾驶安全系统开发

  • 效率革命:结合NVIDIA NeMo Curator工具,在Blackwell GPU上仅需两周即可处理2000万小时视频(较CPU方案提速100倍)


这一解决方案不仅解决了行业关键痛点,更通过高效数据处理管道,将AI开发周期从"年"缩短至"周"量级。

英伟达表示,未来将继续扩展Physical AI Dataset,将其建设成世界最大、统一的开源数据集,可用于AI模型、医疗、自动化驾驶等不同领域,加速AI、实体机器人的训练效率。