
开源地址:https://huggingface.co/collections/nvidia/physical-ai-67c643edbb024053dcbcd6d8
Physical AI Dataset包含 NVIDIA 用于训练、测试和验证物理 AI 的真实世界与合成数据精选集,广泛应用于NVIDIA Cosmos 世界模型开发平台、NVIDIA DRIVE AV 自动驾驶软件栈、NVIDIA Isaac 机器人开发平台以及NVIDIA Metropolis 智能城市框架。
该数据集能显著提升 AI 模型的训练效率——在预训练阶段,丰富的数据可增强模型鲁棒性;在后训练阶段,开发者可利用额外数据优化模型,使其更适配特定场景。
由于构建一个涵盖多样化场景、精准反映现实物理规律的数据集需要巨大的时间和标注成本,这已成为大多数开发者的关键瓶颈。而 Physical AI Dataset 的开放,将帮助开发者突破这一限制,加速 AI 应用的落地。

对学术机构和小型企业而言,组建车队采集自动驾驶训练数据不仅成本高昂(通常90%的采集数据因过于常规而被废弃),在可行性上也面临巨大挑战。然而,商业级AI模型的开发恰恰需要这种海量数据支撑——例如:
NVIDIA Isaac GR00T机器人模型依赖数千小时视频进行后训练
NVIDIA DRIVE AV端到端模型需要数万小时驾驶数据
数据集核心优势:
规模与质量并重:包含数千小时多摄像头视频,提供前所未有的地理覆盖和场景多样性
安全研究突破:支持异常检测和模型泛化评估,直接助力NVIDIA Halos全栈自动驾驶安全系统开发
效率革命:结合NVIDIA NeMo Curator工具,在Blackwell GPU上仅需两周即可处理2000万小时视频(较CPU方案提速100倍)
这一解决方案不仅解决了行业关键痛点,更通过高效数据处理管道,将AI开发周期从"年"缩短至"周"量级。
英伟达表示,未来将继续扩展Physical AI Dataset,将其建设成世界最大、统一的开源数据集,可用于AI模型、医疗、自动化驾驶等不同领域,加速AI、实体机器人的训练效率。
