实探6000平米数据工厂:人形机器人的千万小时泡沫,怎么挤?
在人形机器人融资与发布提速的当下,行业焦虑正从'造本体'转向'喂数据'。本文基于对北京人形机器人创新中心数据与训练基地的实地探访,拆解6000平米'数据工厂'的产能、质检与采集方案,辨析'千万小时数据'背后的真实水位,并给出高质量数据的产业判断。
人形机器人不缺融资,缺的是能让模型落地的数据。
9月4日,《科创板日报》记者实地探访了北京人形机器人创新中心的数据与训练基地。面对镜头,基地负责人抛出了一个行业眼下最扎心的问题:"有的机构说年底要做到千万小时,有的说无本体数据已经有上千万小时——但真正的高质量数据有多少?什么是高质量?"
这句话背后,是整个具身智能产业链焦虑的转向:过去大家拼融资、拼发布会、拼本体数量,现在悄悄变成了拼数据、拼喂数据的速度、拼数据的成色。这篇文章,我们就借着这处被称作"国家队样板间"的数据基地,把具身智能数据基建的真实进度条拉出来看一看。
📍 6000平米"数据工厂":机器人在上班,数据在夜里下班
数据采集这件事,正在被做成一座工厂。
先看场地。这处基地总面积6000余平方米,其中一二层约5000平方米是采集与训练区,总部中心另有1000余平方米。走进去,你会发现这里不像实验室,更像一个影视基地加工厂车间的混合体:家庭、商超、工业、医药康养等六大类共30多种实景场景被一一搭出来,150多台套机器人本体设备在里面"上班"采集数据,另有150多套无本体采集设备配合作业——包括自研的第一人称视角头环,和五自由度的夹爪工装。
二楼一处约200平方米的光学动捕场地颇为醒目。负责人介绍,此前在机器人运动会上包揽举重项目前四名的天工机器人,其举重、跑步、翻越障碍乃至舞蹈动作的数据,全部出自这块场地。
更值得关注的是生产节拍。采集员一天工作8小时,扣除摆场景、摆道具,有效录制约6小时;数据边采边传至云端,夜间由自动化管线处理,第二天即可交付客户——内部称之为"7+1"交付。目前基地数据年产能18万小时,已服务100多家客户,多为头部大模型与具身智能本体公司。
| 关键指标 | 数据 |
|---|---|
| 基地总面积 | 6000余平方米 |
| 采集与训练区 | 约5000平方米 |
| 实景场景 | 6大类、30多种 |
| 本体采集设备 | 150多台套 |
| 无本体采集设备 | 150多套 |
| 数据年产能 | 18万小时 |
| 已服务客户 | 100多家 |
把这组数字摊开看,产业逻辑就清楚了。全国现在能建数采场地的有一百多家,但同质化建场并不构成壁垒——这是负责人在现场的原话。换句话说,场地、机器人、采集员,这些要素花钱就能堆出来;真正值钱的,是场地之上的平台能力:场景怎么设计、数据怎么流转、质量怎么兜底。这就像低空经济里的起降场,谁能建几个垂直起降点不算本事,空管系统和运营体系才是护城河。数据基建,拼的从来不是"有没有",而是"好不好用"。
🫧 千万小时泡沫:军备竞赛下的真实水位
数据数量竞赛,正在制造行业最大的幻觉。
人形机器人本体融资与发布节奏不断加快,但一个微妙的变化是:产业链的焦虑正从"造机器人"转向"喂数据"。于是出现了素材里那一幕——有机构宣称年底做到千万小时,有机构宣称无本体数据已上千万小时。听起来很美好,但负责人的一句话点破了窗户纸:"真正的高质量数据有多少?"
这不是抬杠,而是行业当下最核心的争论:什么才算高质量数据? 业内至今没有定论。负责人给出的判断颇为务实:最有价值的数据,是让模型在场景里能落地、产生好效果的数据。
他用自动驾驶做了一个类比——真正值钱的是corner case数据,特斯拉"影子模式"回流的正是这一类,而不是无论好坏把所有数据都采回来。
这个类比的杀伤力在于:它直接宣判了"堆时长"路线的贬值。如果模型能力的瓶颈在长尾场景,那么一千万小时的常规作业数据,可能不如一万小时的极端场景数据。按这个逻辑推演,当前市场上号称的"千万小时"里,成色参差是必然的——有本体数据、无本体数据、仿真数据、遥操作数据混在一个口径里报数,行业缺一把统一的尺子。
据多位接近头部本体公司的人士私下反馈,采购方在验数据时的第一句话,往往已经不是"你有多少小时",而是"你这批数据覆盖了哪些失败案例"。数据军备竞赛的上半场比谁采得多,下半场比谁采得准——这几乎是可以提前写好的剧本。
🔍 三道质检与95%:一套正在成形的交付标准
高质量不是喊出来的,是一道道检出来的。
既然"高质量"没有行业统一定义,北京人形机器人创新中心的做法是自己先立标准。基地设立了三道质检:采集后一检、标注后二检、交付算法侧验收三检。据其透露,今年上半年交付一家头部客户的数据,验证通过率在95%以上。
这个数字值得展开说说。验证通过率95%,意味着什么?意味着数据从采集端流向模型端的过程中,质量损耗被控制在了一个可量化的区间内。对采购数据的模型公司而言,这比"交付了多少小时"重要得多——数据买回来能不能直接用、要返工多少,直接决定训练效率和成本。
更值得注意的变化在标注环节。记者在现场看到,标注已基本由AI接管——过去需要数百上千人异地标注语义、动作与视频帧,如今"几张卡跑一晚上,第二天人工质检后即可交付"。
把这组事实串起来,一条完整的数据流水线就浮现了:
- 当日白天:采集员8小时作业,有效录制6小时
- 边采边传:数据实时上传云端
- 当夜:自动化管线处理,AI完成标注
- 次日:人工质检,走完三道验收,交付客户
产业逻辑在这里再次收敛:当采集产能可以被复制,质检与交付体系才是数据公司的真壁垒。"7+1"交付、三道质检、95%通过率,这三件事拼在一起,本质上是在把数据生意从"劳动密集型"改造成"流程密集型"。谁能定义流程、稳定质量、压缩交付周期,谁就能在客户预算里占据更大份额。这与低空经济中适航认证的逻辑惊人地相似——认证流程本身就是门槛,走通流程的能力就是稀缺资产。
🤝 有本体+无本体:毫米级捕捉背后的采集矩阵
最好的数据,来自最像人的采集方式。
数据的成色,一半取决于质检,另一半取决于采集方式本身。基地给出的答案是"有本体+无本体"的矩阵式方案。
有本体采集好理解:150多台套机器人在30多种实景场景里干活,机器人在真实环境中产生的感知与操作数据,天然贴近模型未来的部署状态。
更巧妙的是无本体采集。150多套无本体设备里,包括自研的第一人称视角头环和五自由度的夹爪工装——让人戴着头环、套着工装去干家政、理货、搬运,人类操作的真实轨迹被原样记录下来,再映射给机器人学习。这解决了本体采集的一个先天短板:机器人自己采数据,采到的往往是"机器人的笨拙";而无本体采集捕捉的是"人类的熟练"。
技术细节也相当硬核。自研的手部姿态算法可捕捉人手21个关节的运动轨迹,经映射后赋能机器人灵巧手,精度达到毫米级。
把采集方案抽象一下,可以看到一条清晰的技术路线分工:
产业判断是:采集硬件与算法的自研化,正在成为数据基建的第二重壁垒。 光学动捕场地服务了天工机器人的举重、跑步、翻越障碍与舞蹈数据,头环和夹爪工装支撑了无本体的人类操作数据,21关节捕捉算法保证了手部数据的精度——这些都不是租个场地、雇一批采集员能凑出来的。当一百多家机构都能建场地时,能自研采集工具链的,才是真正握住了数据生产的上游。
🌐 从人形到低空:具身产业共享同一套基建逻辑
所有具身智能的终局竞争,都是数据基建的竞争。
跳出人形机器人,把视野拉宽一点,会发现这条逻辑线正在多个具身产业里同时上演。
北京人形机器人创新中心基地负责人那句"同质化建场不构成壁垒",放在低空经济里同样成立:起降场、无人机、eVTOL整机,硬件层面的同质化只会越来越严重;真正拉开差距的,是空管数据平台、运营调度系统、适航验证流程这些"场地之上的能力"。人形机器人的数据之战给出了一面镜子——当一百多家机构涌入同一个环节时,利润和话语权必然向上游的工具链和下游的标准体系迁移。
再往深处看,"有本体+无本体"的采集矩阵、AI标注替代千人标注团队、三道质检兜底交付质量、"7+1"的工厂化节拍——这套组合拳描绘的,其实是具身智能数据基建的通用范式:用工业化的流程生产数据,用自动化的工具处理数据,用可量化的标准验证数据。 无论本体是双足人形、机械臂,还是低空中的无人机,这套范式的骨架大概率是通用的,差异只在场景与传感器形态。
小结:泡沫会破,工厂会留
回到开头那个问题:千万小时的数据泡沫之下,什么是高质量?这次探访给出的答案是——能让模型在真实场景里落地、通过三道质检、带着corner case、可以按时交付的数据,才叫高质量。数据数量的军备竞赛还会继续热闹一阵,但决定行业走向的,是6000平米工厂里那些看不见的东西:平台能力、质检标准、自研工具链。数据泡沫挤干之后,留下的会是真正的数据基建。而这套"采集—质检—交付"的范式,很可能成为所有具身产业——包括低空经济——共享的底座逻辑。