当人类成为机器人的「身体」:深圳遥操作经济与具身智能训练的设计悖论
从 $2,000 遥操作系统到万人数据工厂,中国硬件之都正在用人体为机器人编写肌肉记忆深圳南山区一栋工业楼里,一个年轻人穿着三公斤重的外骨骼手套和动捕服,通过遥操作系统控制几百公里外一台人形机器人的双手。机器人在叠T恤——一个小时,大概叠了三件。这个画面挺让人五味杂陈的:为了让机器人学会「自己干」,得先让成千上万的人天天「装成」机器人。
这是2026年中国具身智能产业的日常。SVRC《State of Robotics 2026》的数据显示,全球机器人市场已达380亿美元,人形机器人是最热的赛道,12家主要公司在这个领域抢跑。而在竞赛的阴影里,一个「数据劳工」产业正在深圳成形——它可能是谁能先做出通用人形机器人的决定性因素。
这篇文章想搞清楚几件事:让机器人「去人化」地自主操作,为什么反而需要最密集的「人化」训练?中国怎么把遥操作硬件成本从八千美元压到两千以下?这种「够用就行」的设计思路到底在想什么?以及,当VLA(视觉-语言-动作)模型最终学会自己干活的时候,那些用身体替AI写肌肉记忆的人,他们的劳动值多少钱?

背景:机器人为什么需要人来教
VLA 模型:从语言到身体
2024到2025年,大语言模型让AI学会了读和写。但要让AI控制一具物理身体完成现实世界的任务,光有语言能力不够——它需要「视觉-语言-动作」(Vision-Language-Action, VLA)模型。VLA把视觉感知、语言理解和动作规划塞进一个框架,让机器人能「看」环境、「听」指令、「动手」操作。
EVSint的技术指南说得很清楚:具身AI必须收集「动作配对的感觉运动数据」——同步的关节角度、夹爪力、相机画面和任务上下文。训练VLA模型要的不是文本或图片,是物理世界里真实的、多模态的、带时间序列的操作数据。这些数据没法从网上爬,只能从真实物理交互中来。
仿真为什么不行?
一个自然的问题:为什么不用仿真环境生成这些数据?答案是sim-to-real gap——仿真到现实的迁移差距,这个老问题困扰机器人学很多年了。
仿真能处理刚体运动、简单碰撞和基础导航,但灵巧操作(dexterous manipulation)——叠软布、拧瓶盖、抓形状不规则的东西——仿真和现实之间的鸿沟还是很大。物体形变、摩擦力的微妙差异、手指和物体表面的接触反馈,这些在仿真里很难精确建模。
Shaip的行业分析提了一个「三层训练策略」:第一层用仿真训练运动控制和全身平衡;第二层用遥操作收集的物理数据训练灵巧操作;第三层用大规模自我中心视频数据集给机器人提供「自然场景先验」——让它看人类视频理解日常任务的逻辑。第二层没法替代,也是最贵的。
深圳的「身体工厂」
深圳在这时候登场了。作为全球硬件制造之都,深圳有从电机、传感器到结构件的完整供应链。别的城市机器人公司还在为买一台八千美元的遥操作设备等几个月,深圳厂商用本地供应链把成本压到两千美元以下。
SVRC的市场报告说,中国厂商生产的leader-follower遥操作系统功能等同于美欧五千到八千美元的设备,成本只有后者的25%到40%。这不是「便宜就行」——深圳的遥操作系统在设计上走了一条「够用」的路:不追求完美的力反馈和全自由度映射,而是聚焦最关键的5到7个自由度,在精度和成本之间找到「数据收集够用」的平衡点。

核心分析
设计悖论:去人化需要最密集的人化
深圳遥操作产业的悖论可以缩成一句话:要让机器人最终不需要人,先得最密集地用人。
这形成了一个人机共生的循环。遥操作员穿外骨骼设备,把自己的动作实时映射到机器人身上。机器人忠实地复制每一个动作——抬手、抓取、旋转、放置。动作数据被记录下来,变成VLA模型的训练素材。模型学了成千上万次人类操作的模式,逐渐「内化」这些技能,最终可能实现自主操作。
但这个过程比想象中慢得多。Rest of World的调查显示,X Square Robot的机器人一小时只能叠大约三件衣物。每一次「成功」的折叠都需要操作员精确控制,机器人偶尔失衡或卡顿又需要人来修正。这不是在「训练」机器人,更像是在「远程扮演」机器人。
这里有个问题我一直想不明白:当机器人最终学会了自主叠衣服,它学到的到底是「叠衣服」这个技能,还是「某个特定的人叠衣服的方式」?训练数据里藏着的人类习惯、偏好、甚至缺陷,都会被模型照单全收。
成本设计:「够用」而非「完美」
深圳遥操作系统的成本优势不光是制造业规模效应的结果,更是一种设计策略。
传统遥操作系统(HaptX、SenseGlove这些美欧产品)追求「完美映射」:全自由度手指追踪、高保真力反馈、亚毫米级精度。远程手术或精密装配确实需要这些,但对机器人训练数据收集来说,很多精度是多余的。
深圳的设计师做了一系列简化的决定:
自由度方面,人类手指有20多个自由度,但大多数日常任务只需要5到7个关键自由度(拇指-食指对捏、腕部旋转、前臂开合等)。深圳的系统只做这些,成本降了六成以上。
力反馈方面,完整的力反馈系统(让用户「感受」到机器人接触物体的力)很贵。深圳要么用简化的振动反馈,要么干脆去掉力反馈,靠视觉反馈(看摄像头画面里机器人手的位置)来替代。操作员需要适应这种「靠眼睛」的操作模式,但一旦适应了,数据收集效率并没有明显下降。
材料方面,美欧系统大量用航空级铝合金和碳纤维,深圳方案用工程塑料和标准铝型材,基本刚度够用,材料成本大幅降低。
这种「够用设计」的底层逻辑是:数据收集场景和操控场景的需求根本不同。操控要精度和可靠性,数据收集要的是「足够好」的大规模覆盖。就像手机拍照和专业相机的区别——对训练图像识别模型来说,一百万张手机照片的价值远大于一千张专业照片。

人机映射:身体不对称的难题
遥操作里最棘手的设计问题之一是「身体不对称」。操作员的体型和目标机器人不匹配的时候——比如一个170cm的人控制一个180cm的机器人,或者一个成年人控制一个小型机器人的手臂——简单的动作映射就会出偏差。
WIRED的报道说,X Square Robot等深圳公司用了两种办法来处理:
等比缩放,把人类动作按比例缩放到机器人身上。简单直接,但在临界情况下(机器人手臂快到物理极限时)可能产生危险动作。
自适应映射,在映射系统里加一层「智能修正」,检测到人类动作会导致机器人不稳定时,自动调整映射关系。这实际上给了机器人一定的「自主判断」——虽然它还在执行人的指令,但它有权「拒绝」某些会导致自身失衡的动作。
这创造了一个有意思的权力关系:训练过程中,机器人不是完全被动的「傀儡」,而是一个有自主性的「学徒」。它在执行人类指令的同时,也在学怎么保护自己。
更深一层的挑战是映射带来的「认知负荷」。操作员不仅要控制自己的身体,还得持续「想象」自己就是那个机器人——手臂更长、手指更粗、平衡点不同。这种「双重身份」的认知负担是遥操作疲劳的主要原因,也是为什么遥操作员通常只能连续干4到6小时。

产业格局:中国机器人公司的城市竞赛
深圳的遥操作经济不是单独存在的,它嵌在中国特有的「城市竞赛」机器人产业格局里。
The Guardian的报道描述了这个格局:杭州有宇树科技(Unitree),上海有智元机器人(AgiBot),北京有银河通用(Galbot),深圳有优必选(UBTech)。每个城市像赞助商一样支持各自的机器人公司,给政策、给钱、给产业链资源。
这种竞争格局对遥操作经济的形态影响很大。
深圳的优势在硬件供应链。依托华强北和珠三角的制造能力,遥操作系统的几乎所有零部件都能在50公里半径内采购到——力矩传感器、伺服电机、连接器、线缆,都有。
上海走的是另一条路。AgiBot开源了AGIBOT WORLD 2026数据集,用「自由形式」数据收集方法——遥操作员不按预设脚本执行任务,而是根据实时条件自己决定怎么完成。数据更多样化,但收集效率更低。
值得注意的是,城市之间的竞争不是零和博弈。深圳的遥操作硬件供应商同时为多个城市的机器人公司供货,形成了「竞争中的合作」。
这种格局催生了一个现象:遥操作硬件正在快速商品化。当多家公司都能以接近的成本造出类似功能的设备,竞争的焦点就从「谁能造出更好的遥操作系统」变成了「谁能用遥操作数据训练出更好的模型」。

案例
X Square Robot 的「折叠衣物」训练流水线
X Square Robot是深圳遥操作经济的典型代表。WIRED和Rest of World都报道过这家公司,它有一套完整的「数据工厂」流程:
招聘不需要机器人学背景,但需要好的手眼协调能力。培训大概两到三周,主要学怎么适应遥操作系统的「延迟感」和「身体差异感」。
每位操作员每天干6到8小时遥操作。最常见的任务是叠衣服——这是人形机器人灵巧操作的经典测试,因为涉及柔软物体的形变建模、多步骤双手协调、以及对折叠精度的判断。
每一次操作都被完整记录——操作员的动作数据、机器人状态数据、多角度视觉数据。原始数据随后进入标注流程,由另一组人做质量评估和标签标注。
积累够一定量的数据后,团队用这些数据微调VLA模型,然后用微调后的模型控制机器人自主尝试。自主操作失败率高的时候,再次启动遥操作数据收集,形成「收集-训练-测试-再收集」的循环。
这个流程的效率目前还很低——机器人一小时叠三件衣服,意味着一条「成功折叠」的训练数据平均要20分钟。但随着操作员熟练度提升和映射系统优化,时间在逐步缩短。
AgiBot 的开源数据集策略
上海的智元机器人走了另一条路。The Robot Report报道,AgiBot开源了AGIBOT WORLD 2026数据集,采用「自由形式」数据收集——遥操作员不按预设脚本,而是根据实时条件自主决定怎么完成任务。
比如「把杯子放到桌上」这个任务,操作员可以自由选择从哪个角度接近杯子、用多大力气抓取、以什么路径移到桌面。这种非脚本化方法产生的训练数据更多样化,有助于提升模型的泛化能力。
AgiBot的策略背后有更宏观的考量:当数据收集的成本优势不在自己手里(深圳的硬件成本优势属于深圳公司),就通过开源数据集建立行业标准和影响力,从「拥有数据」转向「定义数据标准」。
NVIDIA Isaac GR00T 的跨身体训练
NVIDIA的Isaac GR00T N1.6走的是另一条技术路线。Voxos.ai报道说,这是一个32层扩散变换器,在数千小时跨多种机器人身体的遥操作数据上训练。
「跨身体」是关键词。传统上,一个遥操作数据集是为特定机器人形态收集的——为A公司机器人收集的数据不能直接用来训练B公司的机器人,因为关节结构、自由度分布、运动学模型都不同。GR00T试图通过「身体无关」的表征学习来解决这个问题:把不同机器人身体的动作数据映射到一个统一的表征空间,让模型能在不同机器人身体之间迁移技能。
这对遥操作经济的影响很直接:如果跨身体迁移成为可能,遥操作数据的价值就不再局限于特定机器人型号,而是变成一种通用的「机器人技能资产」。深圳的数据工厂可能从为特定公司服务,转向为整个行业提供数据服务。

深度洞察
数据劳工:一个新兴职业的伦理问题
深圳遥操作产业催生了一个新职业——「数据劳工」。这些操作员的日常是穿戴设备、执行任务、产生数据。他们的工作既不是传统工厂工人的体力活,也不是办公室白领的知识工作,而是一种介于两者之间的「身体数据生产」。
这个职业带来了一系列伦理问题。
劳动定价怎么算?一条遥操作数据的价值取决于它最终训练出的模型的商业价值。一个数据劳工的1000小时工作如果帮机器人学会了叠衣服,而这个技能被部署到百万台机器人上,创造的价值怎么追溯到原始数据的贡献者?
职业发展呢?数据劳工的技能(手眼协调、操作精确度)有没有迁移价值?他们能从「数据生产者」晋升为「数据质量管理者」或「遥操作培训师」吗?还是说这是一个终将被自动化取代的过渡性职业?
身体方面,长时间穿戴外骨骼设备做重复操作,对身体有什么长期影响?需要怎样的人体工学设计来保护操作员?
从遥操作到自主:人什么时候退出?
所有遥操作公司的最终目标是让机器人不再需要人。但「人什么时候退出」这个问题比技术问题复杂得多。
技术上的退出条件比较清楚:VLA模型在特定任务上的自主成功率超过阈值(比如95%),且在边缘情况下能安全失败(失败不造成伤害或损失),人就可以从该任务的遥操作中退出。
但经济和伦理上的退出条件模糊得多。当一个城市的数千名数据劳工因为机器人学会了自主操作而丢掉工作,当地政府(曾经大力支持机器人产业)会面临什么社会压力?训练数据里包含了特定人群的动作模式和习惯,模型的「行为偏好」需不需要被审查和修正?
这些问题没有标准答案,但它们正在从假设性讨论变成现实挑战。中国在人形机器人领域的推进速度,让这些伦理问题的解决变得更加紧迫。

专利竞争:谁在保护什么?
PatSnap Eureka的专利分析显示,中国是人形机器人灵巧操作专利申请最活跃的地区。上海交通大学、深圳大象机器人技术、广西大学等机构在灵巧手设计、抓取策略、触觉感知等方向密集布局。
专利竞争揭示了一个趋势:遥操作硬件本身的专利壁垒在降低(「够用设计」降低了技术门槛),但围绕遥操作数据处理、模型训练方法、跨身体迁移算法的专利正在成为新的竞争焦点。未来的竞争优势不在于「谁能造出更便宜的遥操作设备」,而在于「谁能更有效地把遥操作数据转化为机器人智能」。
结论
深圳遥操作经济是2026年一个有意思的技术-社会现象。它说明了一件事:最先进的人工智能,底层仍然是最基础的人类劳动。
这个悖论——用密集的人类劳动换机器人的自主性——不是深圳独有的,而是整个具身智能产业的结构性特征。但深圳因为硬件供应链和劳动力市场的特殊性,把这个悖论放大到了极致。
从设计角度看,深圳遥操作产业的「够用设计」有一个值得记住的点:在技术民主化的过程中,「足够好」往往比「完美」更有用。两千美元的遥操作系统可能不如八千美元的精确,但它让大规模数据收集成为可能,而规模正是训练通用AI模型的关键。
三个趋势值得留意。
数据服务化。遥操作数据将从「公司内部资产」变成「可交易的商品」,催生专门的机器人训练数据供应商。
跨身体迁移。NVIDIA GR00T等项目在推动「身体无关」的技能学习,这会改变遥操作数据的经济模型。
伦理框架。随着数据劳工群体扩大,关于劳动定价、职业保护、数据权益的伦理框架会逐步建立。
当我们回头看2026年深圳的遥操作产业,可能会发现:这既是机器人学会「走路」的起点,也是人类重新想想「劳动」到底意味着什么的起点。

---
参考来源:1. WIRED, "Humanoid Robot Training in China's Hardware Capital", https://www.wired.com/story/humanoid-robot-training-in-chinas-hardware-capital/
2. Rest of World, "China AI Robotics Training Data", https://restofworld.org/2026/china-ai-robotics-training-data/
3. The Guardian, "Inside China's Robotics Revolution", https://www.theguardian.com/technology/2026/mar/19/inside-chinas-robotics-revolution
4. SVRC, "Robotics Market China", https://www.roboticscenter.ai/robotics-market-china
5. SVRC, "State of Robotics 2026", https://www.roboticscenter.ai/state-of-robotics-2026
6. EVSint, "Embodied AI Data Collection & Teleoperation 2026", https://www.evsint.com/embodied-ai-data-collection-teleoperation-sim-to-real-2026/
7. Shaip, "Robot Training Data Strategy", https://www.shaip.com/blog/robot-training-data-strategy/
8. The Robot Report, "AgiBot World 2026 Dataset Open Source", https://www.therobotreport.com/agibot-world-2026-dataset-open-source-accelerate-embodied-ai-development/
9. Voxos.ai, "Embodied Intelligence Robotics 2026", https://voxos.ai/blog/embodied-intelligence-robotics-2026/
10. PatSnap Eureka, "Humanoid Robot Dexterous Manipulation 2026", https://www.patsnap.com/resources/blog/rd-blog/humanoid-robot-dexterous-manulipulation-2026-patsnap-eureka/
11. Robozaps, "Best Humanoid Robots", https://blog.robozaps.com/b/best-humanoid-robots
---