9月23日,觅蜂派APP正式上线发布。

三周前,我们曾在《宝妈、退休人员,开始给机器人“打工”》中讨论过这套模式。那时,觅蜂派已经上线,但还处在内测阶段。任务从哪来、设备怎么管、真实场景能不能进去、数据怎么验收、钱怎么结,很多问题都没有答案。

如今,第一版规则开始浮出水面。

一个月内测期间,觅蜂派注册用户达到2万人,累计产生1.3万份采集任务提交;平台覆盖22大类场景、5000多个任务和50000多个真实环境。

微信图片_20260923231545_388_443.jpg

但觅蜂科技觅蜂派业务总经理 张智富自己也说,今天的觅蜂派“还是一个小baby”。

所以,与其说“机器人版滴滴”已经跑起来,不如说它终于开始接单了。

“机器人版滴滴”,先长出了一套规则

众包要成立,第一步不是先把人招满,而是把“怎么干活”说清楚。

张智富把觅蜂上半年的状态概括为“以产定向”——设备先铺出去、数据先生产出来,往往就能找到需求。现在,觅蜂开始往“以销带产”转。

觅蜂科技董事长兼CEO 姚卯青的说法更直接:“我们是以需求为主导驱动的,以销定产,我收到什么需求再去采集,而不是我现在盲目采集。”

微信图片_20260923213428_7_1955.png

任务也已经被拆到职业、场景和动作。物流、仓储、住宿、养老、餐饮、零售、汽车服务、医疗、农业生产……每一类下面,还会继续往更细的具体动作走。

设备怎么管,也是在内测里试出来的。

觅蜂最初考虑过免费提供设备,但实际运行中发现,完全免费可能导致设备被领走后闲置。使用费因此首先是一道筛选机制,而不是主要收入来源。目前头戴式设备标准使用费为39元/天,推广阶段配套折扣、减免和信用免押;后续腕部设备、触觉手套等硬件逐步开放后,这套规则还会继续调整。

微信图片_20260923232827_416_443.jpg

数据采回来之后,什么算有效,也有了第一版答案。

姚卯青介绍,平台会自动切掉手部不在画面、长时间停顿、无效重复等片段,再按照有效时长结算。之后,数据还要继续经过标注、轨迹提取和人工抽检。

按他的说法,经过前端质检和结算后,超过95%的数据最终仍能进入后续使用环节。

这个数字其实比“2万用户”更值得盯。

中国信通院今年8月发布的《具身智能训练场研究报告(2026年)》就专门提醒,分布式众包一旦铺开,动作不流畅、任务理解错误、场景杂乱、重复采集,都可能直接拖低数据有效率。

95%现在能做到,规模扩大以后还能不能守住,才是真正的考验。

至少到今天,“谁来接单、用什么设备、采什么、什么算有效、怎么结算”,已经有了第一套可以运转的规则。

叠衣服已经“泛滥”了

平台开始接单的同时,需求也在变。

姚卯青现场用了一个很直白的例子:“过去大家都在做家庭场景,都在叠衣服,叠衣服数据已经泛滥了,不需要了。大家可能需要更专业的,哪怕你是修水管、你是去修车,你去理发、美甲这些可能反而需要一个个需要点亮、解锁技能。”

微信图片_20260923232826_415_443.png

当容易进入的家庭、桌面、抓取类场景被反复采集,需求开始往更专业、更分散的长尾技能移动。

一家数据公司可以搭几个家庭场景,却很难同时拥有养老护理员、农场工人和产线技工。

机器人要学会更多事,数据就必须走出数采厂。

张智富透露,觅蜂内部把任务颗粒度划分成五种类型。宽的时候,可以是在一个房间里完成一段操作;细的时候,则可以具体到“打开冰箱”这样持续几秒的动作。

他还用了一个很有意思的比喻:“我们都是去收麦子的,但是最终卖出去的其实不是麦子,是面包。”

采回来的原始数据只是“麦子”。真正交到客户手里的,是经过筛选、切分、加工的数据“面包”。有的客户要“豆沙馅儿”,有的要“肉馅儿”,不同模型需要的数据颗粒度、数量、格式并不一样。

所以觅蜂开始做标准“货架”和SKU,通用需求尽量标准化,特殊需求再定制。

具身数据正在从“按小时扩产”,转向“按需求组织生产”。

总量焦虑当然没有消失。

中国信通院估算,如果具身智能要走向类似“ChatGPT时刻”的能力跃迁,可能需要千万小时级有效数据,而当前全球可用的高质量真实数据仍只有数十万至百万小时级。

但同一份报告也提到,数据多样性对模型泛化能力的影响,甚至比单纯增加绝对数量更重要。

所以,1000万小时只是一个数字。

决定机器人最终学会什么的,是这1000万小时里面装了什么。

Figure正在提供一个更激进的参照。

Index在8月正式公开时,已经覆盖108个国家,累计下载量超过26.4万次,周活跃贡献者超过4.4万人,上传视频超过1600万条,并向创作者支付了1500万美元。到9月11日,Figure创始人Brett Adcock披露,其周活跃贡献者已经超过8.6万人,较公开发布时接近翻倍。

数据还在以每秒约35分钟的速度流入。

更值得注意的不是这个数字,而是Figure已经开始尝试证明这些数据到底有什么用。

9月17日公布的Helix 2.5测试中,在30套此前从未采过数据的住宅里,保持任务数据、模型架构和训练方式不变,仅加入Index预训练,零样本任务成功率就从9%提高到56%。Figure还发现,随着Index预训练数据不断翻倍,机器人下一步动作预测能力出现了相对平滑、可预测的Scaling Law。

数据竞争已经不只看谁采得多,开始看谁真的让机器人学会了东西。

真正难的,还是进入现实世界

一个月前,我们曾判断,众包数采真正稀缺的,可能不是人,而是“场景通行证”。

这个问题没有消失。

觅蜂科技副总裁 殷哲现场用了一个“页岩油”的比喻:“像页岩油,这个场景是有价值的,但是很多时候页岩油为什么不开采,是因为页岩油的开采成本比采出来的油还贵。”

一家食品厂里每天都在发生有价值的真实操作,不代表平台就能直接进去采。

设备是否符合厂区安全要求,是第一关;企业愿不愿意让众包人员戴着设备进入生产现场,是第二关;如果客户要的是海南采椰子、偏远地区农业作业,设备怎么送过去、当地有没有人能接,又是第三关。

微信图片_20260923231545_414_443.jpg

这也是“场景数据联盟”真正值得看的地方。

首批成员包括东呈酒店、中旅集团、陈香贵、普善养护院、上海德济医院、海天瑞声、龙旗科技等50余家企业和机构,覆盖酒店文旅、餐饮服务、养护院、医疗健康、地产制造等领域。

它不是简单多了一份合作名单,而是在提前储备进入现实世界的能力。早期客户说“我要工厂数据”,找到一家工厂拍搬箱子,也许就能交差。现在需求可能已经细化成“我要某条电机产线上的某个动作”。

到了这个颗粒度,泛泛拥有“制造业资源”已经不够,必须找到那个行业、那家工厂、那条产线、那个岗位。

数据越往长尾走,真正稀缺的越不是摄像头,而是许可。

进入医院、工厂、酒店甚至家庭,隐私和安全也随之成为门槛。姚卯青解释,脱敏主要由系统自动完成,后台人员不会先看到原始个人信息;张智富则表示,平台正在形成从用户授权、设备端处理、云端脱敏到合规质检的多层防护。

但还有一个更难的问题,这次依然没有答案。

如果一名汽修工戴着觅蜂的设备,在一家维修企业里完成拆装:技能来自汽修工,场景和工艺来自企业,设备和处理能力来自平台,最后的数据又可能卖给一家甚至多家模型公司——这段数据产生的价值,到底应该怎么分?

目前觅蜂派回答的是采集者如何按任务拿到一次报酬。姚卯青也明确提到,行业共性数据未来可以多次销售,从而降低重复采集成本。

但如果一份数据能够反复销售,最初贡献技能的人、开放场景的企业,是不是只拿第一次的钱?

这次发布会没有给出答案。

“劳动怎么结算”开始有规则了,“数据升值以后谁分享价值”,仍然是空白。

当数据公司开始变成“六边形战士”

平台真正放大以后,难题还会落到设备、供应链、运营和钱上。

姚卯青此次给出的判断是,做到千万小时级数据,需要“几万套设备”;进一步走向亿小时,则可能需要10万套。

如果按照单套设备每天生产约4小时有效数据、每年运行250天的理论满负荷测算,1000万小时大约对应1万套设备。但真实运营显然不会天天满负荷。

2万套设备下线,是制造问题;10万套设备真正跑起来,是运营问题。

设备每天到底工作多久、闲置后怎么调度、坏了谁来修、订单变化以后能不能迅速流向另一个场景,这些最终都会变成成本。

姚卯青因此把具身数据公司形容成“六边形战士”:既要技术和硬件,也要供应链、生产制造、保供、BOM成本和质量,还要投入算力、存储,最后还得会运营。

他透露,为支撑千万小时级需求,觅蜂需要的固定资产投入已经达到“大几个亿”。

而觅蜂不是唯一一个把数据生产做大的玩家。

京东今年已经推出覆盖“采、存、标、训、评、仿、测”的全链路具身智能数据基础设施,并计划最多发动60万人,两年积累1000万小时真实场景视频数据。它最大的筹码,是零售、物流、工业、健康等已经存在的产业场景。

就在觅蜂派发布前一天,原力无限旗下星河数据宣布投入5亿元启动“群星闪耀计划”,目标同样指向千万小时级数据。

几条路线并不相同。

京东是先有场景,再把场景变成数据;觅蜂强调第三方平台、社会化众包和场景网络;原力无限则把数据能力放进自己的具身大脑和数据基础设施体系。

大家争的不是同一个众包App,而是谁能先把现实世界变成一条稳定的数据供应链。

这场竞争最终还是会落在交付上。

姚卯青提到,一些头部客户已经从年初同时找几十家供应商试数据,转向集中采购甚至单一供应商定点;订单也开始出现一周5万、10万小时级别的要求。

当订单来到这个量级,“能不能采”只是第一道门槛。

真正拉开差距的,是需求来了以后,能不能迅速找到人、设备和场景,再把数据按时、按质交出来。

一个月前,我们问的是:谁来生产1亿小时数据?

现在,2万人已经开始试着回答“谁来生产”。

但“能接单”和“跑得起来”,还不是一回事。

需求端有没有持续订单和复购;供给端能不能在规模放大以后稳定找到人、设备和场景;商业端在补贴逐渐退出之后,客户还愿不愿意买、采集者还愿不愿意做、平台还能不能把账算正。

三个闭环都成立,“机器人版滴滴”才算真正跑起来。

到那时,行业真正要回答的,也不再只是“谁来生产1亿小时数据”。

而是:这1亿小时里,到底什么值得被生产。