前华为“天才少年”,曲线进军家庭机器人

博主:fm5i0dxdb2j0考研资深辅导 2026年08月25日 03:06:27

墨奇智能联合创始人、CTO 黄青虬。图片经过 AI 处理

文丨周小燕

编辑丨徐青阳

家庭机器人什么时候才能真正走进普通人的生活?

在墨奇智能联合创始人、首席技术官黄青虬看来,这件事不能急着从 " 家庭 " 开始。

8 月 22 日,在 2026 世界机器人大会上,黄青虬发表《以端到端具身智能破解非结构化居家难题:让通用机器人服务亿万家庭民生》主题演讲。他提出,家庭对机器人泛化能力的要求最高,因此家庭更像是具身智能能力积累后的终点。

墨奇智能选择的路径,是先进入服务场景。

在黄青虬看来,酒店、公寓等服务场景具有较高的泛化性,也能够持续产生真实作业数据,可以作为训练通用具身模型的 " 训练场 "。围绕这一思路,墨奇智能把数据采集、质检、挖掘、标注、训练和评测做成一套完整的数据链路,同时探索 MoRA 具身模型,希望机器人能够理解人的意图,自主决策,并持续完成任务。

这条路径最终指向的仍然是家庭。但在进入家庭之前,机器人需要先解决几个问题:如何从真实世界获得足够有效的数据,如何让模型理解环境和人的意图,如何在执行过程中处理突发变化,以及如何让机器人持续把一件事情做完。

黄青虬认为,家庭机器人走进家庭之前,首先要解决真实世界中的理解、决策和执行问题,让机器人听得懂人的意图,应对环境变化,并把一件事情持续、可靠地完成。

以下为黄青虬演讲全文:

家庭不是起点

大家好,我是黄青虬,来自墨奇智能。

墨奇智能是一家成立了 8 个多月的具身智能初创公司。我们的使命,是让具身智能走进现实,去重塑我们未来的生活方式。简单来说,就是我们想造一个家庭服务机器人。

制造家庭服务机器人是一件非常有挑战的事情,我相信这也是很多具身创业者的追求。拥有一个家庭机器人,也是很多普通人的愿望。但我们认为,进入家庭是能力累积的终点,并不是造一个具身家庭服务机器人的起点。

要理解其中的原因,我们不妨先对世界的运行逻辑做一个简化的梳理。这个世界上的物品,通过工厂生产出产品,再通过庞大的物流服务体系运转到消费端。消费端包括 ToB 的家庭服务、商业服务,也包括 ToC 的家庭。

从具身技术发展的角度来看,我们认为最重要的三个能力是效率、准确率和泛化性。如果把场景和能力放在一起看,工业场景对效率和准确率的要求最高,家庭则对泛化性的要求最高。物流和服务处于两者之间。

家庭还有隐私以及能力要求、用户买单等问题,所以现在很难直接进入。但如果真要进入家庭,我们应该怎么选择切入场景?

我们认为,数据是这里面最需要核心考虑的因素。如果要训练一个可泛化的具身基础模型,就必须有泛化的数据。从这些场景来看,服务场景比较合适。它的泛化性足够高,可以作为家庭的模拟训练场,同时数据的可回流性也足够高。所以我们的思路是,通过服务场景训练一个可泛化的基础模型,再逐步走入家庭。

路径确定之后,接下来就是怎么一步一步积累能力。我们主要从三个部分来做:数据、算法,以及整个硬件本体。

数据,先求 " 真精 "

首先,数据是里面最重要的一环。但我对数据的定义,并不只是一个数据集,而是更像一套持续生产模型训练有效实验结果的基础设施。

具身智能本质上是在学习物理世界,但物理世界不会天然变成模型可以学习的数据。所以我们需要设计一套严密的数据生产机制,把物理世界变成模型可以学习的数据。

在这个数据生产链路里面,第一个环节当然是采集。我们对数据采集的思考是三个 " 真实 ":真实的场景、真实的作业人员、真实的工作。我们认为,只有这样的数据才是高质量数据。

相比之下,很多素材厂里的遥操作数据有点像摆拍。可能看起来采集了 1 万小时、10 万小时,甚至 100 万小时,但其中可能有 90% 的场景都是重复的。如果数据多样性不够,模型能够覆盖的知识面也就不够。

还有一个问题,专业数采员的优化目标是尽可能获取更多数据,而不是把工作本身做好。比如让他去擦一张桌子,他可能会做出一个擦桌子的模拟动作,但他并不是真的想把这张桌子擦干净。所以我们认为,只有进入真实场景做采集,才能真正获取高质量数据。

我们的选择是做自己的便携式采集设备,让酒店、公寓里的保洁人员带上设备,在日常真实工作中把数据采集下来,同时回流给我们的模型做训练。

另外一个可能跟整个业界观点不太一样的地方,是大家现在讨论得比较多的是数据数量。我们没有去冲刺 100 万小时、1000 万小时,甚至 1 亿小时的数据,更关心的是怎么把 1 万小时或者 10 万小时的数据做到足够高质量。

这里面的高质量包括很多方面。比如我们有多个设备,需要把各个设备之间的时间同步做到亚毫秒级;轨迹运动精度做到毫米级;还要通过采集过程中的交互,让采集员或者保洁员在工作的时候保证动作完整,同时通过各种融合算法,让数据变得可学习。

除了数据质量,整个数据链路本身也是一套复杂的迭代引擎。我认为,数据飞轮转得足够快,模型才能更快收敛到正确的结论。我们用了大约半年的时间搭建了一套数据架构,包括采集、质检、挖掘、标注、训练以及评测六个模块。

其中,质量检查是整个数据准入的一道 " 门禁 "。我们有一套比较完善的数据评测体系,只有达到质量分数的数据,才有可能成为机器人的学习数据。

比如时空一致性。多个相机拍到同一个画面时,需要保证同步曝光,误差不能超过 1 毫秒。运动轨迹也需要保持平滑、可达,两毫秒之间不可能突然跳变半米。

除了时空一致性,还有数据完整性,以及整个数据是否具备可执行性等评测标准。这些最终会形成一个 " 质量评分 "(Quality Score)。通过 " 门禁 " 的数据,我们才认为是可以学习的高质量数据。

数据变得足够庞大以后,如何取用数据也会成为一个瓶颈。

比如我们今天来到展会现场,展位是半露天的,会有阳光照进来。当光照变得很强的时候,可能会发现模型能力下降。这时候我们就可以做一个实验,把数据库里的强光照数据拿出来,提高这类数据的比例,看看能不能让模型在强光环境下表现得更好。

如果要做这个实验,就需要从几万小时甚至几十万小时的数据里,快速找到几千小时的高强光数据。这就是挖掘系统的价值,它能够帮助我们快速做各种实验,让模型向希望的方向进行优化。

标注也是整个链路里非常关键,同时非常消耗算力和人力的一个环节。其中一个重要部分叫自动标注(AutoLabel)。我们需要构建各种 Teacher Model,包括多模态专用大模型,再通过各种融合策略,生产模型训练时需要的参考答案。

采集、质检、挖掘、标注、训练和评测,这套链路持续运转,构成了我们推动具身模型发展的基础。

把 " 大脑 " 放到机器人身上

数据之外,接下来就是模型。

今天我不太想重点讲模型架构。模型架构包含很多细节,包括参数量的设计、模块之间的连接关系、监督信号、loss 设计等,最终的模型是很多细节共同构成的结果。所以,单独用 VLA(视觉 - 语言 - 动作)模型或者世界模型这样的概念,很难完整描述一个模型。而且在我看来,VLA 和世界模型本身也并不冲突。

我们更希望从能力维度来描述模型。可能 99.9% 的观众并不关心这个模型长什么样,更关心这个模型能干什么。所以我们对模型的命名,包括模型架构的设计,更多也是从能力出发,关注模型现在能做什么、未来能做什么,以及我们希望它能做什么。

我们的模型叫 MoRA。Mo 代表墨奇,R 代表 Reasoning,A 代表 Autonomy。后面两个词代表我们对模型最重要的两个能力要求。第一是 Reasoning,我们希望它能够理解这个世界。第二是 Autonomy,我们希望它能够自主决策、自主执行。

从整个机器人系统来看,我们现在把它分成三个 System。

System2 大部分时候运行在云端,负责交互。用户给它一个指令之后,它会把指令拆解成机器人可以执行的 Task,再把 Task Instruction 交给端侧的 System1。

System1 就是通常意义上的 " 大脑 " 系统。它输入语言指令,同时看到周围的环境,然后做出动作,输出的是轨迹。

怎么把这个轨迹转换成机器人可以执行的关节信号?这就需要 System0,也就是大家常说的 " 小脑 " 或者运控系统。

在模型设计上,我们遵循两个最核心的理念。

第一个是把更多能力向 System1 转移。System 2 是一个交互系统,是低频系统,同时运行在云端。机器人本身是一个实时闭环系统,必须非常快速地应对执行过程中遇到的各种情况。所以我们希望端侧的 " 大脑 " 越来越聪明,越来越不需要依赖云端的大脑。这样它才能成为一个可以持续执行任务的自主智能体。

所以我们叫 Agentive-Native,希望 System 1,也就是大脑系统,能够自主决策,有记忆,并能够进行长程任务规划。

第二个关键理念是生成、决策、理解一体化。

我们的模型在训练时,既有理解类任务,更接近 VLM 的训练方式,会做 QA(问答)、COT(思维链)和语言理解。同时也会做未来帧或者未来视频的生成,去想象这个世界的画面。

除此之外,它会输出动作。最后,我们还加入了一个高频触觉专家,用来应对一些需要高频响应的触觉动作。

让机器人自己把活干完

目前,我们的机器人已经在类家庭环境里做一些桌面清理和人机交互的任务。

比如桌面任务,它能够区分哪些物体要放在哪里,哪些是垃圾要扔掉。遇到突发情况,它也需要能够处理。比如突然扔过来一个香蕉皮,它能够把它扔掉。

人机交互语义理解同样重要。比如一个人端起一杯水,看了一下发现没有水,机器人能够识别到这个情况,判断这个人可能口渴了,然后给他递一瓶水。

送洗衣服也是一个比较复杂的场景,它涉及开门、按按钮,以及把手伸到洗衣机或者烘干机里面。手伸进去以后,还涉及狭小空间的操作,以及衣服这种柔性物体的操作。另外,还有双手协同的操作,比如拎起一个脏衣篓。

现在我们的模型能够叠各种各样花纹的衣服,但这个能力还在继续提升。比如给它一件大衣、一件西装,可能它还处理不好。

从能力维度来看,我们希望机器人具备多模态的目标理解能力。

人与机器人交互,最直接的方式是给它一个指令。但我们希望这个指令可以比较模糊。比如告诉它 " 收拾桌面 ",不需要再告诉它桌面里的水果应该放哪里,垃圾应该放哪里,生活用品应该放哪里。我们也希望它能够接受图像指令。比如给它一张图片,让它把桌面整理成图片里的样子。

同时,我们希望机器人能够持续不断地工作,一直到完成目标,而不是只完成一个动作就结束。

多模态意图理解也很重要,也就是能够理解人的意图。还有环境干扰的处理能力。我们希望 System One 里面能够自动形成闭环,遇到突发情况时,不需要再去请求云端的交互模型。

在打开洗衣机的过程中,还涉及位置和力控混合。因为洗衣机的门是有弹性的,机器人需要通过力的感受知道需要多大的力度才能把门打开。

为此,我们为模型设计了三层记忆。最短的是毫秒级记忆,用来保证轨迹平滑,需要记住上一帧做了什么,或者上一毫秒做了什么。第二个是秒级记忆。比如已经开过门了,就不会再开一次。第三个是分钟级记忆。机器人在开始做事情之前,需要知道环境原来是什么样。如果一个枕头掉了下来,最后需要恢复原来的状态,它要知道这个枕头原来在哪里,再把它放回沙发上。

这三层不同时间尺度的记忆,都包含在 System One 里面。

回归 " 本体 "

讲完模型,最后再讲一下 " 本体 ",也就是机器人硬件。我们现在看到很多机器人,实际上都是工业风,有裸露的电机和线缆。但我们设计机器人的时候,希望它不管从外观上还是结构上,都能够融入整个家庭空间。

我们的机器人叫 KINO,整体设计风格比较有亲和力。比如底盘,你会发现它比绝大部分机器人都小。我们在实际家庭环境里发现,狭窄底盘很重要,只有底盘足够小,才能通过家里的很多地方。所以整体的设计理念就是,不侵入生活。

总的来说,家庭机器人的第一步,不是马上把它放进家里,也不是让它学会所有技能。最重要的是,让它在真实世界里理解人的意图,应对环境变化,并且持续可靠地把一件事做完。这是机器人进家之前,第一步要做好的事。

除此之外,机器人进家还要面对隐私、物理安全,以及与人长期共处的伦理问题。这是一个更宏大的命题。

但不管怎样,我希望整个行业一起努力,早日把机器人送进每一个家庭。

The End