报告正文
机器人根本没长眼睛,凭啥能满屋子躲着你走?
扫地机器人在你家灵活绕开桌腿、鞋子和猫;仓库里的机器人小车成群结队穿梭,谁也不撞谁。可你凑近看看,它们身上压根没有一双"眼睛"。那它到底是怎么"看见"世界的?
先把结论撂这儿,省得你脑补它有"透视眼":机器人的"看见",跟人根本不是一回事。它不是"看懂了画面",而是把一堆传感器采回来的光和距离,硬算成一张能定位、能导航的三维地图。所谓"眼睛",是好几种传感器拼出来的——各有各的短板,谁也离不了谁。
第一步:它靠的不是一只眼,是一套"传感器全家桶"
机器人感知环境,主力就那么几样,分工特别明确:
- RGB 摄像头:负责"这是啥"。拍彩色画面,认得出人、门、桌子、障碍物,语义信息最丰富、还便宜——但它天生不懂"多远",光线太暗或强逆光就抓瞎。
- 激光雷达(LiDAR):负责"有多远、什么形状"。主动打出激光、按返回时间测距,扫出密密麻麻的点云,精度高、还不怕黑;缺点是贵。
- 深度相机(RGB-D):摄像头 + 红外深度模块的合体,一边给彩色画面一边给"每个像素离我多远",室内近距离好用,一到强阳光下就容易犯迷糊。
- IMU(惯性测量单元):管"我自己在怎么动"。测加速度和转动,频率极高,专门在信号断片、地图跟丢的瞬间稳住阵脚。
一句话:摄像头认得出"是什么"却量不准"多远",激光雷达量得准"多远"却不认"是什么"。这就是为什么单靠一种传感器永远不够。
第二步:把光和点云,翻译成"物体"和"距离"
传感器采回来的,是一大坨原始数据:一帧帧图像、几十万个点的点云。这堆东西机器看不懂,得靠计算机视觉来"翻译"。
对图像,用深度学习模型做目标检测——框出画面里哪块是人、哪块是墙;对点云,做分割和配准——把地面、障碍、可通行区域一块块切开、拼起来。
到这一步,机器人才算把"一片乱光"读成了"前方 2 点钟方向有个人、再往前是堵墙"。它不是真"看懂"了,而是把感知变成了一串它能算的坐标和标签。

第三步:SLAM——边走边画地图,还得知道自己站哪
认出了物体和距离,还差最关键一步:我到底在哪、这屋子长啥样?
这就是机器人界的"看家绝技"——SLAM(即时定位与建图)。名字唬人,干的事其实特实在:一边走、一边把周围环境拼成一张地图,同时在这张地图上标出"我此刻站在哪个点"。建图和定位,同一时刻一起完成,谁也不等谁。
扫地机器人能记住户型、规划路线不重复扫,自动驾驶能在没有 GPS 的地库里稳稳绕圈——背后都是 SLAM 在支撑。它就是机器人心里那张边走边长出来的"活地图"。
第四步:多传感器融合——让它们互相"打掩护"
单个传感器都有软肋:摄像头怕黑、深度相机怕强光、激光雷达贵还认不出物体、IMU 时间一长会漂移。怎么办?让它们互相补位——这就是多传感器融合。
摄像头认物体、激光雷达测距离、IMU 兜住高速运动的瞬间——把几路数据算到一块儿,得到一个比任何单一传感器都更稳、更全的判断。这也是为什么如今主流方案,几乎清一色是摄像头 + 激光雷达 + IMU 的组合拳。
说白了,机器人的"眼力",不是靠某个神器,而是靠一群"偏科生"组队,把各自的短板互相盖住。
说到这,其实才碰到真正的门槛
看到这你大概咂摸出味儿了:让机器人"看见",从来不是装个更贵的摄像头就完事——难的是采集、识别、建图、融合这一整套东西,得在机器人跑动的当下、实时算出来还不能出错。
而"看见",只是它迈向"能干活"的第一步。看见之后怎么理解、怎么决策、怎么动手把活干了——这一整套从"感知"到"行动"的能力,正是这两年最火的词:具身智能。它也正是工业机器人从"按固定程序死干",走向"能看、能想、能应变"的那道分水岭——产业机会,恰恰藏在这道坎里。
想顺着"看见"这条线,把具身智能和工业机器人的技术路线、产业机会一次看透? 我们做了份《具身智能与工业机器人技术演进与产业机会研究》——公众号后台回「机器人」,拿去看。