上篇聊完宇树RL面试之后,有读者在群里问:"宇树只招控制和RL吗?有没有偏视觉的方向?"当然有。宇树的Go2四足机器人和H1人形机器人都装了深度相机和RGB摄像头,视觉感知是让机器人理解环境的关键模块。但跟大疆的视觉岗比,宇树视觉面试的侧重点很不一样——大疆偏航拍场景下的高空俯视感知,宇树偏地面机器人视角下的近距离场景理解,特别是恶劣光照和动态环境下的鲁棒性。这篇围绕3D目标检测、深度估计和语义分割三个方向展开。3D目标检测:点云还是图像?面试官让你选宇树的机器人同时搭载RGB相机和深度传感器,面试官经常从传感器选型开始考你。"3D目标检测用点云做还是用图像做?各有什么优劣?"基于点云的方法(比如PointPillars、CenterPoint)直接在3D点云上做检测,精度高、距离估计准,但激光雷达成本高、点云稀疏(远处的目标可能只有几个点),而且对天气敏感(雨雾天点云噪声大)。基于图像的方法(比如FCOS3D、SMOKE)用单目或者多目摄像头,成本低、纹理信息丰富,但深度估计天然不如激光雷达准,远距离精度衰减严重。宇树的Go2机器人用的是深度相机(Intel RealSense或类似方案),本质上介于两者之间——既有RGB图像又有密集深度图。面试官追问:"用RGB-D做3D检测,你怎么把2D检测结果转成3D包围盒?"思路是:先用一个2D检测器(比如YOLOv8)在RGB图像上检测到目标的2D包围盒,然后从深度图中提取这个包围盒区域内的深度
宇树视觉面试,机器狗眼中的世界跟你想的完全不一样
上篇聊完宇树RL面试之后,有读者在群里问:"宇树只招控制和RL吗?有没有偏视觉的方向?"当然有。宇树的Go2四足机器人和H1人形机器人都装了深度相机和RGB摄像头,视觉感知是让机器人理解环境的关键模块。但跟大疆的视觉岗比,宇树视觉面试的侧重点很不一样——大疆偏航拍场景下的高空俯视感知,宇树偏地面机器人视角下的近距离场景理解,特别是恶劣光照和动态环境下的鲁棒性。这篇围绕3D目标检测、深度估计和语义分割三个方向展开。3D目标检测:点云还是图像?面试官让你选宇树的机器人同时搭载RGB相机和深度传感器,面试官经常从传感器选型开始考你。"3D目标检测用点云做还是用图像做?各有什么优劣?"基于点云的方法(比如PointPillars、CenterPoint)直接在3D点云上做检测,精度高、距离估计准,但激光雷达成本高、点云稀疏(远处的目标可能只有几个点),而且对天气敏感(雨雾天点云噪声大)。基于图像的方法(比如FCOS3D、SMOKE)用单目或者多目摄像头,成本低、纹理信息丰富,但深度估计天然不如激光雷达准,远距离精度衰减严重。宇树的Go2机器人用的是深度相机(Intel RealSense或类似方案),本质上介于两者之间——既有RGB图像又有密集深度图。面试官追问:"用RGB-D做3D检测,你怎么把2D检测结果转成3D包围盒?"思路是:先用一个2D检测器(比如YOLOv8)在RGB图像上检测到目标的2D包围盒,然后从深度图中提取这个包围盒区域内的深度