自动驾驶行业在感知路线上存在根本分歧。特斯拉坚持纯视觉方案,而 Alphabet 旗下的 Waymo 则主张融合摄像头、雷达和激光雷达的多模态传感器套件。Waymo 联席 CEO Dmitri Dolgov 在 Y Combinator 创业学校 2026 活动上详细阐述了这一技术理念,并分享了从演示到商业产品规模化过程中的经验教训。

Dolgov 在演讲中解释了 Waymo 为何依赖多种物理传感模态的数据融合来解决真实交通中的物理 AI 挑战。Waymo 的技术架构围绕多模态传感器设置展开,车辆结合高分辨率摄像头、主动激光雷达和雷达传感器,形成统一的感知模型。他指出,摄像头虽然能提供丰富的色彩和高分辨率,但在强光、直射阳光、完全黑暗或恶劣天气条件下,被动光学传感器会受到影响。主动激光雷达则能提供不受环境光照影响的直接 3D 结构测量,而雷达利用多普勒测量穿透浓雾、大雨和积雪,以测量物体速度。

Waymo 认为,单一模态系统在追求超人驾驶性能时,安全曲线会过早趋于平缓。通过配备多种不同类型的传感器,重叠覆盖可以防止边缘案例故障,例如道路碎片部分遮挡摄像头镜头的情况。这种冗余设计是 Waymo 安全理念的核心。

这一方法论与特斯拉的纯视觉方案形成鲜明对比。Waymo 声称,纯摄像头方法虽然早期推进更容易,但最终会遇到性能天花板。特斯拉则坚持单一感知模态,认为只需向模型提供足够的真实世界数据,就能解决边缘案例。特斯拉曾放弃雷达和激光雷达,全力投入视觉方案,理由是驾驶员用两只眼睛和一个大脑导航,自动驾驶车辆也应使用摄像头和神经网络以相同方式运行。特斯拉仅凭视觉建模物理世界,用摄像头重建 3D 空间,并处理数十亿视频帧以解决长尾边缘案例。

两种技术路线背后反映了不同的商业模式。特斯拉的纯视觉系统保持了较低的硬件成本,使驾驶辅助功能能够原生搭载在全球数百万辆客户车辆上。而 Waymo 的多模态套件增加了昂贵的硬件,但由于其冗余设计基础和经过验证的安全指标,更容易通过当前的监管框架。

尽管人类可以仅凭视觉感知安全驾驶,但增加主动雷达和 3D 激光雷达可提供额外的安全边际,使自动驾驶系统能比人类反应更快,甚至可能以人类安全驾驶的速度更快地行驶。随着两个平台都在扩大其无人监督的无人驾驶运营规模,真实世界中的干预指标将决定哪条技术路径能率先实现大规模车队部署。