自動駕駛行業在感知路線上存在根本分歧。特斯拉堅持純視覺方案,而 Alphabet 旗下的 Waymo 則主張融合攝像頭、雷達和雷射雷達的多模態感測器套件。Waymo 聯席 CEO Dmitri Dolgov 在 Y Combinator 創業學校 2026 活動上詳細闡述了這一技術理念,並分享了從演示到商業產品規模化過程中的經驗教訓。
Dolgov 在演講中解釋了 Waymo 為何依賴多種物理感測模態的資料融合來解決真實交通中的物理 AI 挑戰。Waymo 的技術架構圍繞多模態感測器設定展開,車輛結合高解析度攝像頭、主動雷射雷達和雷達感測器,形成統一的感知模型。他指出,攝像頭雖然能提供豐富的色彩和高解析度,但在強光、直射陽光、完全黑暗或惡劣天氣條件下,被動光學感測器會受到影響。主動雷射雷達則能提供不受環境光照影響的直接 3D 結構測量,而雷達利用多普勒測量穿透濃霧、大雨和積雪,以測量物體速度。
Waymo 認為,單一模態系統在追求超人駕駛效能時,安全曲線會過早趨於平緩。通過配備多種不同型別的感測器,重疊覆蓋可以防止邊緣案例故障,例如道路碎片部分遮擋攝像頭鏡頭的情況。這種冗餘設計是 Waymo 安全理念的核心。
這一方法論與特斯拉的純視覺方案形成鮮明對比。Waymo 聲稱,純攝像頭方法雖然早期推進更容易,但最終會遇到效能天花板。特斯拉則堅持單一感知模態,認為只需向模型提供足夠的真實世界資料,就能解決邊緣案例。特斯拉曾放棄雷達和雷射雷達,全力投入視覺方案,理由是駕駛員用兩隻眼睛和一個大腦導航,自動駕駛車輛也應使用攝像頭和神經網路以相同方式執行。特斯拉僅憑視覺建模物理世界,用攝像頭重建 3D 空間,並處理數十億影片幀以解決長尾邊緣案例。
兩種技術路線背後反映了不同的商業模式。特斯拉的純視覺系統保持了較低的硬體成本,使駕駛輔助功能能夠原生搭載在全球數百萬輛客戶車輛上。而 Waymo 的多模態套件增加了昂貴的硬體,但由於其冗餘設計基礎和經過驗證的安全指標,更容易通過當前的監管框架。
儘管人類可以僅憑視覺感知安全駕駛,但增加主動雷達和 3D 雷射雷達可提供額外的安全邊際,使自動駕駛系統能比人類反應更快,甚至可能以人類安全駕駛的速度更快地行駛。隨著兩個平台都在擴大其無人監督的無人駕駛運營規模,真實世界中的干預指標將決定哪條技術路徑能率先實現大規模車隊部署。