定義
視覺大模型(Visual Foundation Model)指的是先在大規模視覺資料上預訓練、再遷移到多個下游任務的模型。它的對立面不是「小模型」,而是專用模型——後者為某一個任務從頭訓練,換一個任務就要重做。
再往上一層是世界模型:它不只回答「這是什麼」,還要建模空間、材質、光影、運動與因果——也就是物體在三維世界裡如何存在、如何運動、為什麼這樣運動。這些約束不在語料裡,只在物理世界裡。
辨析
| 類別 | 學的是什麼 | 換任務時 |
|---|---|---|
| 專用視覺模型 | 一個任務的判別邊界 | 從頭再訓一次 |
| 視覺大模型 | 可遷移的視覺表徵 | 微調或少樣本遷移 |
| 世界模型 | 空間、材質、光影、運動與因果 | 同一底座支撐不同任務 |
DaoAI World 屬於哪一類
DaoAI World 是微鏈道愛自研的世界模型底座,四條產品線(ACI 質檢、機器人視覺、天眼 SkyVision、Wemio 內容)都建在它之上。公司的核心判斷是:AGI = 一個通用世界大模型 + N 個垂類小模型,而不是「大語言模型 + skill」。