術語 · 視覺大模型

視覺大模型

在大規模視覺資料上預訓練、可遷移到多個下游任務的基礎模型;與「為單一任務從頭訓練的專用模型」相對。

定義

視覺大模型(Visual Foundation Model)指的是先在大規模視覺資料上預訓練、再遷移到多個下游任務的模型。它的對立面不是「小模型」,而是專用模型——後者為某一個任務從頭訓練,換一個任務就要重做。

再往上一層是世界模型:它不只回答「這是什麼」,還要建模空間、材質、光影、運動與因果——也就是物體在三維世界裡如何存在、如何運動、為什麼這樣運動。這些約束不在語料裡,只在物理世界裡。

辨析

類別學的是什麼換任務時
專用視覺模型一個任務的判別邊界從頭再訓一次
視覺大模型可遷移的視覺表徵微調或少樣本遷移
世界模型空間、材質、光影、運動與因果同一底座支撐不同任務

DaoAI World 屬於哪一類

DaoAI World 是微鏈道愛自研的世界模型底座,四條產品線(ACI 質檢、機器人視覺、天眼 SkyVision、Wemio 內容)都建在它之上。公司的核心判斷是:AGI = 一個通用世界大模型 + N 個垂類小模型,而不是「大語言模型 + skill」。

DaoAI World 平臺 —— 底座本身與端到端鏈路

ACI · 自動認知檢測 —— 質檢方向的垂類落點

機器人視覺 —— 三維操作方向的垂類落點

關於微鏈道愛 —— 公司與技術路線