定义
视觉大模型(Visual Foundation Model)指的是先在大规模视觉数据上预训练、再迁移到多个下游任务的模型。它的对立面不是「小模型」,而是专用模型——后者为某一个任务从头训练,换一个任务就要重做。
再往上一层是世界模型:它不只回答「这是什么」,还要建模空间、材质、光影、运动与因果——也就是物体在三维世界里如何存在、如何运动、为什么这样运动。这些约束不在语料里,只在物理世界里。
辨析
| 类别 | 学的是什么 | 换任务时 |
|---|---|---|
| 专用视觉模型 | 一个任务的判别边界 | 从头再训一次 |
| 视觉大模型 | 可迁移的视觉表征 | 微调或少样本迁移 |
| 世界模型 | 空间、材质、光影、运动与因果 | 同一底座支撑不同任务 |
DaoAI World 属于哪一类
DaoAI World 是微链道爱自研的世界模型底座,四条产品线(ACI 质检、机器人视觉、天眼 SkyVision、Wemio 内容)都建在它之上。公司的核心判断是:AGI = 一个通用世界大模型 + N 个垂类小模型,而不是「大语言模型 + skill」。