术语 · 视觉大模型

视觉大模型

在大规模视觉数据上预训练、可迁移到多个下游任务的基础模型;与「为单一任务从头训练的专用模型」相对。

定义

视觉大模型(Visual Foundation Model)指的是先在大规模视觉数据上预训练、再迁移到多个下游任务的模型。它的对立面不是「小模型」,而是专用模型——后者为某一个任务从头训练,换一个任务就要重做。

再往上一层是世界模型:它不只回答「这是什么」,还要建模空间、材质、光影、运动与因果——也就是物体在三维世界里如何存在、如何运动、为什么这样运动。这些约束不在语料里,只在物理世界里。

辨析

类别学的是什么换任务时
专用视觉模型一个任务的判别边界从头再训一次
视觉大模型可迁移的视觉表征微调或少样本迁移
世界模型空间、材质、光影、运动与因果同一底座支撑不同任务

DaoAI World 属于哪一类

DaoAI World 是微链道爱自研的世界模型底座,四条产品线(ACI 质检、机器人视觉、天眼 SkyVision、Wemio 内容)都建在它之上。公司的核心判断是:AGI = 一个通用世界大模型 + N 个垂类小模型,而不是「大语言模型 + skill」。

DaoAI World 平台 —— 底座本身与端到端链路

ACI · 自动认知检测 —— 质检方向的垂类落点

机器人视觉 —— 三维操作方向的垂类落点

关于微链道爱 —— 公司与技术路线