2026 世界人工智能大会期间,生数科技联合万兴科技举办专题论坛,创始人、清华人工智能研究院副院长朱军发表主题演讲,提出通用世界模型是连接数字内容与物理具身场景的全新基础设施。
AI 发展将从单纯生成图文视频,进化为理解环境、预判结果、自主执行动作的完整智能体系,同步分享 MoT 统一架构、双赛道落地与技术突破完整路线。
一、通用世界模型核心定义:理解、想象、行动三位一体
人类大脑会提前预判行为结果、规划行动路径,机器通用世界模型复刻这套逻辑,具备三大核心基础能力:环境精准理解、基于状态预判未来、自主学习执行动作。
区别于传统语言、视频单模态大模型,它不只是回答 “事物是什么”,更能推演因果、预判行为后果,实现从内容生成到世界推演的范式升级。行业发展主线是从专用模型走向通用基座,遵循 Scaling 能力增长规律。
训练核心载体以视频为主,搭建六层数据金字塔,囊括互联网通用视频、第一视角动作影像、机器人操作轨迹等多类素材;行业最大痛点是机器人专用数据稀缺,生数通过生成式技术将海量通用视频转化为机器人可用训练素材,补齐数据短板。
二、MoT 统一架构:一体化基座打通内容与机器人两大赛道
生数自研全球首个 MoT 统一架构,将理解、生成、行动三大专家模块整合至同一模型底座,一套架构兼容两类核心业务,无需拆分多套独立模型:
- 数字内容赛道(Vidu 系列模型):面向影视、数字人创作,实现高动态、高一致性视频生成;全新 Vidu S1 流式实时生成模型支持 42FPS、540P 连续交互,可自定义人设、音色,靠语音指令实时驱动虚拟角色,解决传统数字人动作模板固化、长画面不稳定问题。当前流式生成仍存在实时干预弱、语音控制不完善、长时稳定性差、推理成本高等短板,团队已完成端到端语音交互优化。
- 具身机器人赛道:同基座直接驱动多款异构机器人,仅靠自然语言指令即可拆解长流程任务,自主预判环境状态并输出精准动作。对比传统 VLA 模仿学习方案,通用世界模型依靠预训练推演能力,大幅降低训练数据需求量,跨场景泛化、任务完成率大幅领先,多项行业榜单达到头部水平。
三、核心技术突破:解决流式生成与机器人落地痛点
针对两大业务现存瓶颈,生数完成多层技术优化。
在实时视频生成领域,实现纯流式无模板驱动,支持无限时长连续对话,打通自然语言到画面的端到端链路;在机器人控制领域,摒弃单纯轨迹拟合模式,依靠模型对世界的预测能力规划动作,提升执行安全性、容错性,降低复杂任务落地的数据门槛。
整套技术的底层逻辑依托海量视频大规模预训练,再叠加针对性后训练调优,兼顾内容画质与物理世界行动逻辑,实现一套底座双向赋能文创、工业机器人两大完全不同的产业。
四、产业价值与行业发展方向
过去两年,视频类基础模型快速从技术演示走向产业生产力工具,而通用世界模型是下一阶段核心升级。
其核心产业价值分为两层:数字端革新影视、虚拟人、短视频生产效率;物理端赋能服务、工业机器人,大幅降低智能设备开发与训练成本。不同于单一模态模型,通用世界模型是跨数字、物理空间的底层基础设施,打破内容生成与具身智能的技术壁垒。
生数科技将持续完善 MoT 基座,联动产业伙伴推进通用世界模型落地,依托视频预训练路线挖掘 AI 能力上限,推动行业从 “生成素材” 迈入 “理解并改造真实世界” 全新阶段。