双院士领衔!华控基金联合清华PE研究院共探世界模型与具身智能产业新图景

近日,由清华大学全球私募股权研究院与华控基金联合主办的“范式跃迁:世界模型前沿突破与具身智能产业新图景”主题论坛在清华大学举行。中国科学院院士、清华大学人工智能研究院院长胡事民,中国科学院院士、中国密码学会理事长王小云两位院士领衔,清华大学计算机科学与技术系长聘教授刘华平,极佳视界(GigaAI)联合创始人、首席科学家朱政,三启万物(VAST)联合创始人、CTO梁鼎,流形空间(Manifold AI)创始人兼CEO武伟,息壤开物创始人李寅,以及清华大学全球私募股权研究院院长、清华大学经济管理学院教授肖星,华控基金董事长华桦,合伙人、首席投资官赵伟等嘉宾出席论坛,300余人次产业界及投资界人士现场参会。与会嘉宾围绕人工智能从”语言智能”迈向”物理智能”的关键一步展开深度研讨,共探世界模型的技术路径、商业落地与投资机遇,为产业发展注入协同动能。
进入2026年,人工智能正经历一场深刻的范式切换:从”语言智能”走向”空间智能”与”物理智能”。单纯依赖文本与二维视觉的范式,已难以支撑机器人、自动驾驶对真实世界的理解、预测与决策。世界模型能够感知、重建、推理并生成物理世界,被视为下一代基础模型的核心形态。继OpenAI的Sora、李飞飞团队World Labs之后,4D场景生成、可交互世界引擎、VLA基础模型等前沿方向,正迎来从研究突破走向规模化商业落地的历史窗口。本次论坛正是围绕这些话题展开。
论坛阵容:学界、产业界、投资界三方汇聚

学界方面,中国科学院院士、清华大学人工智能研究院院长胡事民,中国科学院院士,中国密码学会理事长王小云,清华大学计算机科学与技术系长聘教授刘华平出席论坛并发表演讲。
产业界方面,极佳视界(GigaAI)联合创始人、首席科学家朱政,三启万物(VAST)联合创始人、CTO梁鼎,流形空间(Manifold AI)创始人兼CEO武伟,息壤开物创始人李寅同台分享,覆盖数据引擎、三维生成、具身智能、物理世界基础模型等核心环节。
投资界方面,华控基金董事长华桦出席致辞,合伙人、首席投资官赵伟,高级副总裁彭飞出席圆桌,与四位创始人同场对话。

清华大学全球私募股权研究院院长、清华大学经济管理学院教授肖星
清华大学全球私募股权研究院院长、清华大学经济管理学院教授肖星在开场致辞中介绍,研究院是清华大学校级研究机构,依托清华大学经济管理学院,既开展私募股权领域的智库研究与政策建言工作,也布局未来产业与战略性新兴产业细分赛道研究。经过多年积累,研究院已形成覆盖约1500个细分赛道的产业图谱和数据库。她表示,研究院希望将本次论坛打造为汇聚科技、产业与金融的三方互动平台,汇聚科学家、创业者与投资人,共同探寻未来产业的投资机遇。
世界模型的科学基础与前沿路径
上午的议程围绕”世界模型”这一概念的关键技术路径、理论前提、技术卡点与场景应用的可行性展开。
胡事民:从图形学到世界模型——三维内容生成与自主AI基础设施的中国路径

中国科学院院士,清华大学人工智能研究院院长胡事民
胡事民院士从图形学的学科源流讲起:建模、仿真、动画、渲染这四大核心内容,回答的是同一个问题——怎样构造一个世界,让它转起来,并让人看得见、能参与其中。在这个意义上,图形学是世界模型生长起来的沃土。
他提出,世界不只是表面看到的像素流,其下还有大量深度、几何、规则和物体对象。有价值的世界模型应具有真正的物理属性:可演化、可度量、参数可观测、可复杂交互、能长程稳定运行。围绕这一目标,他给出了世界模型的四层技术体系,清华自主研发的“计图”(Jittor)深度学习框架,为物理世界模型的高效运行与国产算力适配提供了底层支撑。谈到落地,他的态度很明确:“一个领域要发展好,一定得落地、一定得跟应用结合。”
刘华平:具身智能与世界模型的双向赋能

清华大学计算机科学与技术系长聘教授,中国人工智能学会理事刘华平
刘华平教授从具身智能的思想脉络切入:从布鲁克斯”智能需要一个身体”,到莫拉维克悖论揭示的”让机器人下棋容易、像一岁小孩一样感知和行动却很难”。他提出,具身智能的本质是形态、行为、感知、学习四个维度的协同增效。
他介绍了团队在脑体协同控制、VLA模型与自主交互学习方面的进展:通过调节控制器复杂度反向激发身体潜能,得到更简单、可解释、更易迁移到真实环境的控制器;针对数据高度依赖人工演示的瓶颈,团队的自主数据采集系统可节省70%以上的工作量,并实现了全程自主的长程任务。
演讲结尾,他引用布鲁克斯那句”世界是它自身最好的模型”——我们可以去理解它、预测它、刻画它,但很难代替它。世界模型与具身智能可能是一个双螺旋结构,互相赋能、共同发挥作用。
世界模型的商业落地与投资逻辑
下午的议程转入安全与产业视角:模型技术的安全边界在哪里,技术路径如何进行商业化落地,资本如何下注。

华控基金董事长华桦
论坛伊始,华控基金董事长华桦在致辞中表示,华控判断世界模型是继大语言模型之后,AI从语言智能迈向空间智能和物理智能的关键一跃,并沿两条主线布局:底层能力上,关注三维内容生成、可交互世界引擎等机会;场景落地上,关注具身智能训练、仿真、数据合成等方向的商业化闭环。“从研究突破到规模化落地的历史窗口正在打开,既需要技术方的锐度,也需要安全底座,更需要资本与产业的耐心共振。”
王小云:密码技术与人工智能安全

中国科学院院士,中国密码学会理事长王小云
在讨论商业落地之前,王小云院士先把视线拉回安全边界。她的核心论断很直接:人工智能安全的核心通道是密码技术——因为只有密码技术能够提供可证明安全,“没有证明是安全的,大概率就是不安全的”。
她分享了团队的系列成果:2018年用AI攻破首个后量子密码公钥算法;2024年提出将密码学差分分析思想移植到神经网络关键参数恢复攻击,由此形成的”基于密码学视角的人工智能安全新理论和防护体系”入选”中国科学十大前沿科学问题”;团队的多模态越狱攻击算法FigStep在30多家顶级研究机构联合撰写的测评报告中成为唯一成功越狱Claude的算法。面向产业,她点出三个方向:后量子密码产业、以全同态加密实现”数据可用不可见”的数据流通产业、人工智能安全产业。
朱政:走向通用世界模型新时代

极佳视界(GigaAI)联合创始人、首席科学家朱政
朱政仿照语言模型的分级思路,把世界模型划分为L1—L5五个层级:L1通用视频生成,L2与物理世界Agent结合生成动作,L3掌握几何常识,L4掌握物理常识,L5生成可运营的、包含多Agent交互协同的通用无限世界。他判断,仅靠2D视频监督不足以学到物理常识,必须引入带动作的数据和强化学习后训练。
在具身基础模型方向,极佳视界搭建了”数据金字塔+算法金字塔”的双金字塔体系。落地层面,自动驾驶方向的DriveDreamer实现数据生成与闭环仿真;8月发布并开源的通用具身大脑GigaBrain-0.7提出了含预测模块的System-3架构;家庭服务场景,拾光S1已获得武汉光谷之寓百台规模在手订单,正在推进规模化部署;北京的机器人组装示范产线规划由机器人接管约20%的工序。公司还在持续迭代通用世界模型一粟YiSu,并牵头建设”通用世界模型北京市重点实验室”。
梁鼎:原生三维表征与全栈生成范式——从Tripo P1.0到通用世界底座

三启万物(VAST)联合创始人、CTO 梁鼎
梁鼎回顾了VAST成立三年来的”三步走”:先做静态3D资产,再做可交互的无限场景,最终做人人可动态交互的无限3D世界。资产层面,早些发布的P2.0是市面首个可直接生成四边面、五边面与三角面的技术,直接产出低面数、拓扑规整、可供游戏产业二次编辑的资产。场景层面,结合Agent能力,一句话、约二十分钟就能生成一个可交互小游戏。
谈到世界模型,梁鼎的架构主张是”3D管记忆、视频管渲染”:纯视频世界模型没有记忆、没有因果,镜头绕物体一圈回来画面就不一致;3D状态可以持久存储,能保证时空一致性。VAST以”结构化状态层—条件接口层—生成式渲染层”三层架构,构建同时适配交互式内容创作和具身智能训练的通用世界模型。
武伟:从预测未来到优化行动——以物理为中心的统一世界模型及应用

流形空间(Manifold AI)创始人、CEO 武伟
武伟从一个问题切入:人类认知世界的基座模型是语言模型吗?他的答案是否定的——儿童行动能力的习得稳定先于语言,行动智能来源于视觉引导的、以物理为中心的世界模型。沿着这条路线,流形空间完成了全栈布局:自动驾驶世界模型连续两年获得Waymo Sim Agents挑战赛第一,业内首个实现2分钟级生成;机器人世界模型RoboScape生成的数据与真实环境相似度达95.3%;世界模型基模WorldScape能把单张图片扩展为可交互世界,在国际权威榜单上精度全球第一,可在边缘侧实时运行。
他还介绍了两项原创突破:首次将MoE稀疏激活引入世界模型,把100%稠密激活降至约三分之一,有望打开世界模型的Scaling Law;首次实现机器人的In-Context Learning,看一遍人类演示即可零样本复现毫米级精度的操作,“这是我们认为的机器人的下一个GPT时刻”。
李寅:LPM——物理世界基础模型的架构设计和训练

息壤开物创始人李寅
基于在华为云负责盘古大模型和多个具身智能ToB项目的经验,李寅直言当前具身智能商业化的三大难题:泛化性不足、长程任务执行能力弱、缺乏闭环学习。“大模型真正解决的不是某个场景最后一公里的精度问题,而是泛化性问题。”为此他创立息壤开物,研发通用物理基座模型LPM(Large Physics Model,大物理模型)。
技术层面,该方案借助贝尔曼方程,将问题建模为世界模型P与策略π两个变量的联合求解。对比当前主流的VLA、WAM模型,LPM的目标更贴合贝尔曼递归方程最优解的第一性原理。自回归架构天然具备统一表征π与P的理论基础;同时,过往基于DiT架构训练视频生成模型的实践也印证:生成能力需要依托自回归模型完成推理,这也是其选用自回归作为主干架构的核心原因。商业层面,公司定位L0级通用基础底座,向L1具身智能领域延伸,赋能行业客户开展L2层的自主开发。
圆桌论坛:世界模型的产业落地——机遇、挑战与投资逻辑
圆桌由华控基金高级副总裁彭飞主持,赵伟与四位创始人围绕行业格局、护城河、商业化拐点和Physical AGI时间表展开讨论。

关于路线,朱政主张把行业分为垂类场景与通用场景,共同把蛋糕做大;梁鼎按具身与娱乐两个场景划分;武伟认为关键要看团队是否真正以物理和视觉为中心;李寅则简化为”给人看的”和”给机器看的”两大路线。赵伟给出投资人的三层框架——表征方式、如何注入物理、产品形态是渲染器、仿真器还是规划器,三层叠加才能把不同企业放进不同的格子。
关于护城河,梁鼎押注数据质量与细粒度物理标注;朱政列出数据、训练工艺、客户绑定三重壁垒;李寅认为坚持基模训练的底层第一性原理和高质量数据最难被带走;武伟直言核心壁垒是顶尖人才,“卡最多、现金最多的公司,并不拥有最顶尖的模型”。
关于商业化,各方判断基本一致:视觉内容生成与数据合成已基本跑通闭环,具身智能受泛化性不足、定制化成本高所限,仍需一到三年。关于AGI时间表,朱政指出具身基模参数量仅为语言模型的百分之一甚至千分之一,亟需找到不同于语言模型的Scaling路径;梁鼎预计算法瓶颈今年底或明年上半年就会有阶跃式变化;武伟则认为:“这个时代算法可能是最不重要的,因为以后的算法是AI写的。”
赵伟还分享了华控的投资逻辑:早期看人,看团队的大模型训练经验和算法迭代加速度;成长期看数据和场景,数据飞轮能否闭环是核心考核;成熟期回归商业化与规模化。他判断,如果世界模型的Sim-to-Real gap足够小,其商业价值将远大于今天的语言模型。
华控基金:深耕人工智能前沿赛道,抢先布局世界模型产业窗口
本次论坛的举办,为世界模型与具身智能领域的技术交流、产业对接与资本合作搭建了重要平台。随着三维生成、可交互世界引擎、具身智能等方向的持续突破,世界模型产业正加速从实验室走向规模化落地,有望在未来数年成为驱动人工智能下一轮变革的核心力量。

华控基金自2018年起深度参与清华全球私募股权研究院建设,持续深耕产学研协同。多年来,其通过资本运作探索科研成果转化,为多行业发展注入动能。
华控基金构建Top-down的研究体系,已覆盖千余细分领域产业知识图谱,通过跨学科研究精准把握技术突破节点。在人工智能领域,采用多赛道并行策略,打造”基础模型+具身智能+AI基础设施”投资矩阵,凭借全产业链协同、多技术路线覆盖的模式,实现技术与资本高效融合。
在华控基金看来,世界模型是继大语言模型之后人工智能最重要的底层范式跃迁:一方面,4D场景生成、可交互世界引擎、VLA基础模型等技术正在快速收敛;另一方面,机器人、自动驾驶等场景的数据飞轮开始转动,商业化闭环渐次清晰。历史窗口已经打开,既需要技术方的锐度,也需要安全底座,更需要资本与产业的耐心共振。
未来,华控基金将继续坚守”长期主义”信条,与学术方、产业方并肩前行、协同攻关,以资本为纽带,支持更多具备原创技术能力与工程化落地能力的科技企业成长,共同推动人工智能从”语言智能”迈向”物理智能”的范式跃迁,见证并参与一个可被计算、可被交互的真实世界智能时代。

上一篇:
