thinkism.ai

当世界模型只搭骨架:解读 Tencent Proxy2World 的「轻量代理」路线

2026-10-04 · AI / 视频生成 / 世界模型 · 阅读时间 ≈ 8 分钟

2026 年 9 月底,Tencent IEG 放出了 Proxy2World(arXiv:2609.35023)。它想回答一个工程上很现实的问题:如果只让你搭一座城堡的骨架(几条低多边形线 + 几个简单几何体),能不能让生成模型自己把墙体、材质、光照全部补出来,而且每一次补出来的还都不一样?答案是可以,而且关键判断是——不要用 proxy–video 配对数据训练。

这篇笔记会拆开 Proxy2World 的方法、为什么「不配对训练」是它的核心赌注、以及它提出的 ProxyBench 给了哪些可量化的对照。然后我会给出工程落地角度的判断——什么时候该抄这条路线,什么时候应该绕开它。

Proxy2World 跨模态联合 RGBD 学习与代理-相机混合去噪流程图
图 1 · Proxy2World 的方法总览:上排是训练阶段的两种互补能力,下排是推理时由「代理定结构」过渡到「RGBD 联合细化」。图源:论文官方项目页,作者 Hongli Xu 等(Tencent IEG),2026,CC-BY 4.0。

一、问题:让视频模型「听话」的三种姿势

可控视频生成(controllable video generation)走到 2026 年,主流路线其实只有三种摆位,各有取舍:

第三种姿势的关键难度在于:proxy 本身是「underdetermined」的。同一座城堡骨架,可以生成哥特黄昏、神秘紫晶、血色圣殿三种完全不同的世界——这不是 bug,是产品需求。如果用「proxy ↔ 真实视频」配对数据去训练,模型会过度记忆一种渲染风格,反而失去了多样性。

二、方法:没有 proxy–video 配对数据,怎么学结构服从?

Proxy2World 的核心做法是把训练和推理解耦:

  1. 训练阶段,只用普通的、带相机位姿的 RGBD 视频(120,624 段),让一个共享的 DiT 同时学两种能力——深度条件下的 RGB 生成(几何当作硬约束)和RGBD 联合去噪(几何与外观一起细化)。这一步用 cross-modal flow matching 串起来。
  2. 推理阶段,执行一种 40 步的「hybrid denoising」:前 3 步把 proxy 渲染出的深度当作硬条件,强行把场景结构钉死在用户声明的布局上;后 37 步去掉这个深度硬约束,让模型同时细化 RGB 和 深度,但始终保留相机引导。

为什么要分两步?因为如果全程把 proxy 深度当硬条件,模型会原样保留低多边形的僵直边缘;如果全程只用相机引导,主体位置又会偏离设计稿。论文的消融实验(图 5)清楚显示:单一控制都会失真,混合推理是唯一兼顾两者的方案。

另一个不显眼但关键的细节是相机-几何尺度对齐。proxy 的深度图和视频模型期待的深度必须在同一度量尺度上,否则相机一动几何就会「各说各话」。这部分在论文里只占两段,但工程上是最容易翻车的地方。

三、数据:为什么「不配对训练」反而是优势

控制式视频生成的老问题:proxy 千人千面,根本没有自然存在的「proxy ↔ 视频」配对数据集。如果你让设计师手动为每段真实视频反向拆出 proxy,单段成本可能就要几小时;自动化又会把「我想要的 proxy」和「模型看到的 proxy」混淆。

Proxy2World 的策略是不训练这个映射,而是让模型从普通 RGBD 视频里学到「几何是一种可以被遵守、也可以被放开的条件」。结果是:

我个人最喜欢的一个 demo 是「同一个城堡骨架」下切换 Gothic / Arcane / Crimson 三套配色,相机和动作完全一致,但场景气质完全变了。代理做约束、模型做自由度,这种分工对内容生产是真有用的。

四、评测:ProxyBench 给了哪些可比的数字

为了避免「自说自话」,论文同时放出了 ProxyBench(25 个场景、300+ 段 5 秒序列,论文里选 78 段做统一定量比较)。它的核心论点是:可控视频生成不能只看「几何对齐」或「相机误差」一项,必须同时看结构服从、外观质量、相机精度——它们之间天然存在 tradeoff。

ProxyBench 的设计与评测流程图
图 2 · ProxyBench 的设计思路:覆盖多种场景、代理抽象程度和相机轨迹复杂度,同时给出结构、质量、相机精度三类指标。图源:官方项目页 ProxyBench 模块。

论文给出的代表性数字(同一权重、同样的文字 + 首帧 + 相机轨迹输入):

值得提醒的是,论文自己也承认不是所有指标都第一。例如 Cosmos-Depth 在 VLM 代理遵循胜率上反而高于混合版本。论文的重点是「在保留可控结构的同时让粗糙几何有机会变成更自然的形体和外观」——这是一个tradeoff 优化,不是单点冠军。

五、我的判断:这条路线值不值得抄?

看完方法、数据和数字,我的工程视角判断如下:

什么时候该走 Proxy2World 路线

什么时候不该走

两条延伸观察

  1. 「混合推理 + 多模态条件」正在变成可控生成的默认配方。Proxy2World、4Director、LooseControlVideo 这一波新工作,几乎都是「前 N 步硬约束 + 后 M 步放开」的混合控制思路。可以赌一把:未来 12 个月,所有顶会视频生成论文都会引入这种 timestep-wise 强度调节。
  2. benchmark 比模型更值得抄。ProxyBench 这种「结构 / 质量 / 交互三者联合评测」的范式,比单点冠军论文更影响行业——它直接决定了下游团队如何选模型。如果你正在搭内部评测,强烈建议抄它的指标设计思路。

六、落地思考:现在可以拿这套方法做什么

如果你下周就要在公司内部复现或借鉴这条路线,我的建议是:


参考

下一篇预告:当世界模型进入「在线任务识别」阶段,机器人该如何看待自己的「预演未来」能力——以及为什么这会改变具身智能的训练循环。