腾讯混元发布 WorldClaw: 3D 生成从单体迈向可编辑场景

腾讯混元发布 WorldClaw: 3D 生成从单体迈向可编辑场景

WorldClaw3D生成AI Agent腾讯混元游戏开发

数据源:arXiv + GitHub

2026 年 8 月 7 日,腾讯混元 3D 研究团队正式开源 WorldClaw 框架,将 3D 内容生成从单物体构建推向了可编辑的开放世界场景。以往生成模型输出的神经隐式场如同难以解包的渲染黑盒,而 WorldClaw 在一句话提示词下生成的 11 个示例世界中,提供了可直接拖入引擎修改的显式网格与高度场。论文(arXiv 2608.05248)与代码发布后,在 Hacker News 获得 231 分和 72 条讨论。

WorldClaw 生成的春季等距世界全景 图:WorldClaw 生成的春季等距世界全景。来源:tencent-hunyuan.github.io

WorldClaw 意味着 3D 内容生成由「单个资产拾遗」迈入「整世界协作生成」阶段。它采用规划、地形、区域对象到渲染检查的多 Agent 协同链条,解决了全局空间一致性与局部几何细节难以兼得的困境。对于游戏与虚拟世界生产管线而言,这项技术展示了从辅助生成贴图过渡到直接产出可复用场景的可能。

隐式场与工程落地的解耦难题

过去两年间,3D AI 领域大多聚焦于单物体重建或神经辐射场(NeRF)与 3D 高斯泼溅(3DGS)的生成。隐式场在视点合成上具备优异画质,但无法直接导出为传统渲染管线所需的带贴图网格(Textured Mesh)与结构化碰撞体。游戏引擎中的关卡设计师无法对隐式表达中的具体树木进行微移,也难以调整光照与地形高程。

数据层面,单个 3D 模型的生成已在混元 Hunyuan3D-2.x 等前沿模型上取得较高完备度,但场景生成并非简单堆砌资产。当多个 3D 物体组合在同一空间时,标尺错位、地形悬空以及风格脱节等问题极易迅速累积。将场景切割为独立模块并保持空间约束,成为大模型走向场景级生成的关键考验。

Frontier Mosaic 示例世界 isometric layout 图:Frontier Mosaic 示例世界 isometric layout。来源:tencent-hunyuan.github.io

WorldClaw 选择保留传统游戏管线的显式表示,全量输出多通道渲染图(RGB、实例分割、法线图、深度图)与独立 Asset 文件。这种设计牺牲了一部分连续隐式表达的拟真光影,换取了游戏引擎内可拾取、可编辑与可替换的工程灵活性。

共享语义接口控制的三阶段生成

WorldClaw 的核心在于将漫长的大场景生成解耦为三个严格分工的 Agent 阶段。Stage 01 为意图分析与场景规划,意图 Agent 负责精准提取提示词中的显式约束条件,场景规划 Agent 随后补全缺省属性,输出统一的结构化场景规范(Scene Specification)。

这一结构化规范构成了后续所有模块的共享语义接口。全局地形生成 Agent(Stage 02)与区域对象生成 Agent(Stage 03)必须同时读取该规范,从而保证局部生成过程不会越界破坏整体空间组织。这种通过结构化中间层传导约束的设计,降低了多 Agent 协同中的幻觉累积风险。

WorldClaw 完整多 Agent 生成管线架构 图:WorldClaw 完整多 Agent 生成管线架构。来源:tencent-hunyuan.github.io

在 Stage 02 中,系统结合语义布局图、程序化材质与可复用 3D 原型,通过区域感知高度场合成连续的不规则地形。针对接缝处的断层现象,渲染检查循环(Render-and-inspect loop)会在阶段尾声自动纠偏,确保过渡区域的几何自然度。

射线碰撞与网格质量的检查回路

进入 Stage 03 后,区域规划 Agent 会在已经生成的地形表面寻找能承载特定功能需求的平整区域。散布类资产通过 3D 代码(3D coding)程序化构建,而主体建筑与关键道具则由生成式 3D 模型独立生成。每个生成的独立网格均需要经过射线恢复(Raycasting)重新校正落地姿态。

为解决 AI 生成网格常见的悬空与比例失真,精修 Agent(Refinement Agent)会对生成的姿态、网格质量、缩放尺寸及表面接触状态进行多轮校验。系统通过实例分割与深度图回传视角结果,反向修正物理接触参数。

这种显式资产管线使 WorldClaw 能在 Frontier Mosaic、Snowline Village 及 Ember Caldera 等 11 个复杂地貌示例中,同时完成等距布局全景、轨道环绕及地面漫游视图的稳定渲染。工程测算显示,多通道渲染的深度与法线匹配度超过常规多视角扩散模型,极大降低了场景破面概率。

算力延迟与程序化生成管线的现实分歧

尽管 WorldClaw 展示了高完成度的场景生成能力,社区对其工程落地路线依然存在分歧。一部分开发者指出,级联多 Agent 架构叠加多轮渲染检查回路,使生成单个开放世界需要消耗数分钟乃至数十分钟的 GPU 算力。相比之下,基于 Houdini 或 Unreal Engine 程序化生成(PCG)的规则引擎能在数秒内确定性输出数平方公里的地形与植被。

另一方面,支持者认为神经网络 Agent 展现出了传统程序化规则无法比拟的复杂语义理解力。提示词中蕴含的艺术风格、历史氛围与非线性空间要求,很难单纯用数学规则穷举。将生成模型负责的语义灵感与程序化代码控制结合,可以填补前期关卡白模(Greyboxing)搭建的效率空白。

此外,生成资产的材质 UV 分布与碰撞体网格仍需二次优化。在自动化部署到商业渲染管线之前,AI 生成模型产出的高面数网格与轻量化游戏运行时需求之间仍需要额外的烘焙与降面处理。

结论

WorldClaw 的工程突破在于证明了多 Agent 协作能够将 3D 内容生成推向可编辑场景的维度。通过共享语义接口与可视化检查回路,该框架在保证大范围全局一致性的同时,输出了具备工业落地可能性的显式 3D 资产。当 3D 生成从隐式黑盒回归到结构化关卡生成时,生成式 AI 在游戏与虚拟世界搭建中的角色,已经开始向自动化工业管线靠近。

参考链接:

  • Tencent Hunyuan3D 团队项目页
  • arXiv 2608.05248 论文预印本