Tripo如何为其3D资产管线解决干净拓扑问题
Tripo 首席科学家曹炎培谈 AI 生成 3D 资产:Smart Mesh 5 秒内端到端输出带干净边流、可直接进游戏管线的模型。
中文
复制

从图像生成 3D 模型在过去几年里变得容易了许多,但生成一个资产,和产出一个专业艺术家真正能用、能反复迭代以实现其艺术构想的东西,并不是一回事。AI 生成的模型往往带着混乱的拓扑、难以编辑的材质、不一致的几何结构,以及其他种种问题,让一个看起来惊艳的结果在进入生产管线之前,先变成一大堆清理工作。对 Tripo 来说,弥合生成与可用性之间的这道鸿沟,已经成为公司的核心目标之一。联合创始人兼首席科学家 曹炎培博士是从几何处理、重建和 3D 数字化的背景切入这个问题的。我们与曹炎培博士聊了聊,这项技术如何从简单的模型生成,走向可直接投入生产的资产。

能否先介绍一下你自己,也谈谈这家公司、你的职业经历,以及这一切是如何一步步走到 Tripo 的?
曹炎培博士,Vast(Tripo AI)首席科学家兼联合创始人:我在清华大学读完本科和博士,在清华做的是几何处理、几何理解和重建。毕业后我和人合伙创办了 Owlii,后来公司被快手收购。那时候我们做的是 3D 数字化,比如捕捉和重建动态环境。那段经历教会我如何把一个研究项目变成用户能用的系统。但在这个过程中,我也确信了 3D 创作存在瓶颈:它慢,而且碎片化,只有极少数高度专业的艺术家才做得来。我想改变这一点。后来生成式 AI 出现了,我和几位创始人决定用生成式 AI 做一家公司、做一个平台,降低 3D 创作的门槛,让更多用户、更多开发者生成他们需要的 3D 资产。
如果向一个完全不了解的人介绍 Tripo,你会怎么说?它是给 3D 艺术家用的工具吗?是生成式工具吗?客户是谁?主要功能是什么,或者说你们主要在解决哪些痛点?
曹炎培博士:目前我们把 Tripo 看作一个 AI 原生系统,同时也是一系列 AI 3D 基础模型。我们为游戏行业、3D 打印行业,甚至机器人行业的创作者提供工具和平台——任何需要 3D 资产或 3D 环境的行业或垂直领域,都可以用 Tripo 创建他们需要的内容。我们并不止步于生成资产;我们希望让这些资产有用、并且保持可用,也就是说,从一张提示图像或多张图像生成 3D 资产之后,平台和我们的模型还会完成剩下的工作,比如把 3D 模型拆分成有意义的部件、做贴图、绑定骨骼,甚至做动画。
不少公司都能从一张图片生成 3D 资产。在我看来,最大的痛点之一是:生成出来的不能只是一个网格,它得真正带骨骼、能动画,得有可编辑的材质,还得能加 shader 和其他东西。能不能讲讲你是怎么把创作控制权加进这套流程里的,以及用户可以怎么用它?大部分工具是在你们自己做的软件里,还是能和其他软件打通?Tripo 在整个管线里处于什么位置?
Dr. Yanpei Cao:我举一两个例子吧。目前我们把模型分成两条路线来做。第一条是高保真、高质量的模型,AI 模型输出细节非常丰富的 3D 模型,面数可以到几百万。这是比较传统的路线。但今年我们推出了 Tripo Smart Mesh,背后是我们在 SIGGRAPH 上的研究,叫 Nexus。借助 Smart Mesh 或 Nexus,我们为美术师创造了一种新的范式:从单张图片生成可用的、能直接进游戏的资产。也就是说,出来的不是一团乱糟糟的多边形汤,而是有干净边流的模型。这样动画做起来更容易,面数预算也好控制,模型跑得很快。Tripo Smart Mesh 端到端输出游戏可用资产,5 秒以内。这大大改变了流程:游戏开发者现在可以给模型发 20 条甚至 50 条 prompt 或方向,等上几秒,收结果,再决定往哪个方向走。迭代速度提上来是件大事。而且结果带有可用的拓扑和桥接,能直接送进 Blender、Maya 或 Unity 这类软件。这样一来,我们不是在让美术师围着工具转,而是为美术师做工具,尽量把清理工作砍掉:我们做初步建模,艺术方向交给美术师定。

有人用 Tripo 的时候,输入是什么?只能给一段文字提示,还是也能加参考图?能放自己的概念设定图吗?
曹炎培博士:我们希望整个流程尽可能可控。你可以用文字、一张参考图,甚至多张图,比如一整张包含多个参考的角色设定表,或者角色的几个局部特写角度。我们还在开发更多控制方式,比如包围盒控制、宽高比控制,甚至 3D 到 3D——如果你有一个旧资产想重制,也可以直接拿来用。
我觉得 AI 生成资产最大的挑战之一,尤其是 3D,是材质和几何体的大量细节都失去了清晰度,很多地方糊成一团。你们是怎么解决这个问题的?你们展示的材质总是很锐利、水准很高,所以我想问:这些是开箱即得的结果吗?还是你们额外做了处理、清理过?你们怎么保证几何体足够锐利?
曹炎培博士:两条路我们都在走。首先是纯自动的方式,我们推动模型从底层构建自研技术。现在 AI 模型可以把极高分辨率的几何体压缩成一个紧凑资产,大约 2000×2000×2000 体素,再压缩到潜空间状态,用来生成高分辨率几何体。我们也围绕艺术家在造工具,让他们能配合 AI 模型一起迭代输出,比如我们开发的 Magic Brush,用户可以在 AI 模型与艺术意图的协作下快速调整几何体和纹理材质的细节。

你过去在 Gaussian Splatting 上做了很多工作。现在生成内容的时候,会用到这些背景和研究吗?你们现在用 Tripo 生成角色和道具,那更复杂的整个环境、完整场景呢?你怎么看这件事,生成这类内容的问题在哪?
曹炎培博士:NeRF 和 Gaussian Splat 这些研究上的进展帮了我们很多,这个过程中我们也一直在开发让模型直接输出 3D Gaussian Splat 作为最终格式的能力,因为它更轻、更容易渲染。即便是实体物件,我们也在和一些制造实验室合作,把 3D Gaussian Splat 打印出来——你可以把 Gaussian Splat 打印出来。这太疯狂了!颜色和几何体可以同时看到。这是我们正在开发的一件事,更重要的是我们把很多进展都开源了,比如 TripoSplat,我们以 MIT 许可证开源,并且尽可能做轻,所以一发布就得到了 Comfy 的 day zero 支持,很多用户已经在用 TripoSplat 这个开源项目,把自己的资产做成 3D Gaussian。另一件事当然是我们正在构建的环境。我觉得有两点:第一,我们在和 World Labs 这类公司合作,通过黑客松和其他活动,让用户看到如何把多边形网格与 Gaussian Splat 结合起来——也就是 World Labs 的 Marble 在做的东西——整合成协调统一的体验。另外,我们也在迭代自己的世界模型,扩展构建环境的能力。我们正在和一些机器人公司、仿真公司合作,扩展输出可直接用于仿真的资产和环境的能力,让机器人能在我们生成的场景里直接操作物体,比如放下东西、拿起东西。

目前 AI 在研发方面面临的最大挑战是什么?是几何、材质、定义,还是成本?最大的挑战有哪些,你如何看待未来的发展?直到最近我们才开始看到从提示词到 2D 再到 3D 的流程,你得到的很多输出看起来非常不错,但当然在可控性、幻觉等方面还存在问题。
曹炎培博士:我认为对我们来说,一个挑战仍然是生成资产是否好用,或者说是否达到生产就绪的程度。我们把几何和拓扑,或者说线框,看作两件不同的事。几何更偏向连续,而拓扑,或者说线框,更偏向离散,比如什么和什么相连。拓扑或线框是目前大多数美术师关注的东西。大多数情况下,借助 Tripo Smart Mesh,我们已经向前迈出了一大步,但我们正在投入更多研发资源朝这个方向迭代。我们希望模型能够输出,或者说理解,美术师背后的拓扑思维。这是我们正在努力构建的一件事。在模型层面,我们确实需要加入更多控制,让用户能够输入任意视角的参考图像,我们也在尝试弄清楚如何把创作过程中的智能体环节整合进来。目前我们的 API 在功能上作为端点还比较零散。但我们正在构建智能体流程,让用户输入最终的艺术方向,然后让智能体尽可能多地动态、即时地用 AI 创建工作流,这样美术师就能更专注于艺术方向,而不是繁重的体力活或杂务。

你谈到了输出。生成一个完整、可用的资产需要多长时间?比如说,如果你坐下来开始工作,写了一个提示词,又有一些参考图像,那么生成一个能用在游戏里的角色需要多长时间?就是一个完整的三维角色?
曹炎培博士:我们有两类模型。我们有高清系列,也就是 H 系列。对于这个系列,从你输入提示词到一个完全贴图完成的角色,时间成本可能仍然不到一分钟,而且这是高模。对于 Smart Mesh,速度更快。你可以在 10 秒内得到最终输出。它是一个角色,细节没那么丰富,但多边形可控、边流可用,10 秒以内。大概会在 2 万个多边形左右。你们怎么收费?是授权模式吗?还是 token 模式?
曹炎培博士:是 token 模式。你花一些 token 来获取资产。

最后一个问题:未来几年,你对这个行业有什么期待?比如 NVIDIA 在做什么,或者其他这些公司在做什么?你最兴奋的是什么?
曹炎培博士:未来的挑战主要有几点。首先,整个行业如何从单资产生成走向环境、走向交互与动态。这需要两件事:第一,高质量的资产生成;第二,我们需要把代码或逻辑整合进来,去构建整个环境的结构,或者让交互具备更多逻辑;第三则是世界模型。我们需要一个模型来预测接下来几分钟内会发生什么。这三件事加在一起,就是我们希望整个行业发展的方向。做到这些,我认为创作流程就能被彻底改变。更进一步,艺术家可以真正专注于创作方向,而不是把时间花在制作资产、写代码和脚本逻辑上。

曹炎培博士,VAST(Tripo)联合创始人兼首席科学家
采访:Kirill Tokarev
Physical Fog Addon | Photorealistic Volumetric System
几分钟内创建电影级体积雾。自动域、分层预设、动态物理体积交互与写实散射。