Tripoが3Dアセットパイプラインのクリーンなトポロジー問題を解決する方法

日本語
コピー
展会现场照片:三位戴着会议胸牌的观众围看一台显示器,屏幕上是 Tripo 网页应用正在生成的 3D 角色(红发、戴绿色高礼帽)与资产缩略图列表,背景是黄色展墙,右下角标着 TRIPO 与 SIGGRAPH 2026 洛杉矶

画像から 3D モデルを生成するのは、この数年でずいぶん簡単になった。だが、アセットを 1 つ生成することと、プロのアーティストが実際に使え、自分の芸術的構想を実現するために何度も反復できるものを生み出すことは、別の話だ。AI が生成するモデルは、乱れたトポロジー、編集しにくいマテリアル、不揃いなジオメトリといった問題を抱えていることが多く、見た目は見事でも、制作パイプラインに入れる前に大量の後始末を強いられる。Tripo にとって、生成と実用性の間にあるこの溝を埋めることが、会社の中心的な目標の一つになっている。共同創業者兼チーフサイエンティストの曹炎培博士は、ジオメトリ処理、再構築、3D デジタル化のバックグラウンドからこの問題に取り組んできた。曹炎培博士に、この技術が単純なモデル生成から、そのまま制作に投入できるアセットへとどう進んでいくのかを聞いた。

まず自己紹介と、この会社について、あなたの経歴、そしてどうやって Tripo にたどり着いたのかを聞かせてください。

曹炎培博士、Vast(Tripo AI)チーフサイエンティスト兼共同創業者:清華大学で学部と博士課程を終え、在学中はジオメトリ処理、ジオメトリ理解、再構築をやっていました。卒業後、Owlii を共同創業し、後にその会社は快手に買収されました。当時やっていたのは 3D デジタル化で、たとえば動的な環境のキャプチャと再構築です。あの経験から、研究プロジェクトをユーザーが使えるシステムに変える方法を学びました。ただ、その過程で 3D 制作にはボトルネックがあることも確信しました。遅く、断片化していて、ごく一部の高度に専門化したアーティストしか扱えない。これを変えたいと思いました。そこに生成 AI が登場し、創業者数人で生成 AI を使った会社とプラットフォームを作り、3D 制作の敷居を下げて、より多くのユーザーや開発者が自分に必要な 3D アセットを生成できるようにしようと決めました。

Tripo をまったく知らない人に紹介するなら、どう説明しますか?3D アーティスト向けのツールですか?生成ツールですか?顧客は誰で、主な機能は何か、あるいは主にどんな課題を解決しているのですか?

曹炎培博士:今のところ、私たちは Tripo を AI ネイティブなシステムであり、同時に一連の AI 3D 基盤モデルだと考えています。ゲーム業界、3D プリンティング業界、さらにはロボティクス業界のクリエイターにツールとプラットフォームを提供しています。3D アセットや 3D 環境を必要とする業界や垂直領域ならどこでも、Tripo で必要なコンテンツを作れます。私たちはアセットを生成して終わりではありません。そのアセットを有用に、かつ使い続けられる状態にしたいのです。つまり、1 枚のプロンプト画像や複数枚の画像から 3D アセットを生成した後も、プラットフォームと私たちのモデルが残りの作業を引き受けます。たとえば 3D モデルを意味のある部品に分割したり、テクスチャを貼ったり、リギングしたり、さらにはアニメーションまで行います。

1 枚の画像から 3D アセットを生成できる会社は少なくありません。私が見る限り、最大の課題の一つは、生成物が単なるメッシュでは済まないことです。ちゃんとボーンが入ってアニメーションでき、編集可能なマテリアルがあり、shader やその他もろもろを足せる必要がある。この制作上のコントロールをどうやってワークフローに組み込んでいるのか、ユーザーはどう使えるのかを聞かせてください。ツールの多くは自社製ソフトウェアの中で完結しますか、それとも他のソフトウェアと連携できますか?Tripo はパイプライン全体のどこに位置しますか?

Dr. Yanpei Cao:例を 1、2 つ挙げましょう。現在、モデルは 2 つの路線に分けて作っています。1 つ目は高忠実・高品質なモデルで、AI モデルが非常に細部まで作り込んだ 3D モデルを出力し、ポリゴン数は数百万に達することもあります。これは比較的従来型の路線です。ただ、今年私たちは Tripo Smart Mesh を発表しました。背後にあるのは SIGGRAPH での研究で、Nexus というものです。Smart Mesh、あるいは Nexus によって、アーティストに新しいパラダイムを提供しています。1 枚の画像から、そのままゲームに入れられる実用的なアセットを生成するというものです。つまり、出てくるのはごちゃごちゃしたポリゴンの塊ではなく、きれいなエッジフローのあるモデルです。これならアニメーションも付けやすく、ポリゴン数の予算も管理しやすく、モデルも軽快に動きます。Tripo Smart Mesh はゲームで使えるアセットをエンドツーエンドで 5 秒以内に出力します。これはワークフローを大きく変えます。ゲーム開発者は今や、モデルに対して 20 本、場合によっては 50 本の prompt や方向性を投げ、数秒待って結果を受け取り、どの方向に進むかを決められます。反復速度が上がるのは大きなことです。しかも結果には使えるトポロジーとブリッジが付いていて、Blender、Maya、Unity といったソフトウェアにそのまま送り込めます。こうして私たちは、アーティストをツールに合わせるのではなく、アーティストのためにツールを作る方向に進み、後始末をできるだけ削っています。下地のモデリングは私たちがやり、アートの方向性はアーティストが決める、という形です。

Tripo を使うとき、入力は何ですか?テキストプロンプトだけなのか、参考画像も足せるのか?自分のコンセプトアートを入れられますか?

曹炎培博士:フロー全体をできるだけ制御可能にしたいと考えています。テキスト、参考画像 1 枚、あるいは複数枚の画像も使えます。たとえば複数の参考を並べたキャラクター設定表や、キャラクターの局部をいくつかの角度から捉えたカットなどです。さらに制御方法も開発中で、バウンディングボックスによる制御、アスペクト比の制御、さらには 3D から 3D へ、古いアセットを作り直したいときにそのまま使う、といったことも可能にしていきます。

AI 生成アセットの最大の難しさの一つは、特に 3D で、マテリアルとジオメトリの細部の精細さが失われ、多くの箇所がぼやけてしまうことだと思います。これはどう解決していますか?あなた方が見せているマテリアルはいつもシャープで水準が高いので、聞きたいのですが、これはそのまま出てくる結果なのか、それとも追加の処理やクリーンアップをしているのか?ジオメトリを十分にシャープに保つにはどうしているのですか?

曹炎培博士:私たちは二つの道を同時に進めています。一つは完全自動のアプローチで、モデルが基盤から自社技術を構築できるよう後押ししています。現在の AI モデルは、非常に高解像度のジオメトリを約 2000×2000×2000 ボクセルというコンパクトなアセットに圧縮し、さらに潜在空間の状態へと圧縮して、高解像度ジオメトリの生成に使えます。もう一つはアーティスト向けのツール開発で、AI モデルと一緒に反復しながら出力を磨けるようにしています。たとえば私たちが開発した Magic Brush では、AI モデルとアーティストの意図が協調しながら、ジオメトリやテクスチャマテリアルの細部を素早く調整できます。

あなたはこれまで Gaussian Splatting に多く取り組んできました。今コンテンツを生成するとき、そうした背景や研究は活かされていますか?現在 Tripo でキャラクターやプロップを生成していますが、より複雑な環境全体、完全なシーンはどうですか?このことについてどう考えていますか、こうしたコンテンツを生成する際の問題はどこにありますか?

曹炎培博士:NeRF や Gaussian Splat といった研究の進展には大きく助けられてきました。その過程で、モデルが最終フォーマットとして 3D Gaussian Splat を直接出力する能力の開発も続けています。より軽く、レンダリングしやすいからです。実体のある物体であっても、いくつかの製造ラボと協力して 3D Gaussian Splat を印刷しています——Gaussian Splat は印刷できるんです。これは本当にクレイジーです!色とジオメトリを同時に見ることができます。これは私たちが開発を進めていることの一つですが、さらに重要なのは、多くの進展をオープンソース化していることです。たとえば TripoSplat は MIT ライセンスでオープンソース化し、可能な限り軽量にしたので、公開と同時に Comfy の day zero サポートを得て、多くのユーザーがすでにこのオープンソースプロジェクト TripoSplat を使って自分のアセットを 3D Gaussian にしています。もう一つはもちろん、私たちが構築している環境です。ポイントは二つあると思います。第一に、World Labs のような企業と協力し、ハッカソンやその他のイベントを通じて、ポリゴンメッシュと Gaussian Splat をどう組み合わせるかをユーザーに見せています——つまり World Labs の Marble がやっていることですが——それを調和のとれた統一的な体験に統合します。また、私たち自身のワールドモデルも反復させ、環境を構築する能力を拡張しています。いくつかのロボティクス企業やシミュレーション企業と協力し、シミュレーションにそのまま使えるアセットや環境を出力する能力を拡張して、ロボットが私たちの生成したシーンで直接物体を操作できるようにしています。たとえば物を置く、物を持ち上げる、といったことです。

現在、AI が研究開発の面で直面している最大の課題は何ですか?ジオメトリ、マテリアル、定義、それともコストですか?最大の課題は何で、今後の発展をどう見ていますか?つい最近になって、私たちはプロンプトから 2D、そして 3D への流れを見始めたところです。得られる出力の多くは非常によく見えますが、もちろん制御性やハルシネーションなどの面ではまだ問題があります。

曹炎培博士:私たちにとって一つの課題は、生成されたアセットが使いやすいか、あるいはプロダクションレディのレベルに達しているか、だと思います。私たちはジオメトリとトポロジー、つまりワイヤーフレームを二つの別物として捉えています。ジオメトリはどちらかといえば連続的で、トポロジー、つまりワイヤーフレームはどちらかといえば離散的です。何と何がつながっているか、といったことです。トポロジーやワイヤーフレームは、現在ほとんどのアーティストが気にしているものです。ほとんどの場合、Tripo Smart Mesh によって私たちは大きく前進しましたが、この方向により多くの研究開発リソースを投じて反復を続けています。モデルが、アーティストの頭の中にあるトポロジーの考え方を出力できる、あるいは理解できるようにしたいのです。これは私たちが構築に取り組んでいることの一つです。モデルのレベルでは、ユーザーが任意の視点の参照画像を入力できるよう、より多くの制御を加える必要がありますし、制作プロセスにおけるエージェントの部分をどう統合するかも模索しています。現在の私たちの API は、機能としてはエンドポイントとしてまだ断片的です。しかし私たちはエージェントのワークフローを構築していて、ユーザーが最終的なアートディレクションを入力すれば、エージェントができる限り動的に、その場で AI を使ってワークフローを作り出します。そうすればアーティストは、重い肉体労働や雑務ではなく、アートディレクションにより集中できます。

出力について話しましたね。完全で使えるアセットを生成するのにどれくらいかかりますか?たとえば、座って作業を始め、プロンプトを書いて、参照画像もいくつかあるとして、ゲームで使えるキャラクターを生成するのにどれくらいかかりますか?完全な 3D キャラクターです。

曹炎培博士:私たちには二種類のモデルがあります。ハイデフシリーズ、つまり H シリーズです。このシリーズでは、プロンプトを入力してから完全にテクスチャリングされたキャラクターまで、所要時間はおそらく 1 分未満で、しかもハイポリです。Smart Mesh ならもっと速いです。10 秒以内に最終出力が得られます。キャラクターではありますが、ディテールはそれほど豊かではなく、ポリゴンは制御可能でエッジフローも使えます。10 秒以内です。ポリゴン数は 2 万前後になるでしょう。料金体系はどうなっていますか?ライセンスモデルですか?それともトークンモデルですか?

曹炎培博士:トークンモデルです。アセットを取得するのにトークンを消費します。

最後の質問です。今後数年で、この業界に何を期待しますか?たとえば NVIDIA がやっていること、あるいは他のこうした企業がやっていることなどです。最も興奮していることは何ですか?

曹炎培博士:今後の課題は主にいくつかあります。まず、業界全体が単一アセットの生成から、環境へ、そしてインタラクションと動きへとどう進むかです。これには二つのことが必要です。第一に高品質なアセット生成、第二にコードやロジックを統合して環境全体の構造を構築する、あるいはインタラクションにより多くのロジックを持たせること。そして第三にワールドモデルです。今後数分で何が起こるかを予測するモデルが必要です。この三つが揃えば、それが私たちが業界全体に望む方向です。これが実現すれば、制作の流れは根本から変えられると思います。さらに進めば、アーティストはアセットの制作やコード、スクリプトロジックの記述に時間を費やすのではなく、本当に創作の方向性に集中できるようになります。

曹炎培博士、VAST(Tripo)共同創業者兼チーフサイエンティスト

インタビュー:Kirill Tokarev

Physical Fog Addon | Photorealistic Volumetric System

数分でシネマティックなボリュメトリックフォグを作成。自動ドメイン、レイヤードプリセット、動的な物理ボリューム相互作用、リアルな散乱を実現。

出典: 80 Level← ホームへ戻る