🔥 Hot topics · Ne peut PAS faire · Peut faire · § The Court · Bascules récentes · 📈 Calendrier · Demander · Éditoriaux · 🔥 Hot topics · Ne peut PAS faire · Peut faire · § The Court · Bascules récentes · 📈 Calendrier · Demander · Éditoriaux
Stuff AI CAN'T Do

L'IA peut-elle éditer des scènes 3D à partir d'instructions textuelles ?

Qu'en penses-tu ?

Cette question demande si les systèmes d'intelligence artificielle peuvent directement remodeler et retexturer une scène 3D à partir d'instructions en texte brut, sans altérer l'édition selon différents angles de vue. Elle examine la faisabilité d'une seule passe feed-forward qui préserve la cohérence spatiale dans l'ensemble de l'environnement.

Background

Dans des travaux récents, Kaixin Zhu et al. (2026) abordent l'édition de scènes 3D natives avec leur méthode VGGT-Edit, qui effectue des modifications de géométrie et d'apparence de manière feed-forward. Au lieu de s'appuyer sur la diffusion multi-vues ou l'optimisation itérative, VGGT-Edit prédit des champs géométriques et d'apparence résiduels pour appliquer directement le changement demandé dans l'espace 3D, visant à maintenir l'intégrité structurelle invariante sous les changements de vue. Les auteurs évaluent leurs résultats sur ScanNet++, OmniScenes et Matterport3D, montrant que la prédiction de champs résiduels surpasse les références précédentes en termes de fidélité d'édition et de cohérence inter-vues. Leur code et ensemble de données open-source sont disponibles à l'adresse https://github.com/zhuKaixhin/VGGT-Edit.


L'édition texte vers 3D par IA a progressé de la manipulation grossière de scènes vers le contrôle multi-objets et multi-attributs, où le langage naturel spécifie des modifications telles que le matériau, la couleur, le placement d'objets ou l'éclairage en un seul passage avant. Les modèles génératifs 3D basés sur la diffusion prennent désormais en charge les modifications locales guidées par le texte en injectant des jetons de texte dans les champs de radiance neuronaux ou les pipelines de Gaussian splatting, permettant des modifications comme « rendre le canapé rouge » tout en maintenant la cohérence géométrique entre les points de vue. Les travaux antérieurs reposaient sur des ajustements par vue qui produisaient souvent des textures ou des ombres incohérentes lorsqu'ils étaient observés sous de nouveaux angles, tandis que les méthodes plus récentes contraignent les modifications avec des représentations 3D canoniques ou des caractéristiques triplane pour préserver la cohérence spatiale. Les évaluations, qui mélangent des scènes intérieures synthétiques et réelles, montrent une amélioration des scores d'alignement basés sur CLIP et une réduction de la dérive géométrique lorsque les modifications sont conditionnées à la fois par le langage et la structure 3D. Les prototypes de recherche démontrent l'édition interactive de scènes guidée par le texte en moins de 10 secondes sur des GPU de milieu de gamme, indiquant des progrès vers des flux de travail en temps réel. Cependant, des défis persistent, notamment dans la résolution des occlusions, la préservation de la géométrie fine et la mise à l'échelle des scènes ouvertes sans réentraînement par scène.

Statut vérifié le July 3, 2026.

📰

Galerie

In the Court of AI Capability
Summary of Findings
Verdict over time
May 2026May 2026May 2026May 2026Jun 2026Jun 2026Jun 2026Jun 2026Jun 2026Jul 2026
Sitting at the Bench Filed · juil. 3, 2026
— The Question Before the Court —

L'IA peut-elle éditer des scènes 3D à partir d'instructions textuelles ?

★ The Court Finds ★
Reaffirmed
Presque

Des démonstrations limitées existent — mais le jury n'était pas unanime.

Ruling of the Bench

Le jury a reconnu que l'édition guidée par texte de scènes 3D n'est plus une pure fantaisie, mais le consensus a hésité sur la mesure dans laquelle la technologie a réellement progressé au-delà de démonstrations fragiles. Bien que les prototypes puissent faire émerger une forme ou une texture à partir d'une phrase, ils butent encore lorsqu'on leur demande de réorganiser, supprimer ou modifier logiquement des scènes complexes, ce qui incite à une approbation prudente penchant du côté du « presque là ». Décision : « L'algorithme dessine l'image, mais bave encore sur la gomme. »

— Hon. B. Liskov-Chen, Presiding
Jury Tally
0Oui
2Presque
0Non
Verdict Confidence
80%
The Court of AI Capability is, of course, not a real court.
But the data is real.
The Case File · Stacked History
Session I · May 2026 Presque · 83%
Session II · May 2026 Presque · 81%
Session III · May 2026 Presque · 83%
Session IV · May 2026 Presque · 77%
Session V · Jun 2026 Presque · 77%
Session VI · Jun 2026 Presque · 73%
Session VII · Jun 2026 Presque · 88%
Session VIII · Jun 2026 Presque · 90%
Session IX · Jun 2026 Presque · 88%
Case № D2D0 · Session X
In the Court of AI Capability

The Case File

Docket № D2D0 · Session X · Vol. X
I. Particulars of the Case
Question put to the courtL'IA peut-elle éditer des scènes 3D à partir d'instructions textuelles ?
SessionX (10 hearing)
Convened3 juil. 2026
Previously ruledALMOST (May '26) → ALMOST (May '26) → ALMOST (May '26) → ALMOST (May '26) → ALMOST (Jun '26) → ALMOST (Jun '26) → ALMOST (Jun '26) → ALMOST (Jun '26) → ALMOST (Jun '26) → ALMOST (Jul '26)
Presiding JudgeHon. B. Liskov-Chen
II. Cumulative Tally Across Sessions

Across 10 sessions, 29 jurors have heard this case. Combined tally: 12 YES · 17 ALMOST · 0 NO · 0 IN RESEARCH.

Note: cumulative includes older juror opinions. The current session tally above is the live verdict.

III. Verdict

By a vote of 0 — 2 — 0, the panel returns a verdict of PRESQUE, with verdict confidence of 80%. The court so orders.

IV. Déclarations du tribunal
Juré I ALMOST

"Text-to-edit systems like LLM+3D diffusion/NeRF editors exist but lack broad reliability"

Juré II ALMOST

"Text-to-3D models and scene editing exist"

Les déclarations individuelles des jurés sont affichées dans leur anglais d'origine afin de préserver la précision probatoire.

B. Liskov-Chen
Presiding Judge
M. Lovelace
Clerk of the Court

Ce que le public pense

Non 22% · Oui 39% · Peut-être 39% 23 votes
Non · 22%
Oui · 39%
Peut-être · 39%
60 days of activity

Discussion

no comments

Les commentaires et les images passent par une révision administrative avant d'apparaître publiquement.

10 jury checks · plus récent il y a 1 jour
03 Jul 2026 2 jurors · indécis, indécis indécis
27 Jun 2026 2 jurors · peut, indécis indécis
22 Jun 2026 2 jurors · indécis, peut indécis
17 Jun 2026 2 jurors · peut, indécis indécis
11 Jun 2026 2 jurors · peut, indécis indécis
06 Jun 2026 3 jurors · indécis, indécis, peut indécis
31 May 2026 3 jurors · peut, indécis, indécis indécis
26 May 2026 5 jurors · indécis, indécis, peut, peut, indécis indécis
20 May 2026 4 jurors · peut, peut, indécis, indécis indécis
15 May 2026 4 jurors · indécis, peut, peut, indécis indécis

Chaque ligne est une vérification du jury distincte. Les jurés sont des modèles d'IA (identités gardées neutres à dessein). Le statut reflète le décompte cumulé sur toutes les vérifications — comment fonctionne le jury.

Plus dans technology

Une que nous avons oubliée ?

Nous faisons une revue hebdomadaire.