← Toutes les publications

GPT-6 Astra s’approche du niveau humain dans la reconstruction de plans d’appartement

A close-up of a colorful Rubik's Cube puzzle, showcasing concentration and play.

D’après les résultats du benchmark Blueprint-Bench 2, le modèle GPT-6 Astra d’OpenAI atteint un score de 0,49, se rapprochant du niveau humain (0,59) dans la tâche de reconstruction de plans d’appartement à partir de photos. Cette performance, annoncée en septembre 2026, marque une progression notable pour l’intelligence artificielle dans le domaine du raisonnement spatial.

Détails techniques et annonce

Le benchmark Blueprint-Bench 2, développé par Andon Labs, consiste à fournir au modèle une série de photos d’intérieur (une vingtaine par logement) sur 50 logements consécutifs. Le modèle doit produire un plan 2D indiquant les pièces, les portes et les tailles relatives. Un bloc-notes persistant lui permet de retenir les informations apprises d’un appartement à l’autre.

Les scores s’échelonnent de 0 (plan aléatoire) à 1 (plan parfait). Les humains, évalués sur 12 appartements, atteignent 0,59. GPT-6 Astra obtient 0,49, surpassant Claude Fable 5.1 d’Anthropic (0,42) et Fable 5 (0,39). Le classement public n’est pas encore mis à jour, mais un graphique partagé par Fabien Mikol sur X indique cette avancée.

Progrès récents et enjeux du raisonnement spatial

En septembre 2025, la première version du benchmark montrait que tous les modèles produisaient du bruit, équivalent à un tirage aléatoire. Sept mois plus tard, la version 2 révèle des progrès : presque tous les modèles devinent correctement le nombre de pièces (environ 90 %), mais échouent sur la connectivité, c’est-à-dire quelles pièces communiquent entre elles. Cette compétence est cruciale pour des applications comme les robots domestiques, les aspirateurs sans lidar ou les lunettes de réalité augmentée.

Particularité notable : Gemini Robotics-ER 1.6, un modèle spécialisé en robotique, obtient des résultats au niveau du hasard, soulignant que la spécialisation seule ne suffit pas sans une compréhension spatiale de base.

Conséquences pour les utilisateurs et perspectives

La progression rapide vers le niveau humain pourrait permettre à terme des assistants capables de comprendre l’agencement d’un lieu à partir de photos, ouvrant des applications pratiques pour la navigation intérieure ou la robotique. Andon Labs mesure une amélioration d’environ 0,04 point par mois sur les modèles de pointe. L’écart entre Astra et l’humain est de 0,10 point, suggérant que le niveau humain pourrait être atteint d’ici la fin de l’année si la tendance se maintient.

Des chercheurs de Google DeepMind travaillent également sur la mesure de ces capacités au-delà de l’AGI, une IA capable d’égaler l’humain sur la plupart des tâches.

Ce qui est confirmé et ce qui reste à vérifier

Le score de GPT-6 Astra (0,49) est confirmé par un graphique partagé, mais les détails exacts et les conditions de test ne sont pas encore visibles sur la page publique du benchmark. Le repère humain repose sur seulement 12 appartements, ce qui laisse une marge d’incertitude. Il n’est pas encore clair si cette performance se maintient sur des tests plus variés ou si elle résulte d’un entraînement ciblé sur des données similaires au benchmark.