Un vrai journal de recherche, en cours
Regarder un agent JEPA apprendre à jouer à Minecraft — et comprendre comment ça marche, chapitre par chapitre
Mine-JEPA est une petite architecture JEPA (Joint-Embedding Predictive Architecture) entraînée directement sur des images de jeu, construite pour planifier ses propres actions plutôt que de réagir à l'aveugle. Ce site raconte comment il a été construit, dans l'ordre où c'est vraiment arrivé — y compris les parties qui n'ont pas fonctionné. Chaque chapitre est écrit deux fois : une fois pour un curieux qui découvre le sujet, une fois pour quelqu'un qui connaît déjà le machine learning. Choisissez une piste, changez à tout moment.
Commencer le parcours
MineRLTreechop-v0 : l'agent, guidé par son modèle
du monde JEPA, planifie son approche jusqu'à un arbre et l'abat pour obtenir une bûche.
C'est le meilleur épisode enregistré parmi ceux évalués — le taux de réussite réel de
cette politique se situe plutôt entre une fois sur quatre et une fois sur deux, pas à
chaque tentative.
L'arbre de progression
Les chapitres suivent le projet dans l'ordre où il s'est réellement déroulé : chacun s'appuie sur les idées et les résultats du précédent — comme une recette de craft, où chaque case ne se débloque qu'une fois ses ingrédients réunis.
-
Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ?
Aucun prérequis — c'est le point de départ du parcours.
-
Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche)
Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? »
-
Apprendre au modèle à imaginer la suite
Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? » et Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) »
-
Essayer 512 avenirs dans sa tête avant d'appuyer sur un bouton
Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? », Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) » et Chapitre 3, « Apprendre au modèle à imaginer la suite »
-
Le grand saut vers le vrai Minecraft : quatre échecs, puis un agent qui coupe des arbres
Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? », Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) », Chapitre 3, « Apprendre au modèle à imaginer la suite » et Chapitre 4, « Essayer 512 avenirs dans sa tête avant d'appuyer sur un bouton »
-
Apprendre à fabriquer : la règle est comprise, le premier arbre reste hors de portée
Prérequis : Chapitres 1 à 5 — l'encodeur, les garde-fous anti-collapse, le world model, le planificateur, et le premier succès en vrai Minecraft.
-
La curiosité en panne, puis deux rustines qui marchent à moitié
Prérequis : Chapitres 1 à 6 — jusqu'au mur du premier arbre trouvé en solo, que ce chapitre attaque pour la première fois.
-
Le mur est comportemental : une vraie première réussite, puis quatre preuves qu'affiner le signal ne suffit pas — et une cinquième qui confirme le diagnostic
Prérequis : Chapitres 1 à 7 — y compris les deux premières tentatives, échouées, de trouver seul le premier arbre.
-
Après les pistes A et C : la politique apprise a été promue, puis testée (suite au Chapitre 10)
Prérequis : Chapitres 1 à 8 — dont l'attempt #8 (pistes A et C, testées et NO-GO, voir Chapitre 8). Ce chapitre récapitule l'état des trois pistes qu'il avait promues (la politique apprise, deux affinements) — toutes désormais construites et testées ; le Chapitre 10 en donne le récit complet.
-
La piste apprise a été testée : elle non plus ne suffit pas — mais elle élimine deux explications
Prérequis : Chapitres 1 à 9 — dont la politique apprise par clonage comportemental (Proposition B), promue priorité 1 au Chapitre 9. Construite, passe un gate anti-collapse discriminant, testée en direct : 0/8, mais le résultat négatif le plus net de la campagne, qui élimine deux explications concrètes et pointe vers une nouvelle hypothèse.
-
La campagne fait une pause : la boussole ne s'est pas éteinte, elle pointe à l'envers
Prérequis : Chapitres 1 à 10 — dont l'hypothèse posée par élimination au Chapitre 10 (le jugement du monde imaginé, pas la génération de gestes). Ce chapitre la teste directement, hors-ligne, et la confirme : la notation goal-centroid de
ebwm.ptne s'éteint pas hors de son terrain d'entraînement, elle s'inverse. La campagne cold-start fait une pause sur ce diagnostic, avec un menu de quatre pistes candidates, aucune encore lancée. -
Deux pistes du menu passées à l'épreuve : la réparation de la boussole échoue une troisième fois, la mémoire des lieux visités produit le deuxième vrai succès de la campagne
Prérequis : Chapitres 1 à 11 — dont les deux premières pistes du menu ouvert au Chapitre 11 (réparer la boussole, une mémoire des lieux visités), ici testées pour de vrai. La réparation de la boussole échoue une troisième fois (le raccourci de luminosité vit dans l'encodeur figé) ; la mémoire des lieux visités produit le deuxième résultat non nul de toute la campagne cold-start, sans pathologie comportementale.
-
L'alarme à noyade fonctionne parfaitement ; le geste de sauvetage, lui, ne sait pas où est la terre ferme
Prérequis : Chapitres 1 à 12 — dont la mémoire des lieux visités (attempt #12), dont la relecture des journaux révèle ici que 12 des 20 épisodes de son propre lot de confirmation se sont en fait terminés par une noyade. Le détecteur de noyade par pixels construit en réponse est précis et bien calibré ; le geste de secours câblé ne sait pas où se trouve la terre ferme — même leçon que l'attempt #5 du Chapitre 8, sur un mécanisme entièrement différent.
-
Un géant du web à l'épreuve : CLIP repère bien la forêt, mais lui aussi confond ça avec la luminosité
Prérequis : Chapitres 1 à 13 — dont l'inversion de boussole (Chapitre 11) et le raccourci de luminosité confirmé trois fois (Chapitre 12), qu'un test hors-ligne de CLIP (un modèle de vision-langage pré-entraîné, jamais touché à ce projet) vient tester avant d'engager la piste H-JEPA la plus coûteuse. CLIP repère bien la direction arbre/pas-d'arbre, mais reste lui aussi très lié à la luminosité — un résultat mixte, avec une question ouverte (une frame de grotte sombre) plutôt qu'une conclusion tranchée.
-
Cinquième confirmation pour le raccourci de luminosité, une fausse alerte qui n'en était pas une, et une énigme à 144 qui reste sans réponse
Prérequis : Chapitres 1 à 14 — dont la piste H-JEPA justifiée au Chapitre 14. Un test de ratios de couleur par tuile spatiale ferme la piste de correction photométrique pour de bon (5ᵉ confirmation indépendante) ; séparément, un lot de 20 parties confirme que le sauvetage anti-noyade du Chapitre 13 tient à grande échelle (noyade 60%→15%) sans faire remonter le taux de coupe, une fausse alerte de processus est corrigée, et une récompense isolée de 144 reste un mystère documenté, sans effet sur les conclusions.
-
Le modèle le plus proche de H-JEPA jusqu'ici prédit l'avenir, pas l'image — et perd quand même contre la simple moyenne
Prérequis : Chapitres 1 à 15 — dont la piste visuelle désormais fermée pour de bon (Chapitre 15). Le Coverage-Value Predictor prédit le gain d'exploration à partir d'indices de mouvement et de visitation, sans jamais regarder la couleur — un vrai bug de départage d'égalités est corrigé en chemin, et le test d'indépendance à la luminosité passe deux fois — mais le modèle entraîné perd contre la simple moyenne en validation croisée rigoureuse. NO-GO honnête, d'une nature différente des échecs de luminosité : un problème de quantité de données, pas un raccourci trompeur.
-
Même un détecteur qui ne peut rien apprendre retombe sur le même raccourci : le problème est dans l'œil, pas dans l'apprentissage
Prérequis : Chapitres 1 à 16 — dont la boussole confirmée inversée au Chapitre 11, jamais réparée directement depuis. Deux attaques bon marché et directes sur ce mécanisme (un détecteur hors-distribution sans aucun paramètre entraîné, une vérification de diversité des données d'entraînement) échouent toutes les deux — mais la première, une simple formule statistique fixe sans possibilité d'apprendre un raccourci, retombe quand même dans la même confusion de luminosité : 6ᵉ confirmation indépendante, et la plus structurellement décisive à ce jour.
-
La première victoire de la campagne n'a pas survécu à un échantillon plus grand — et c'est elle-même qui s'en est aperçue
Prérequis : Chapitres 1 à 17 — dont les six confirmations du raccourci de luminosité accumulées jusqu'au Chapitre 17. Un test de généralisation par pseudo-profondeur (MiDaS) semble d'abord réussir les deux gates de la campagne pour la toute première fois — puis échoue le jour même une fois l'échantillon annoté élargi de 10 à 27 images, une correction que l'équipe s'inflige à elle-même avant de publier le résultat. Séparément, un écart réel et non photométrique de couverture d'actions Treechop/Obtain est découvert (104x le bruit d'échantillonnage) — un facteur candidat, pas encore une cause confirmée.
-
Le premier vrai réentraînement du cœur du modèle : deux leviers, deux échecs bien compris, une pause choisie
Prérequis : Chapitres 1 à 18 — dont les deux leviers scopés au Chapitre 18 (couverture d'actions, SIGReg). Premier réentraînement direct du cœur d'
ebwm.pten dix-neuf tentatives : les deux leviers échouent, chacun pour une cause identifiée plutôt que devinée — dont un effondrement dimensionnel inédit, invisible à l'ancien outil de surveillance, attrapé par un nouveau garde-fou de rang effectif. L'utilisateur choisit une pause et une consolidation plutôt qu'un troisième levier. -
Ne rien faire prédisait mieux : vingt tentatives à réparer le pilote, quand le problème était le moteur
Prérequis : Chapitres 1 à 19 — le chapitre de clôture de la campagne et sa mesure la plus importante. Personne n'avait vérifié si le modèle du monde réagissait aux actions de l'agent. Il réagit — mais le conditionnement par les vraies actions prédit le futur mesurablement moins bien que de supposer que l'agent n'a rien fait, sur le domaine d'entraînement lui-même.
Le parcours s'arrête honnêtement là où la rédaction s'arrête aujourd'hui : aucune case suivante n'a été ajoutée par avance.
Pourquoi ça ressemble à un carnet de labo, pas à un showreel
Mine-JEPA est un projet réel, toujours en cours, et ce site est écrit directement à partir de son journal de recherche — y compris les tentatives qui ont échoué, les résultats seulement partiellement concluants, et les problèmes que personne n'a encore résolus. Si un chapitre rapporte un résultat négatif, il reste un résultat négatif ici : pas d'enthousiasme forcé, pas de confettis. La version honnête de cette histoire est aussi la plus intéressante.