Un vrai journal de recherche, en cours

Regarder un agent JEPA apprendre à jouer à Minecraft — et comprendre comment ça marche, chapitre par chapitre

Mine-JEPA est une petite architecture JEPA (Joint-Embedding Predictive Architecture) entraînée directement sur des images de jeu, construite pour planifier ses propres actions plutôt que de réagir à l'aveugle. Ce site raconte comment il a été construit, dans l'ordre où c'est vraiment arrivé — y compris les parties qui n'ont pas fonctionné. Chaque chapitre est écrit deux fois : une fois pour un curieux qui découvre le sujet, une fois pour quelqu'un qui connaît déjà le machine learning. Choisissez une piste, changez à tout moment.

Commencer le parcours
Vue à la première personne dans Minecraft : l'agent traverse une forêt dense, s'approche d'un tronc d'arbre et frappe avec son outil jusqu'à faire tomber l'arbre pour obtenir une bûche.
Vraies images issues de MineRLTreechop-v0 : l'agent, guidé par son modèle du monde JEPA, planifie son approche jusqu'à un arbre et l'abat pour obtenir une bûche. C'est le meilleur épisode enregistré parmi ceux évalués — le taux de réussite réel de cette politique se situe plutôt entre une fois sur quatre et une fois sur deux, pas à chaque tentative.

L'arbre de progression

Les chapitres suivent le projet dans l'ordre où il s'est réellement déroulé : chacun s'appuie sur les idées et les résultats du précédent — comme une recette de craft, où chaque case ne se débloque qu'une fois ses ingrédients réunis.

  1. Chapitre 1

    Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ?

    Aucun prérequis — c'est le point de départ du parcours.

  2. Chapitre 2

    Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche)

    Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? »

  3. Chapitre 3

    Apprendre au modèle à imaginer la suite

    Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? » et Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) »

  4. Chapitre 4

    Essayer 512 avenirs dans sa tête avant d'appuyer sur un bouton

    Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? », Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) » et Chapitre 3, « Apprendre au modèle à imaginer la suite »

  5. Chapitre 5

    Le grand saut vers le vrai Minecraft : quatre échecs, puis un agent qui coupe des arbres

    Prérequis : Chapitre 1, « Qu'est-ce que JEPA, et pourquoi apprendre à un programme à jouer à Minecraft avec ça ? », Chapitre 2, « Le raccourci que le modèle essaie toujours de trouver (et comment on l'en empêche) », Chapitre 3, « Apprendre au modèle à imaginer la suite » et Chapitre 4, « Essayer 512 avenirs dans sa tête avant d'appuyer sur un bouton »

  6. Chapitre 6

    Apprendre à fabriquer : la règle est comprise, le premier arbre reste hors de portée

    Prérequis : Chapitres 1 à 5 — l'encodeur, les garde-fous anti-collapse, le world model, le planificateur, et le premier succès en vrai Minecraft.

  7. Chapitre 7

    La curiosité en panne, puis deux rustines qui marchent à moitié

    Prérequis : Chapitres 1 à 6 — jusqu'au mur du premier arbre trouvé en solo, que ce chapitre attaque pour la première fois.

  8. Chapitre 8

    Le mur est comportemental : une vraie première réussite, puis quatre preuves qu'affiner le signal ne suffit pas — et une cinquième qui confirme le diagnostic

    Prérequis : Chapitres 1 à 7 — y compris les deux premières tentatives, échouées, de trouver seul le premier arbre.

  9. Chapitre 9

    Après les pistes A et C : la politique apprise a été promue, puis testée (suite au Chapitre 10)

    Prérequis : Chapitres 1 à 8 — dont l'attempt #8 (pistes A et C, testées et NO-GO, voir Chapitre 8). Ce chapitre récapitule l'état des trois pistes qu'il avait promues (la politique apprise, deux affinements) — toutes désormais construites et testées ; le Chapitre 10 en donne le récit complet.

  10. Chapitre 10

    La piste apprise a été testée : elle non plus ne suffit pas — mais elle élimine deux explications

    Prérequis : Chapitres 1 à 9 — dont la politique apprise par clonage comportemental (Proposition B), promue priorité 1 au Chapitre 9. Construite, passe un gate anti-collapse discriminant, testée en direct : 0/8, mais le résultat négatif le plus net de la campagne, qui élimine deux explications concrètes et pointe vers une nouvelle hypothèse.

  11. Chapitre 11

    La campagne fait une pause : la boussole ne s'est pas éteinte, elle pointe à l'envers

    Prérequis : Chapitres 1 à 10 — dont l'hypothèse posée par élimination au Chapitre 10 (le jugement du monde imaginé, pas la génération de gestes). Ce chapitre la teste directement, hors-ligne, et la confirme : la notation goal-centroid de ebwm.pt ne s'éteint pas hors de son terrain d'entraînement, elle s'inverse. La campagne cold-start fait une pause sur ce diagnostic, avec un menu de quatre pistes candidates, aucune encore lancée.

  12. Chapitre 12

    Deux pistes du menu passées à l'épreuve : la réparation de la boussole échoue une troisième fois, la mémoire des lieux visités produit le deuxième vrai succès de la campagne

    Prérequis : Chapitres 1 à 11 — dont les deux premières pistes du menu ouvert au Chapitre 11 (réparer la boussole, une mémoire des lieux visités), ici testées pour de vrai. La réparation de la boussole échoue une troisième fois (le raccourci de luminosité vit dans l'encodeur figé) ; la mémoire des lieux visités produit le deuxième résultat non nul de toute la campagne cold-start, sans pathologie comportementale.

  13. Chapitre 13 NO-GO

    L'alarme à noyade fonctionne parfaitement ; le geste de sauvetage, lui, ne sait pas où est la terre ferme

    Prérequis : Chapitres 1 à 12 — dont la mémoire des lieux visités (attempt #12), dont la relecture des journaux révèle ici que 12 des 20 épisodes de son propre lot de confirmation se sont en fait terminés par une noyade. Le détecteur de noyade par pixels construit en réponse est précis et bien calibré ; le geste de secours câblé ne sait pas où se trouve la terre ferme — même leçon que l'attempt #5 du Chapitre 8, sur un mécanisme entièrement différent.

  14. Chapitre 14 Résultat mixte

    Un géant du web à l'épreuve : CLIP repère bien la forêt, mais lui aussi confond ça avec la luminosité

    Prérequis : Chapitres 1 à 13 — dont l'inversion de boussole (Chapitre 11) et le raccourci de luminosité confirmé trois fois (Chapitre 12), qu'un test hors-ligne de CLIP (un modèle de vision-langage pré-entraîné, jamais touché à ce projet) vient tester avant d'engager la piste H-JEPA la plus coûteuse. CLIP repère bien la direction arbre/pas-d'arbre, mais reste lui aussi très lié à la luminosité — un résultat mixte, avec une question ouverte (une frame de grotte sombre) plutôt qu'une conclusion tranchée.

  15. Chapitre 15

    Cinquième confirmation pour le raccourci de luminosité, une fausse alerte qui n'en était pas une, et une énigme à 144 qui reste sans réponse

    Prérequis : Chapitres 1 à 14 — dont la piste H-JEPA justifiée au Chapitre 14. Un test de ratios de couleur par tuile spatiale ferme la piste de correction photométrique pour de bon (5ᵉ confirmation indépendante) ; séparément, un lot de 20 parties confirme que le sauvetage anti-noyade du Chapitre 13 tient à grande échelle (noyade 60%→15%) sans faire remonter le taux de coupe, une fausse alerte de processus est corrigée, et une récompense isolée de 144 reste un mystère documenté, sans effet sur les conclusions.

  16. Chapitre 16 NO-GO

    Le modèle le plus proche de H-JEPA jusqu'ici prédit l'avenir, pas l'image — et perd quand même contre la simple moyenne

    Prérequis : Chapitres 1 à 15 — dont la piste visuelle désormais fermée pour de bon (Chapitre 15). Le Coverage-Value Predictor prédit le gain d'exploration à partir d'indices de mouvement et de visitation, sans jamais regarder la couleur — un vrai bug de départage d'égalités est corrigé en chemin, et le test d'indépendance à la luminosité passe deux fois — mais le modèle entraîné perd contre la simple moyenne en validation croisée rigoureuse. NO-GO honnête, d'une nature différente des échecs de luminosité : un problème de quantité de données, pas un raccourci trompeur.

  17. Chapitre 17 NO-GO

    Même un détecteur qui ne peut rien apprendre retombe sur le même raccourci : le problème est dans l'œil, pas dans l'apprentissage

    Prérequis : Chapitres 1 à 16 — dont la boussole confirmée inversée au Chapitre 11, jamais réparée directement depuis. Deux attaques bon marché et directes sur ce mécanisme (un détecteur hors-distribution sans aucun paramètre entraîné, une vérification de diversité des données d'entraînement) échouent toutes les deux — mais la première, une simple formule statistique fixe sans possibilité d'apprendre un raccourci, retombe quand même dans la même confusion de luminosité : 6ᵉ confirmation indépendante, et la plus structurellement décisive à ce jour.

  18. Chapitre 18 Auto-corrigé

    La première victoire de la campagne n'a pas survécu à un échantillon plus grand — et c'est elle-même qui s'en est aperçue

    Prérequis : Chapitres 1 à 17 — dont les six confirmations du raccourci de luminosité accumulées jusqu'au Chapitre 17. Un test de généralisation par pseudo-profondeur (MiDaS) semble d'abord réussir les deux gates de la campagne pour la toute première fois — puis échoue le jour même une fois l'échantillon annoté élargi de 10 à 27 images, une correction que l'équipe s'inflige à elle-même avant de publier le résultat. Séparément, un écart réel et non photométrique de couverture d'actions Treechop/Obtain est découvert (104x le bruit d'échantillonnage) — un facteur candidat, pas encore une cause confirmée.

  19. Chapitre 19 NO-GO ×2

    Le premier vrai réentraînement du cœur du modèle : deux leviers, deux échecs bien compris, une pause choisie

    Prérequis : Chapitres 1 à 18 — dont les deux leviers scopés au Chapitre 18 (couverture d'actions, SIGReg). Premier réentraînement direct du cœur d'ebwm.pt en dix-neuf tentatives : les deux leviers échouent, chacun pour une cause identifiée plutôt que devinée — dont un effondrement dimensionnel inédit, invisible à l'ancien outil de surveillance, attrapé par un nouveau garde-fou de rang effectif. L'utilisateur choisit une pause et une consolidation plutôt qu'un troisième levier.

  20. Chapitre 20 campagne close

    Ne rien faire prédisait mieux : vingt tentatives à réparer le pilote, quand le problème était le moteur

    Prérequis : Chapitres 1 à 19 — le chapitre de clôture de la campagne et sa mesure la plus importante. Personne n'avait vérifié si le modèle du monde réagissait aux actions de l'agent. Il réagit — mais le conditionnement par les vraies actions prédit le futur mesurablement moins bien que de supposer que l'agent n'a rien fait, sur le domaine d'entraînement lui-même.

Le parcours s'arrête honnêtement là où la rédaction s'arrête aujourd'hui : aucune case suivante n'a été ajoutée par avance.

Pourquoi ça ressemble à un carnet de labo, pas à un showreel

Mine-JEPA est un projet réel, toujours en cours, et ce site est écrit directement à partir de son journal de recherche — y compris les tentatives qui ont échoué, les résultats seulement partiellement concluants, et les problèmes que personne n'a encore résolus. Si un chapitre rapporte un résultat négatif, il reste un résultat négatif ici : pas d'enthousiasme forcé, pas de confettis. La version honnête de cette histoire est aussi la plus intéressante.