En septembre 2026, le développeur indépendant Mithil Vakde a obtenu un score de 44 % lors de l’évaluation publique ARC-AGI-1 en faisant tourner son entraînement pendant seulement 1,5 heure sur un unique GPU RTX 5090. L’ensemble du processus d’entraînement n’a coûté que 67 centimes. Avec une seule carte graphique grand public et une facture inférieure à un dollar, sa solution a directement égalé les scores de solveurs spécialisés de premier plan comme TRM et HRM, tout en distançant une foule de grands modèles de langage (LLM) généraux aux budgets colossaux.
Proposé par François Chollet en 2019, l’ARC-AGI est considéré depuis longtemps comme l’étalon-or pour mesurer le raisonnement abstrait humain, la communauté proposant une prime de 1 million de dollars. Un benchmark de référence établi depuis 6 ans a été franchi par une personne seule en s’appuyant sur une architecture Transformer fondamentale.
44 % de score pour seulement 67 centimes
Le score de 44 % atteint par Mithil Vakde démontre l’efficacité spectaculaire de la communauté open source sur des modèles à taille réduite. Lors de la publication de la version précédente de ce projet, celui-ci avait déjà suscité des discussions publiques parmi des chercheurs de renom tels que Lucas Beyer de Google DeepMind, Jeremy Howard de fast.ai et Rohan Anil. Un modèle développé individuellement dans un environnement contraint en matériel a fait jeu égal avec les équipes d’élite des géants de la tech.
La stratégie des grands modèles consistant à injecter massivement de l’argent et des données montre ses limites sur le raisonnement à partir de peu d’exemples (few-shot). Les meilleurs solveurs spécialisés nécessitent des architectures complexes et des investissements en calcul exorbitants, tandis que cette approche open source a reproduit les mêmes capacités pour moins d’un dollar. L’accumulation de puissance de calcul ne saurait masquer l’inefficacité algorithmique sur des tâches spécifiques ; un ajustement fin de l’architecture s’avère bien plus percutant qu’une expansion par la force brute.
Figure : Comparaison des performances sur l’évaluation publique ARC-1. Source : Blog de Mithil Vakde
Supprimer des composants clés divise le score par deux
Cette solution ne sort pas du cadre du Transformer, mais intègre avec précision des composants architecturaux modernes tels que SwiGlu, RMSNorm, le codage de position 3D RoPE et l’optimiseur NorMuon. Dans les études d’ablation publiées par l’auteur, le retrait de 3D RoPE ou de l’embedding par tâche (per-task embedding) fait immédiatement s’effondrer le score du modèle de 44 % à environ 24 %.
| Configuration | Score |
|---|---|
| Configuration complète (3D RoPE + per-task embedding) | 44 % |
| Sans 3D RoPE | environ 24 % |
| Sans per-task embedding | environ 24 % |
| Configuration de base uniquement | 18 % |
| Entraînement des tokens de sortie uniquement (vs version précédente) | 40 % → 44 % |
L’essence de la tâche ARC réside dans le traitement de grilles bidimensionnelles et de canaux de couleur, et 3D RoPE cartographie parfaitement cette structure multidimensional. Les mécanismes de codage de position spatiale et d’embedding personnalisés pour des tâches spécifiques comblent avec précision les lacunes du modèle dans l’extraction de caractéristiques locales.
Ces données d’ablation démontrent une réalité claire : la modélisation précise de la structure de la tâche a bien plus de valeur que l’empilement de paramètres. L’entraînement par force brute sur l’ensemble des paramètres, habituel pour les LLM généraux, atteint son plafond sur des tâches de raisonnement hautement abstrait. L’optimisation architecturale ancrée dans la logique métier constitue le véritable levier pour obtenir des scores élevés.
Figure : Étude d’ablation : chute libre sans 3D RoPE ni per-task embedding. Source : Blog de Mithil Vakde
Les coûts de recherche verrouillent l’espace d’exploration
Mithil Vakde avance un constat audacieux : les grands modèles de langage ne possèdent aucun avantage inhérent en matière d’efficacité échantillonnelle. Si personne n’a réussi à ouvrir cette voie sur ARC au cours des 6 dernières années, ce n’est pas en raison d’obstacles techniques insurmontables, mais parce que les coûts expérimentaux prohibitifs ont verrouillé l’espace d’exploration des chercheurs dans les grands laboratoires. Avec des coûts d’entraînement s’élevant à des milliers ou des dizaines de milliers de dollars par essai, les équipes des grands groupes ne peuvent pas exécuter des dizaines ou des centaines d’expériences d’ablation, ce qui les empêche de découvrir quels détails architecturaux sont réellement efficaces pour ARC.
Un coût d’essai-erreur de quelques centimes permet en revanche à un développeur indépendant de tester des combinaisons de composants à haute fréquence. Le moindre ajustement de paramètre peut être vérifié en 1,5 heure. Les capacités générales développées par les géants de la tech au prix de millions de dollars d’entraînement paraissent bien lourdes face à des tâches ciblées nécessitant des essais intensifs et une précision chirurgicale.
Figure : Comparaison des meilleurs résultats d’autres ablations. Source : Blog de Mithil Vakde
L’efficacité échantillonnelle prend la main
Lorsque l’union des tâches résolues lors de plusieurs exécutions atteint 55 %, l’auteur estime que le Transformer seul peut toucher le seuil des 65 % sur ARC. Cette solution entièrement open source, incluant les poids du modèle et le code d’entraînement, a obtenu 546 points et 146 commentaires sur Hacker News, suscitant un vifs engouement de la communauté pour le potentiel des petits modèles. Outre ses excellentes performances sur ARC-AGI-1, le modèle a également obtenu un score de 7 % sur le test ARC-2, nettement plus difficile.
Répliquer les résultats des meilleures équipes de recherche pour 67 centimes met en lumière l’inefficacité des investissements en millions de dollars des grands groupes. La suprématie de la puissance de calcul ne se traduit pas directement en scores élevés ; l’efficacité échantillonnelle démontrée par la communauté open source à un coût dérisoire s’impose comme la variable clé de la seconde moitié de la compétition en IA.
Liens de référence :
- Blog de Mithil Vakde
- Discussion HN
- Discussion Lobsters