TabPFN-3.5 bouscule les classements des modèles tabulaires
Prior Labs dévoile TabPFN-3.5, un modèle tabulaire capable de prédire sur une table sans entraînement spécifique par jeu de données. Le système revendique aussi des résultats de tête sur sept benchmarks et bat un vieux score Kaggle.
Prior Labs a présenté TabPFN-3.5, sa nouvelle version de modèle fondation pour données tabulaires, avec une promesse simple à résumer : prédire directement sur une table, sans entraînement ni réglage propres à chaque jeu de données. Selon la société, le modèle prend la tête sur sept benchmarks tabulaires et dépasse même le score gagnant d’un célèbre challenge Kaggle de 2015. L’enjeu dépasse le petit monde du benchmark, car les tableaux restent la matière première de nombreux usages métiers, de la finance à l’industrie. Et, pour une fois, la table ne sert pas qu’à poser le café.
Un modèle pensé pour les tableaux, pas pour les discours
TabPFN-3.5 est un modèle fondation tabulaire, c’est-à-dire un système entraîné pour apprendre des régularités dans des données structurées en colonnes et lignes. Prior Labs explique qu’il fonctionne en forward pass unique, sans adaptation par base de données, avec des poids ouverts pour la recherche, l’évaluation et Kaggle. En revanche, l’usage en production passe par l’API de Prior Labs ou une licence commerciale.
La version 3.5 monte en puissance par rapport aux itérations précédentes. Le cœur du modèle passe de 512 à 1 024 dimensions, et le nombre de paramètres grimpe à 220 millions, contre 53 millions pour TabPFN-3 de classification. Un seul point de contrôle couvre désormais classification et régression. Les données d’entrée passent par de nouvelles encodages, notamment des caractéristiques de Fourier apprises et des rangs ECDF en contexte, l’ECDF étant la fonction de répartition empirique, utile pour représenter la position d’une valeur dans la distribution. Prior Labs dit aussi avoir simplifié le prétraitement, en retirant plusieurs transformations comme le quantile transform, le robust scaling et des features SVD.
Un score Kaggle que la communauté regarde de près
La démonstration la plus commentée concerne le concours Otto Group Product Classification Challenge, organisé sur Kaggle en 2015. D’après le texte source, cette compétition avait réuni 3 505 équipes et distribuait 10 000 dollars de prix. Les participants devaient classer des produits dans 9 catégories à partir de 93 variables de comptage obfusquées. L’équipe victorieuse, composée de Gilberto Titericz et Stanislav Semenov, avait obtenu un score de log loss multiclasses de 0,382.
Nick Erickson, co-créateur d’AutoGluon et chercheur chez Prior Labs, dit poursuivre ce résultat depuis des années. Il indique qu’AutoGluon avait atteint la 23e place dans son article de 2020, puis la 14e en 2023 et la 9e en août 2026 [à vérifier]. TabPFN-3.5 affiche, lui, un score de 0,375 sur le private leaderboard du challenge Otto, avec des réglages par défaut et des données brutes, en environ une minute sur un GPU RTX PRO 6000. Le modèle n’a pas été préentraîné sur Otto ni sur un jeu Kaggle, seulement sur des données synthétiques. Un notebook Kaggle reproductible est public.
Des benchmarks où le modèle vise la première place
Le rapport technique cite une première place sur sept bancs d’essai : TabArena, BeyondArena, STRABLE, MulTaBench, RelArena-α, TALENT et ScoringBench. Dans plusieurs cas, le meilleur résultat revient non pas au modèle de base, mais à des variantes spécialisées. TabPFN-3.5-Thinking prend ainsi la tête sur TabArena, BeyondArena, STRABLE et MulTaBench, tandis qu’un harness interne TabPFN-Rel est annoncé en avance sur RelArena-α.
Sur TabArena, un benchmark vivant de 51 jeux de données, la version Thinking atteint 1 910 Elo, quand le modèle de base obtient 1 866 Elo. Prior Labs affirme aussi que la version standard dépasse AutoGluon 1.6 extreme de 130 Elo, avec un temps d’exécution réduit à un cinquième. Sur BeyondArena, qui couvre 142 jeux de données mêlant tables groupées, temporelles, larges, textuelles et à forte cardinalité, TabPFN-3.5 termine environ 150 Elo devant le leader précédent. Les MLP optimisés et assemblés gardent cependant l’avantage sur certaines sous-catégories, notamment les données groupées, temporelles et de grande taille.
Ce qui change sous le capot
Le gain de performances vient aussi d’un modèle plus flexible. La famille TabPFN-3.5 comprend une version de base à 220 millions de paramètres et huit estimateurs par défaut, une version Fast à 84 millions de paramètres annoncée jusqu’à six fois plus rapide, une version Plus réservée à l’API et à l’entreprise, et une version Thinking qui consomme davantage de calcul à l’inférence sans recourir à des LLM, des données réelles ni de recherche externe. Prior Labs dit que cette dernière peut aller jusqu’à 12 fois plus vite que TabPFN-3-Thinking.
Autre détail utile pour les équipes qui comptent leurs GPU : le cache KV reste d’une taille proche de celui de TabPFN-3 malgré la hausse de paramètres. Les prédictions sur une seule ligne restent donc à peu près aussi rapides, mais sur de grands ensembles d’entraînement le modèle de base peut être jusqu’à deux fois plus lent que TabPFN-3. TabPFN-3.5 supporte jusqu’à 1 million de lignes, avec 6 000 colonnes recommandées et 20 000 prises en charge.
Points clés
- TabPFN-3.5 revendique la première place sur sept benchmarks.
- Le score Otto annoncé est de 0,375, contre 0,382 en 2015.
- Prior Labs parle d’un test en une minute sur RTX PRO 6000.
- Le modèle de base compte 220 millions de paramètres.
- TabArena totalise 51 jeux de données selon Prior Labs.
- TabPFN-3.5-Plus reste limité à l’API et à l’entreprise.
En chiffres
- 3 505 équipes — participation au Kaggle Otto Group Product Classification Challenge, 2015.
- 10 000 dollars — dotation annoncée pour ce challenge Kaggle, 2015.
- 220 millions — paramètres de TabPFN-3.5, selon Prior Labs.
- 1 million de lignes — volume maximal pris en charge par le modèle, selon le rapport.
- 142 jeux de données — périmètre de BeyondArena cité par Prior Labs.