IBM muscle ses prévisions de séries temporelles avec PatchTST-FM-r2
IBM a publié PatchTST-FM-r2, un modèle open source de prévision de séries temporelles d’environ 385 millions de paramètres. Il vise les usages industriels, avec licence permissive, résultats de benchmark et prise en charge des valeurs manquantes.
IBM a publié le 9 septembre 2026 Granite Time Series PatchTST-FM-r2, un modèle de prévision de séries temporelles d’environ 385 millions de paramètres. Pensé pour des données comme la demande, les prix, l’énergie ou le trafic, il génère des prédictions sans fine-tuning spécifique. L’enjeu compte pour les entreprises car la prévision “zero-shot” réduit la dépendance à un modèle entraîné case par case, et donc du temps machine, des coûts et quelques maux de tête.
Un modèle qui veut sortir la prévision du laboratoire
PatchTST-FM-r2 est le nouveau venu de la famille Granite Time Series, chez IBM Research. La promesse est simple à énoncer, plus difficile à tenir : prendre un modèle préentraîné et l’appliquer à une nouvelle série temporelle sans réentraînement dédié. IBM le positionne pour des usages réguliers et très concrets, de la consommation énergétique aux volumes de transaction, en passant par la télémétrie.
Selon IBM, le modèle est disponible avec les poids, l’architecture, le pipeline d’inférence et le code nécessaires pour reproduire les résultats de benchmark. La publication vise autant les équipes data que les organisations qui veulent auditer ce qu’elles déploient. Dans ce domaine, l’opacité n’aide jamais longtemps.
Pourquoi IBM insiste sur la licence
Le modèle est distribué sous double licence Apache 2.0 et OpenMDW 1.0, deux cadres permissifs qui autorisent l’usage, la modification et la redistribution. IBM met en avant cette combinaison pour faciliter l’adoption commerciale. Le message est clair : le modèle doit pouvoir sortir du cadre de recherche et entrer dans des chaînes de production sans bloqueur juridique immédiat.
La documentation publiée avec le modèle précise toutefois que les développeurs IBM ont produit ce code comme projet open source et non comme produit IBM, sans obligation de support ou de mise à jour. Cette nuance compte pour les acheteurs et les équipes juridiques : permissif ne veut pas dire garanti.
Des résultats solides sur GIFT-Eval, mais avec une petite astérisque
IBM dit que, au 8 septembre 2026, PatchTST-FM-r2 se classe deuxième parmi les modèles replicables, zero-shot et sans fuite de données de test sur GIFT-Eval, un benchmark de prévision de séries temporelles. Sur les métriques CRPS et MASE, le modèle affiche respectivement 0,467 et 0,6846 en moyenne géométrique. Il arrive juste derrière TimesFM-3 sur CRPS, mais reste le meilleur des modèles à licence permissive dans cette catégorie.
Lorsque les modèles “pretrained” sont ajoutés à la comparaison — donc des modèles autorisés à avoir vu des données d’entraînement du benchmark dans leur corpus — PatchTST-FM-r2 reste très bien placé : troisième en CRPS et quatrième en MASE, selon IBM. Les références citées incluent Chronos-2, Timer-S1 et plusieurs variantes de Toto. [à vérifier] Le classement exact dépend aussi du moment où la page du benchmark est consultée, les résultats étant encore en discussion sur GIFT-Eval.
Une architecture repensée pour capter le court et le long terme
Par rapport à PatchTST-FM-r1, la version r2 conserve l’idée du découpage en patches, mais remplace les blocs transformer classiques par des blocs de type conformer. Un conformer, pour faire simple, mélange auto-attention et convolution temporelle afin de mieux traiter à la fois les relations lointaines et les motifs locaux. IBM dit que cela améliore les erreurs de prévision et lisse les transitions entre patches.
Le modèle utilise des patches superposés à 50 %, avec une longueur de patch de 16 et un stride de 8. Il applique un pondération de fenêtre de Hamming à l’entraînement, puis une stratégie overlap-and-add à l’inférence pour lisser les frontières. La version r2 passe aussi de 20 à 30 blocs, avec une dimension cachée de 1024, un contexte allant jusqu’à 8 192 pas et la prédiction de 99 quantiles pour produire à la fois une estimation centrale et des intervalles d’incertitude.
Ce que dit le jeu de données d’entraînement
IBM décrit un corpus d’entraînement documenté composé de quatre sources : des jeux de données sélectionnés de GiftEvalPretrain ; des données synthétiques basées sur KernelSynth avec noyaux périodiques modifiés et augmentation limitée ; un corpus TSMixup généré selon l’approche de Chronos mais excluant les données du jeu d’évaluation GIFT-Eval ; et environ 500 000 séquences synthétiques CauKer de longueur 4 096.
Cette transparence change la lecture du produit. Pour les entreprises, savoir d’où viennent les données ne remplace pas une revue interne de gouvernance, mais cela permet de vérifier plus vite les risques de fuite de benchmark, les contraintes de licence et la pertinence du modèle pour un usage métier. Les responsables data n’aiment pas les boîtes noires ; ici, IBM leur en laisse moins qu’à l’habitude.
Du notebook au flux en temps réel
IBM ne s’arrête pas au modèle isolé. Avec Confluent, plusieurs modèles Granite Time Series sont aussi proposés en Early Access dans Confluent Cloud, dont PatchTST-FM-r1, FlowState-r1.1, TTM-r3 et TSPulse. L’objectif est de faire tourner l’inférence sur des flux live via Apache Flink, sans transférer les données dans un environnement machine learning séparé.
Ce déplacement vers le streaming compte pour les cas d’usage industriels où les séries arrivent en continu. Prévoir une charge énergétique, des anomalies ou des volumes de trafic en temps réel ne se traite pas comme un tableau statique. IBM pousse donc sa famille Granite Time Series dans une direction très opérationnelle, avec une brique de recherche qui commence à ressembler à une brique d’infrastructure.
Points clés
- Publication le 9 septembre 2026 par IBM Research.
- Environ 385 millions de paramètres pour PatchTST-FM-r2.
- GIFT-Eval : 2e en zero-shot replicable, selon IBM.
- CRPS moyen géométrique : 0,467, selon IBM.
- MASE moyen géométrique : 0,6846, selon IBM.
- Double licence : Apache 2.0 et OpenMDW 1.0.
En chiffres
- 385 millions de paramètres — taille du modèle, annoncée par IBM, septembre 2026.
- 8 192 pas — longueur de contexte maximale, selon IBM Research.
- 99 quantiles — sorties probabilistes pour l’incertitude.
- 500 000 séquences — volume approximatif de CauKer synthétiques.
- 4 sources — corpus d’entraînement documenté par IBM.