Pebble fait le pari des très petits modèles, mais les résultats varient

Pebble, série de modèles open source de basically-ai, a été mesurée sur plusieurs bancs de test et sur différents matériels. Les chiffres montrent des performances modestes, des écarts entre version Chat et base, et un écosystème runtime encore limité.

Pebble, la famille de modèles open source de basically-ai, a été évaluée et re-mesurée sur plusieurs environnements le 4 septembre 2026 puis le 5 septembre 2026. Les données montrent des modèles très compacts — de 10,3 millions à 24,5 millions de paramètres — mais aussi des écarts sensibles entre les scores publiés par l’éditeur et ceux obtenus dans une mesure indépendante. Dans ce contexte, l’intérêt n’est pas seulement académique : il touche à la portabilité, à la vitesse d’exécution et à la fiabilité des benchmarks pour les petits modèles.

Des modèles minuscules, mais pas anecdotiques

Pebble-10M, Pebble-10M-Chat, Pebble-25M et Pebble-25M-Chat partagent une architecture hybride Mamba2:attention, avec 6 couches Mamba2 et 2 couches d’attention. Le plus petit modèle revendique 10 281 744 paramètres, tandis que Pebble-25M monte à 24 486 710 paramètres ; les poids fp32 pèsent environ 44 Mo pour les versions 10M et autour de 98 à 103 Mo pour les versions 25M. Le tout reste sous licence Apache-2.0.

La particularité la plus gênante pour l’interprétation des chiffres tient au tokenizer : il est byte-level, avec environ un token par byte UTF-8. Résultat, le débit en tokens par seconde surestime d’environ 4 fois le débit en mots lisibles. Petite ligne de défense contre l’enthousiasme excessif : les nombres seuls ne parlent pas toujours humain.

Les scores de qualité restent bas, et l’écart au lab existe

Sur la suite de précision en zéro-shot, les chiffres publiés par basically-ai comme les mesures indépendantes restent modestes. Dans le record indépendant, Pebble-25M atteint par exemple 58,32 % sur PIQA et 33,00 % sur ARC-Easy, quand Pebble-10M-Chat tombe à 48,97 % sur PIQA. Sur HellaSwag, tous les modèles se situent autour de 23,41 % à 27,32 %, donc très près du hasard sur un test à 4 choix fixé à 25 %.

La comparaison avec les valeurs « lab-reported » montre des écarts dans les deux sens. Sur PIQA, l’indépendant est inférieur de 2,77 points pour Pebble-10M et de 0,93 point pour Pebble-25M, mais il dépasse de 3,93 points sur ARC-Challenge pour Pebble-10M-Chat. Le document attribue ces divergences possibles à des splits différents, à des règles de filtrage distinctes, à des détails de normalisation ou à la variance de run, sans trancher.

Chat ne veut pas toujours dire meilleur

Les variantes Chat ne surclassent pas systématiquement les versions de base. Sur ce record, elles font moins bien sur PIQA et sur HellaSwag, mais mieux sur ARC-Challenge. Pebble-10M-Chat perd ainsi 6,69 points sur PIQA par rapport à Pebble-10M, tout en gagnant 3,07 points sur ARC-Challenge. Ce n’est pas une progression linéaire, c’est un modèle qui dépend du test, et le test n’a pas l’air de vouloir se laisser dompter.

Autrement dit, la couche conversationnelle ajoute de la variabilité autant que du style. Pour les équipes qui comparent des petits modèles, le message est clair : la version « chat » peut améliorer certaines tâches, mais elle ne garantit pas un meilleur socle général.

Des performances d’exécution très dépendantes du runtime

Sur CPU, le picture est plus favorable. Avec llama.cpp patché pour Pebble, le modèle Pebble-10M f16 affiche 2 115 tokens/s en préremplissage et 449 tokens/s en génération sur un Xeon Kaggle à 4 threads ; Pebble-25M f16 descend à 838 tokens/s en préremplissage et 232 tokens/s en génération. En quantifié q4_k_m, Pebble-25M remonte même à 1 003 tokens/s en préremplissage et 274 tokens/s en génération.

Le même document signale pourtant que, sur le même matériel, la version pure-torch est nettement plus lente : environ 6 à 16 fois plus lente en préremplissage et 4 à 6 fois plus lente en décodage que llama.cpp. Le runtime compte donc presque autant que l’architecture. Sans l’infrastructure adaptée, un petit modèle reste petit, mais pas forcément pratique.

Quantification, perplexité et limites de portabilité

La perplexité mesurée sur un échantillon de wikitext-103-raw montre un coût modéré de la quantification. Pebble-10M passe de 16,40 en f16 à 18,24 en q4_k_m, soit environ +1,8 point ; Pebble-25M passe de 13,27 à 14,14, soit environ +0,9 point. Le record note donc une dégradation réelle, mais contenue sur ce corpus et dans ces conditions.

Côté écosystème, le constat est plus sévère : la pile officielle mamba_ssm n’a pas pu être compilée sur les images Kaggle testées, vLLM échoue à la fois pour des raisons de runtime CUDA et parce que l’architecture Pebble n’y est pas enregistrée, et aucune classe modèle Pebble n’existe dans MLX ou mlx-lm. En clair, l’open source avance, mais pas toujours en ligne droite.

Ce que ces chiffres racontent vraiment

Les sorties de Pebble ont aussi été examinées via des générations brutes. Les échantillons montrent des boucles de répétition, du texte incohérent et des réponses factuellement fausses sur des prompts simples comme « 2 + 2 = » ou « What is 2+2? ». Le document insiste : il s’agit d’un matériau d’observation, pas d’un verdict général sur tous les usages possibles.

Au fond, Pebble sert surtout de cas d’école. Les modèles sont très petits, les scores sont mesurables, les écarts entre pipelines existent et la portabilité reste incomplète. Pour les acteurs qui cherchent à faire tourner de l’IA localement ou à moindre coût, le sujet n’est donc pas de savoir si ces modèles impressionnent, mais où ils tiennent vraiment la route — et à quel prix.

Points clés

  • 4 modèles évalués, avec 10,3 M à 24,5 M de paramètres.
  • Mesures indépendantes réalisées le 4 septembre 2026.
  • Pebble-25M atteint 58,32 % sur PIQA.
  • Pebble-10M-Chat perd 6,69 points sur PIQA face à Pebble-10M.
  • basically-ai a publié des scores lab distincts de la re-mesure.

En chiffres

  • 10 281 744 paramètres — Pebble-10M, source basically-ai et re-mesure indépendante.
  • 24 486 710 paramètres — Pebble-25M, source basically-ai.
  • 2 115 tok/s — préremplissage de Pebble-10M f16 sur CPU Kaggle, record indépendant.
  • 16,40 — perplexité de Pebble-10M f16 sur wikitext-103-raw, record indépendant.
  • 6 à 16× — écart de vitesse entre llama.cpp et pure-torch en préremplissage, même machine.

À lire