Needle 2 tient dans 14 Mo et vise les fonctions hors ligne
Cactus Compute lance Needle 2, un modèle ouvert de 45 millions de paramètres dédié au tool calling. Il tient dans un binaire de 14 Mo, tourne avec environ 28 Mo de RAM et vise les appareils contraints, du téléphone bas de gamme au casque XR.
Cactus Compute a présenté Needle 2, un modèle ouvert de 45 millions de paramètres pensé pour appeler des outils, piloter des appareils et extraire des données structurées. Le point qui change tout tient en une ligne : l’ensemble est livré dans un binaire de 14 Mo et fonctionne avec environ 28 Mo de RAM pour une session complète. Dans un marché de l’IA où la plupart des modèles réclament des serveurs musclés, ce positionnement vise clairement les appareils sans GPU ni NPU, du mobile d’entrée de gamme aux objets connectés.
Un modèle qui préfère la contrainte au bavardage
Le parti pris de Cactus est assez net : pour transformer une phrase bancale en appel de fonction typé, il n’y aurait pas besoin de connaissance générale ni de génération ouverte. Needle 2 cible donc des cas très précis, comme la commande vocale hors ligne, le contrôle d’appareils, l’extraction de reçus ou de factures, ou encore le routage local vers le cloud quand la confiance baisse. Une manière de rappeler que l’IA utile n’est pas toujours celle qui raconte de belles histoires.
Selon la société, le modèle est fourni en binaires précompilés et en bibliothèque statique pour macOS, Linux, Windows, Android, iOS/watchOS/tvOS et WebAssembly. Cactus indique aussi que Pebble utilise déjà Needle en local dans l’application Index 01 pour des actions vocales hors ligne.
Une architecture taillée pour la mémoire basse
Sur le plan technique, Needle 2 repose sur ce que l’équipe appelle un Simple Attention Network. La recette remplace le réseau feed-forward classique par un Hadamard MLP, conserve l’attention GQA, ajoute une mémoire clé-valeur issue de tables de n-grammes hachées et utilise des multi-lane hyper-connections. Le modèle compte 27 couches pour une largeur de 512.
Cactus dit avoir préentraîné Needle 2 sur un corpus propriétaire de 115 milliards de tokens, puis l’avoir poursuivi avec 38 milliards de tokens de post-training. Les poids sont codés en CQ2-bit via Cactus Quants, ce qui permet, selon l’éditeur, de les déployer sans décompression en RAM. L’arithmétique resterait ainsi dans une voie de calcul de type int8, avec sélection automatique du noyau CPU au démarrage : SDOT, NEON, AVX2, vecteurs RISC-V, wasm SIMD ou simple mode scalaire.
Pourquoi ça compte pour les appareils contraints
Le modèle cible des usages où la latence, le coût et l’absence de réseau stable comptent davantage que la capacité à rédiger un essai. Cactus cite les smart homes, les wearables, les téléphones bas de gamme, l’automobile embarquée, la robotique de service, les kiosques de vente, les routeurs, les caméras IP et certains environnements réglementés où l’audio ne doit pas quitter l’appareil. C’est aussi dans ces segments que le tool calling local peut réduire les allers-retours vers le cloud.
La logique produit est simple : une fenêtre d’attention de 256 tokens, des KV sinks pour garder la mémoire stable, et un plafond de RAM qui ne grimpe pas avec la longueur de la conversation. Quand plus de cinq outils sont déclarés, un mécanisme de recherche contrastive n’en retient que les cinq mieux classés. Les outils non retenus ne sont pas seulement peu probables, ils sont inaccessibles. Le modèle rend aussi une valeur de confiance, et renvoie une réponse vide [] quand la requête sort du cadre.
Des mesures solides, mais spécialisées
Sur cinq jeux de test publics dédiés au function calling, Needle 2 affiche des résultats contrastés. Il prend la tête sur Seal-Tools, avec 32,6 sur le split in-domain et 28,7 sur l’out-of-domain, mais reste derrière d’autres modèles sur BFCL v4, où il atteint 42,6 en score global contre 60,8 pour LFM2.5 230M et 61,7 pour Apple FM. Cactus explique cet écart par la spécialisation du corpus, centré sur des actions d’appareils grand public plutôt que sur des API d’entreprise plus générales.
Points clés
- Needle 2 tient dans un binaire de 14 Mo.
- Une session complète occupe environ 28 Mo de RAM.
- Le modèle compte 45 millions de paramètres.
- Cactus cite 115 milliards de tokens de préentraînement.
- Les résultats BFCL v4 sont publiés sur 3 641 cas.
En chiffres
- 14 Mo — taille du binaire, selon Cactus Compute.
- 28 Mo — mémoire annoncée pour une session complète.
- 45 millions — paramètres du modèle Needle 2.
- 3 641 — cas BFCL v4 utilisés dans l’évaluation globale.
- 32,6 — score Seal-Tools in-domain, publié par Cactus.