AMD rachète Taalas pour accélérer l’inférence IA sur silicium

AMD a conclu un accord définitif pour acquérir Taalas, startup torontoise qui grave des poids de modèles dans la puce. Le groupe veut renforcer ses offres d’inférence face à Nvidia, avec une exécution plus rapide mais des puces moins flexibles.

AMD a annoncé jeudi 6 août 2026 l’acquisition de Taalas, une startup torontoise qui conçoit des puces d’inférence IA en gravant les poids des modèles directement dans le silicium. L’enjeu est clair : accélérer et alléger le coût d’exécution des modèles, un marché devenu crucial avec la montée des assistants de code, des agents et des services “premium” de génération de tokens. Le prix n’a pas été communiqué et l’opération reste soumise aux autorisations réglementaires.

Une puce pensée pour un seul modèle, et pour aller très vite

Taalas, fondée en 2023 et sortie de l’ombre en 2024, ne suit pas l’approche classique des GPU généralistes. Ses circuits, que l’on peut décrire comme des MSIC pour model-specific integrated circuits, intègrent les poids du modèle dans le silicium, au lieu de les charger dans une mémoire haute bande passante de type HBM. Résultat, l’entreprise promet une baisse marquée des goulots d’étranglement liés au calcul et à la mémoire.

Les premiers éléments publics ont attiré l’attention pour une raison simple : en février, Taalas a présenté une puce de test, la HC1, gravée en 6 nm chez TSMC. Selon ses mesures, elle faisait tourner Llama 3.1 8B à 16 960 tokens par seconde. À ce niveau, la démonstration servait surtout à prouver le concept, mais le signal envoyé au marché était net. Un peu plus tard, la startup affirmait pouvoir lancer de nouvelles puces en deux mois, contre un délai souvent compris entre un et deux ans dans l’industrie [à vérifier].

Pourquoi AMD s’y intéresse maintenant

Pour AMD, l’opération s’inscrit dans une bataille plus large contre Nvidia sur les infrastructures IA. L’entreprise veut proposer une plateforme complète, du calcul aux racks, et Taalas peut s’y insérer comme brique d’inférence spécialisée. Vamsi Boppana, vice-président senior de la division IA chez AMD, a résumé l’intention dans un communiqué : “AMD is building a full-stack AI platform that gives customers the flexibility to deploy the right compute solutions for every AI workload.”

Selon la logique décrite par AMD et par des sources proches du dossier, la future intégration pourrait combiner les racks Instinct et les technologies de Taalas : les GPU resteraient dédiés au traitement lourd des requêtes, tandis que la génération de tokens serait déportée vers des accélérateurs fondés sur Taalas. Ce schéma vise les charges de travail où chaque centime par token compte, surtout pour des services d’IA générative vendus à grande échelle.

Le revers de la médaille tient à la rigidité du silicium

Le pari de Taalas a une limite très concrète : une fois la puce fabriquée, elle reste liée au modèle pour lequel elle a été conçue. Toute évolution majeure du modèle impose une nouvelle passe de conception, donc du temps et de l’argent. AMD et Taalas soutiennent toutefois qu’il ne faut pas repartir de zéro ; seules deux couches de métal seraient à modifier pour adapter la puce, ce qui réduirait l’ampleur du chantier [à vérifier].

Ce compromis explique pourquoi l’approche vise surtout les grands éditeurs de modèles, les fournisseurs d’infrastructure et quelques acteurs de l’inférence. Dans l’article de The Next Platform cité par la source, Taalas affirmait qu’“etching a model's weights into silicon is 100x less expensive than training a frontier model.” La phrase est spectaculaire, mais le gain attendu se joue surtout sur le coût d’exploitation, pas sur la souplesse. Quand le modèle change tous les mois, la puce immuable a un petit côté “mariage pour la vie”.

Un dossier canadien qui s’inscrit dans une série

Le rachat de Taalas est la deuxième acquisition d’une startup canadienne d’IA par AMD en un peu plus d’un an. En 2025, le groupe avait déjà conclu un accord pour racheter l’équipe derrière Untether AI, autre spécialiste torontois des puces d’inférence. AMD, qui a aussi des opérations au Canada depuis le rachat d’ATI Technologies en 2006, dit vouloir conserver et développer les talents locaux.

La cible arrive avec un historique de financement déjà solide. Taalas a levé 50 millions de dollars auprès de Quiet Capital, de Pierre Lamond et d’autres investisseurs après sa sortie de stealth, puis 169 millions de dollars supplémentaires plus tôt cette année, avec Fidelity dans le tour. La société a été fondée par d’anciens dirigeants d’AMD et de Tenstorrent : Ljubisa Bajic, aujourd’hui directeur général, Lejla Bajic, directrice des opérations, et Drago Ignjatovic, directeur technique.

Points clés

  • Annonce le 6 août 2026, transaction soumise aux autorisations.
  • AMD rachète Taalas, startup fondée en 2023 à Toronto.
  • HC1 a affiché 16 960 tokens par seconde sur Llama 3.1 8B.
  • Taalas a levé 50 millions puis 169 millions de dollars.
  • En 2025, AMD avait déjà acquis l’équipe d’Untether AI.
  • Vamsi Boppana défend une plateforme IA “full-stack”.

En chiffres

  • 16 960 tokens par seconde — performance revendiquée par la puce HC1 en février, sur Llama 3.1 8B.
  • 50 millions de dollars — premier financement public de Taalas, après sa sortie de stealth en 2024.
  • 169 millions de dollars — nouveau tour annoncé plus tôt cette année, avec Fidelity.
  • 2 mois — délai de lancement de nouvelle puce revendiqué par Taalas [à vérifier].
  • 2025 — année du rachat de l’équipe d’Untether AI par AMD.

À lire