Kimi K3 arrive sur Bedrock avec un contexte géant
Moonshot AI rend Kimi K3 disponible sur Amazon Bedrock. Ce modèle open weight de 2,8 billions de paramètres apporte vision native, contexte d’1 million de tokens et cache explicite.
Moonshot AI rend Kimi K3 généralement disponible sur Amazon Bedrock, dans toutes les régions où le service opère, depuis le 18 septembre 2026. Ce modèle open weight de 2,8 billions de paramètres combine vision native, fenêtre de contexte d’un million de tokens et cache de prompt explicite. L’enjeu dépasse la fiche technique : AWS rapproche ainsi la flexibilité des modèles ouverts des garde-fous attendus par les entreprises, sans obliger à choisir entre les deux.
Un modèle ouvert, mais sous contrôle cloud
Kimi K3, présenté comme le modèle open weight le plus capable de Moonshot AI, arrive dans le même périmètre de sécurité que les modèles propriétaires sur Bedrock. Les contrôles d’accès, le chiffrement et l’audit restent identiques, avec en plus une conservation nulle des données pour l’inférence et aucun accès opérateur aux prompts ou aux réponses. Dit autrement, les équipes peuvent tester un modèle frontalier sans faire voyager leurs données hors du cadre AWS, ce qui rassure les secteurs régulés.
Amazon précise que Kimi K3 est disponible via les profils d’inférence cross-region global.moonshotai.kimi-k3 et us.moonshotai.kimi-k3. Le premier route les requêtes vers des régions commerciales AWS prises en charge dans le monde, le second limite le traitement à la géographie américaine pour respecter des exigences de résidence des données. Pour les usages sensibles, cette nuance compte autant que la taille du modèle — et parfois plus, car la meilleure IA ne sert pas à grand-chose si la conformité bloque le déploiement.
Pourquoi le million de tokens change la donne
La fenêtre de contexte d’un million de tokens permet de charger un très gros corpus en une seule session : dépôt de code, manuels, documents internes ou transcriptions vidéo. Kimi K3 gère aussi la vision native, ce qui veut dire qu’il peut traiter des images, des captures d’écran et des pages numérisées sans outillage OCR séparé. Pour les usages de codage et de connaissance, ce mélange réduit les allers-retours entre systèmes et limite le besoin de mémoire externe.
Moonshot AI avance aussi un gain d’environ 2,5 fois en efficacité de passage à l’échelle par rapport à Kimi K2. Cette mesure vient du fournisseur lui-même et n’est pas encore validée par des benchmarks indépendants largement diffusés [à vérifier]. Dans le même temps, la seule taille du modèle ne garantit pas la qualité finale : les entreprises devront tester Kimi K3 sur leurs propres tâches avant de le mettre en production.
Le cache explicite, nouvel argument de coût
Bedrock ajoute avec Kimi K3 la prise en charge du cache de prompt explicite pour un modèle open weight, une première sur la plateforme selon AWS. Le principe est simple : on marque une portion stable du prompt, d’au moins 1 024 tokens, puis Bedrock peut réutiliser ce contexte au lieu de le retraiter à chaque appel. Résultat : latence réduite, coût d’entrée plus bas et meilleure efficacité sur les workflows répétitifs.
Cette logique vise surtout les tâches longues, où le même socle d’instructions revient à chaque requête : assistant de code, agent documentaire, outil de recherche interne. Les tokens écrits en cache sont facturés à un tarif plus élevé au départ, puis conservés au moins 30 minutes ; les lectures en cache bénéficient ensuite d’un tarif réduit. AWS dit aussi que ces tokens en cache ne comptent pas dans les quotas d’input-tokens-per-minute sur les requêtes correspondantes.
Ce qu’AWS met en avant pour les équipes techniques
Le lancement s’inscrit dans une montée en puissance continue des modèles open weight sur Bedrock depuis 2025, avec des ajouts venus notamment de DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI et Qwen. En 2026, la plateforme a aussi ajouté le tool calling, les sorties structurées, le streaming, ainsi que les API Responses et Chat Completions. L’idée est claire : faire d’un service cloud un point d’accès unique, sans multiplier les intégrations par modèle.
Pour les développeurs, AWS recommande plutôt les API Responses ou Chat Completions que Converse pour Kimi K3, en raison de limites connues sur certaines configurations multi-tours. Bedrock indique aussi que les entrées vidéo ne sont pas prises en charge, tandis que les images doivent idéalement précéder le texte dans les requêtes mixtes. Ce sont des détails, mais les détails font souvent dérailler un projet plus vite qu’un grand discours produit.
Reste une question de fond : la performance réelle suivra-t-elle la promesse d’échelle ? Les premiers signaux sont surtout stratégiques. AWS renforce son catalogue de modèles ouverts, Moonshot AI gagne une distribution cloud immédiate, et les entreprises obtiennent un accès plus simple à un modèle massif sans sortir de leur cadre de gouvernance. Pour les usages de code et de connaissance, c’est une combinaison qui compte déjà.
Points clés
- Kimi K3 est disponible sur Bedrock depuis le 18 septembre 2026.
- Moonshot AI annonce 2,8 billions de paramètres et 1 million de tokens.
- Bedrock prend en charge le cache explicite pour ce modèle.
- Le profil global route les requêtes partout dans le monde.
- Le profil US limite le traitement à la géographie américaine.
- AWS cite un déploiement sans partage des données avec le fournisseur.
En chiffres
- 2,8 billions de paramètres — modèle Kimi K3, Moonshot AI, 2026.
- 1 million de tokens — fenêtre de contexte annoncée pour Kimi K3.
- 2,5x — gain d’efficacité de passage à l’échelle revendiqué face à Kimi K2.
- 1 024 tokens — seuil minimal pour un point de cache explicite.
- 30 minutes — durée minimale de conservation du cache explicite.