
Kimi K3 : 2,8 trillions de paramètres en open weights, et une API à côté — la Chine change la donne
Moonshot AI a publié fin juillet 2026 les poids ouverts de Kimi K3, un MoE de 2,8 trillions de paramètres. Une API payante existe en parallèle. Décryptage : ce qui est gratuit, ce qui est payant, et pourquoi la licence n'est pas totalement libre.
Le 16 juillet 2026, Moonshot AI a lancé Kimi K3. Le 27 juillet, l'entreprise chinoise a publié les poids complets du modèle — c'est-à-dire son code neuronal, librement téléchargeable depuis Hugging Face. Résultat : le monde compte désormais son plus gros modèle en open weights de l'histoire, et il vient de Pékin.
Les chiffres donnent le vertige : 2 800 milliards de paramètres, une fenêtre de contexte de 1 million de tokens, une deuxième place mondiale sur les benchmarks publics indépendants. Kimi K3 n'est pas juste un « bon » modèle chinois — c'est un événement structurant dans l'équilibre géopolitique de l'IA.
Deux façons d'utiliser K3 (à ne pas confondre)
C'est le point qui prête souvent à confusion, donc autant le clarifier tout de suite. Kimi K3 existe sous deux formes complémentaires :
1. Les poids ouverts (gratuits… mais pas sans coût)
- Téléchargeables gratuitement sur huggingface.co/moonshotai/Kimi-K3
- 96 shards, environ 1,56 To de fichiers safetensors
- Coût réel : le téléchargement est gratuit, mais faire tourner un modèle de 2,8 T paramètres exige du hardware sérieux — minimum ~8 GPU H100 pour l'inférence, soit environ 250 000 € en achat ou 50-100 €/heure en cloud. Ce n'est pas « gratuit » dans un sens économique — c'est « rien à payer à Moonshot ».
- Publié sous une Kimi K3 License custom (pas MIT ni Apache), qui impose :
- Un accord commercial séparé à négocier avec Moonshot si tu dépasses un certain seuil de chiffre d'affaires ou d'utilisateurs actifs (typiquement pour éviter que des concurrents cloud revendent K3 en Model-as-a-Service à grande échelle sans compensation)
- Une mention « Kimi K3 » obligatoire dans l'interface de ton produit au-delà de certains seuils
Techniquement, on parle donc d'« open weights » avec restrictions plutôt que d'open source strict à la Mistral (Apache 2.0) ou à l'OLMo (Apache 2.0 total). C'est la même famille que Llama : les poids sont librement redistribuables pour l'usage général, mais l'usage commercial à très grande échelle est encadré.
2. L'API officielle de Moonshot (payante, à l'usage)
Si tu ne veux pas gérer d'infrastructure, Moonshot propose son API compatible OpenAI :
- 3,00 $ par million de tokens en entrée (cache-miss)
- 0,30 $ par million de tokens en entrée (cache-hit — quand le modèle réutilise un long contexte déjà envoyé)
- 15,00 $ par million de tokens en sortie
- Un tarif plat quelle que soit la taille du contexte utilisé (jusqu'à 1 M tokens)
Ce sont des ordres de grandeur comparables à Claude Sonnet ou GPT-5.5. Le cache-hit à 0,30 $/M est particulièrement compétitif pour les usages à long contexte récurrent.
3. Les hébergeurs tiers
Plusieurs plateformes proposent déjà K3 sans passer par Moonshot :
- OpenRouter, Together AI, Fireworks, DeepInfra — chacun avec ses tarifs propres, souvent légèrement différents (parfois moins cher, parfois plus)
- Certaines de ces plateformes rentrent dans le cadre de la licence commerciale négociée avec Moonshot ; d'autres opèrent sur un modèle gris pour les usages transactionnels
Concrètement : tu paies l'inférence quelque part — soit à Moonshot, soit à un provider tiers, soit à ton propre cloud si tu héberges les poids toi-même. Le seul « gratuit total » possible, c'est de télécharger les poids et de les faire tourner sur du hardware que tu possèdes déjà (labo de recherche, cluster interne, workstation avec plusieurs GPU pro).
2,8 trillions de paramètres, mais « seulement » 104 milliards actifs
Kimi K3 est un Mixture-of-Experts (MoE). Sur les 2 800 milliards de paramètres totaux, seuls 104 milliards sont actifs pour traiter chaque token. Sur les 896 experts routés du modèle, 16 seulement se déclenchent par jeton.
Cette architecture change tout : au lieu de faire tourner un modèle dense monolithique de plusieurs trillions (impossible en pratique sur du hardware raisonnable), Moonshot fait tourner un réseau spécialisé qui n'active que la fraction pertinente à chaque instant. Résultat : le coût d'inférence reste dans la fourchette d'un modèle « lourd » classique, mais la capacité de spécialisation est démultipliée.
2,8 trillions de paramètres en open weights. À titre de comparaison, GPT-3 en avait 175 milliards. On a multiplié par 16 en 6 ans.
Une fenêtre de contexte d'un million de tokens
La deuxième claque : 1 048 576 tokens de contexte. Concrètement, tu peux nourrir Kimi K3 avec :
- Un livre entier (par ex. les 3 tomes du Seigneur des Anneaux ~ 500 000 tokens)
- Une base de code de plusieurs centaines de milliers de lignes
- Des dizaines d'articles scientifiques à analyser en parallèle
- Un historique de conversation ou de logs professionnels de plusieurs semaines
Deuxième place mondiale sur les benchmarks
D'après un banc d'essai indépendant portant sur 47 modèles, Kimi K3 arrive en 2ᵉ position. Le seul modèle au-dessus de lui : GPT-5.6 Sol d'OpenAI — bloqué dans plusieurs marchés à cause des sanctions.
Les résultats reportés par Moonshot placent K3 devant :
- Claude Opus 4.8 Max d'Anthropic, notamment sur les tâches de code et d'agent
- GPT-5.5 High d'OpenAI, sur plusieurs benchmarks classiques
Et derrière :
- Claude Fable 5, le vaisseau amiral rédactionnel d'Anthropic
- GPT-5.6 Sol, le sommet actuel
Autrement dit : Kimi K3 est à quelques points de coude à coude avec les modèles fermés les plus chers du marché occidental — mais avec un modèle économique très différent, puisque les poids sont disponibles.
Ce que ça change concrètement
1. La souveraineté IA n'est plus une chimère
Jusqu'ici, si tu voulais un modèle vraiment souverain (poids maîtrisés, pas de dépendance à un fournisseur cloud américain, pas de risque politique), tu devais accepter un compromis important sur la qualité (Llama 3, Mistral Large 2, DeepSeek V3.5). Avec Kimi K3 en poids ouverts, ce compromis est nettement plus faible pour quiconque a l'infrastructure d'héberger.
2. La Chine ne joue plus le rattrapage, elle joue la co-leadership
Moonshot n'est pas un projet gouvernemental : c'est une startup fondée en 2023, valorisée aujourd'hui autour de 8 milliards de dollars. Kimi K3 s'inscrit dans une vague de modèles chinois massifs — DeepSeek V3.5, Qwen 3, GLM 5, Yi 2 — qui ne se contentent plus de suivre les tendances OpenAI mais explorent des architectures et des trade-offs différents.
3. L'open weights devient l'endroit où l'action se passe
À très gros modèle, OpenAI et Anthropic gardent la main. Mais sur les modèles utilisables sous licence permissive, hébergeables sans compte, forkables, fine-tunables — la frontière est désormais tenue par la Chine. Meta reste actif avec Llama 4, mais sur la barre des 2 T de paramètres, ils n'y sont pas encore.
4. Les DSI européens ont un nouveau candidat sérieux
Pour les entreprises européennes soumises au RGPD strict et à la volonté de rapatrier certains traitements IA on-premise, Kimi K3 devient une option crédible — à condition (a) d'avoir l'infrastructure GPU, (b) d'auditer les biais linguistiques, (c) de vérifier l'alignement politique du modèle, (d) de bien lire la Kimi K3 License pour valider l'usage commercial prévu.
À surveiller
Trois angles à suivre dans les prochains mois :
- La communauté fine-tunée : combien de variantes spécialisées (juridique, médical, code, agents) vont émerger dans les 90 prochains jours ? C'est là que la vraie force d'un modèle open weights se mesure.
- Les benchmarks indépendants long terme : Moonshot a publié ses propres résultats. Il faudra confirmer sur des benchs adverses (HELM, ARC-AGI-2, SWE-bench) sur plusieurs semaines.
- La réponse américaine : Llama 4.5 est attendu pour l'automne. Meta va-t-il oser publier un MoE de 3 T+ ? Sous quelle licence ?
Une chose est sûre : ceux qui pensaient que les modèles à poids ouverts plafonneraient autour de 500 milliards de paramètres viennent de se prendre 2 800 milliards en pleine figure. Le paysage a changé.
Sources : VentureBeat, Simon Willison, ExplainX, Amplifi Labs, Layer3 Labs, Fello AI, Digital Applied, OpenRouter, Hugging Face, Wikipedia.