Kimi de Moonshot en 2026 : K3, K2.6, K2.7-Code et agents pour le manager

AI-модели в этой статье
Un modèle chinois open source peut-il rivaliser avec les fleurons propriétaires d’OpenAI et d’Anthropic ? D’après notre évaluation indépendante, le nouveau Kimi K3 (sorti le 16 juillet 2026) a pris la 2e place sur 47 modèles. Seul GPT-5.6 Sol le devance – et, contrairement à ce fleuron propriétaire, K3 est un modèle ouvert, bien moins cher, que vous pouvez exécuter sur votre propre infrastructure : la souveraineté des données et la conformité RGPD restent entre vos mains.
En 2026, Kimi est passée d’un modèle unique à toute une famille : le nouveau fleuron K3 avec une fenêtre d'1 million de tokens, la K2.6 plus abordable pour le travail quotidien, la K2.7-Code spécialisée pour le développement, et l’agent de bureau Kimi Work, qui exécute des tâches directement sur votre ordinateur. Voici ce que cela apporte à un manager et les résultats de notre benchmark.

Qui est Moonshot AI
Moonshot AI est une startup pékinoise fondée en 2023 par d’anciens collaborateurs de ByteDance (le créateur de TikTok). L’entreprise est soutenue par Alibaba et HongShan (anciennement Sequoia China). Le fondateur et CEO – Zhilin Yang – est chercheur spécialisé en NLP.
La startup a misé sur deux axes : le contexte long et les capacités agentiques. La première version de Kimi, en 2024, avait attiré l’attention grâce à une fenêtre contextuelle alors record. Début 2026, K2.5 a porté ces deux axes dans la ligue d’élite, mais elle a été retirée du service dès le 25 mai. La gamme s’est poursuivie avec K2.6 et la K2.7-Code dédiée au code, puis, le 16 juillet, un nouveau fleuron est arrivé – K3, qui a immédiatement pris la 2e place de notre benchmark.
Ce que sait faire Kimi
Les modèles Kimi reposent sur une architecture Mixture-of-Experts : pour la gamme K2.x, c’est 1 000 milliards de paramètres dont 32 milliards actifs, et le nouveau K3 monte à 2 800 milliards. À chaque instant, seule une partie des experts travaille – d’où la combinaison de puissance et d’efficacité : les réponses sont rapides et le coût via API reste plusieurs fois inférieur à celui de Claude ou de GPT.
Caractéristiques clés :
- Fenêtre contextuelle – 256K tokens pour K2.x (soit environ 350 à 500 pages de texte par requête), et déjà 1 million de tokens pour K3
- Multimodalité native – comprend le texte, les images et la vidéo nativement
- Quatre modes de fonctionnement : Instant (réponses rapides), Thinking (analyse approfondie), Agent (tâches autonomes avec outils) et Agent Swarm (travail parallèle de sous-agents – jusqu’à 100 sur K2.5 et jusqu’à 300 sur K2.6)
- Code ouvert – licence MIT (modifiée), poids disponibles sur HuggingFace. K2.5 a été retirée du service ; les modèles actuels sont le fleuron K3, K2.6 et K2.7-Code (les poids de K3 sont annoncés pour le 27 juillet)
Agent Swarm : la fonctionnalité phare
C’est une approche fondamentalement nouvelle. Au lieu de résoudre une tâche de manière séquentielle, Kimi peut la décomposer en sous-tâches et lancer des dizaines, voire des centaines de sous-agents spécialisés en parallèle (jusqu’à 300 sur K2.6, avec une coordination atteignant 4 000 étapes). Chaque sous-agent travaille indépendamment, tandis que l’agent principal coordonne le résultat.

Pourquoi attendre 10 minutes quand on peut diviser la tâche en 100 flux ? En mode Swarm, Kimi K2.5 exécute une requête analytique complexe en 2 à 3 minutes au lieu de 10. Au test BrowseComp (navigation et recherche web), Agent Swarm a obtenu 78,4 % – le meilleur score parmi tous les modèles testés, y compris GPT-5.2.

Par ses capacités, Kimi peut rivaliser notamment avec Notebook LM de Google. Pour les présentations interactives – le résultat est plutôt convaincant au premier abord. Certes, les données datent de l’année dernière.
Pour un manager, c’est pertinent dans des scénarios comme « analyse 10 sites concurrents et produis une synthèse » ou « prépare un rapport à partir de plusieurs sources ».
Ce que montrent les benchmarks
Dès le lancement de la gamme, début 2026, Kimi K2.5 rivalisait solidement sur les benchmarks industriels standard avec les meilleurs modèles propriétaires de l’époque (les chiffres ci-dessous sont historiques ; le fleuron actuel de la gamme est K3) :
| Benchmark | Kimi K2.5 | GPT-5.2 | Claude Opus 4.5 | DeepSeek V3.2 |
|---|---|---|---|---|
| HLE avec outils | 50,2 % | 45,5 % | 43,2 % | 40,8 % |
| BrowseComp (Agent Swarm) | 78,4 % | 54,9 % | 24,1 % | 67,6 % |
| SWE-Bench Verified (code) | 76,8 % | 80,0 % | 80,9 % | 73,1 % |
| AIME 2025 (maths) | 96,1 % | 100,0 % | 92,8 % | 93,1 % |
| VideoMMMU (vidéo) | 86,6 % | 85,9 % | 84,4 % | – |
Kimi K2.5 domine en tâches agentiques (recherche, navigation, travail autonome) et en compréhension vidéo. En programmation, il cède face à Claude ; en mathématiques – face à GPT-5.2. Mais il s’agit d’écarts de 3 à 4 points de pourcentage, pas d’un gouffre.
Comme toujours, benchmarks et usage réel – ce sont deux choses différentes. Mais la tendance était claire : dès le début de l’année, Kimi K2.5 jouait dans la même ligue que les fleurons. Depuis juillet, c’est K3 qui mène la gamme – ce sont ses résultats dans notre benchmark que nous analysons ci-dessous.
Les capacités impressionnent – mais comment vérifier que le modèle gère réellement vos tâches ? Dans notre module gratuit, nous avons réuni 9 scénarios issus du travail réel d’un manager : de l’e-mail professionnel à la note stratégique. Vous pouvez lancer n’importe lequel d’entre eux sur Kimi K3 ou K2.6 et comparer le résultat avec d’autres modèles.
9 tâches de management – de l'e-mail client à la note stratégique. Vérifiez comment Kimi K3, K2.6 et d'autres modèles gèrent votre travail. Gratuit, sans inscription.
Sans paiement requis • Notification au lancement
La gamme Kimi : K3, K2.6 et K2.7-Code
Aujourd’hui, la gamme Kimi compte trois modèles actifs. K3 (16 juillet 2026) est le nouveau fleuron : 2 800 milliards de paramètres, fenêtre d'1 million de tokens, vision native et mode de raisonnement activé en permanence. K2.6 reste l’option plus économique pour le travail quotidien, et la K2.7-Code (sortie le 12 juin) est un modèle spécialisé pour la programmation, non prévu pour le chat ordinaire. Les trois sont open-weight sous licence MIT modifiée, avec les poids disponibles sur HuggingFace (ceux de K3 sont annoncés pour le 27 juillet).
Côté prix, K3 n’est plus « le modèle chinois pas cher » : 3 $ / 15 $ par million de tokens entrée/sortie, contre ~0,74 $ / ~3,49 $ pour K2.6. C’est environ la moitié du tarif de Claude Fable 5 et un prix raisonnable pour un niveau flagship – mais pour la routine, K2.6 reste plus avantageuse.
Ce qui rend K2.7-Code intéressante :
- Conçue pour le développement long-horizon : elle planifie, édite, exécute des outils et débogue le code sur plusieurs étapes en une seule boucle. Pour les tâches de gestion ordinaires, restez sur K2.6.
- Architecture et contexte – 1 000 milliards de paramètres, 32 milliards actifs (MoE), fenêtre de 256K tokens, poids ouverts (MIT modifiée) sur HuggingFace, accessible via l’API Kimi et Kimi Code.
- 30 % de « tokens de raisonnement » en moins que K2.6 – une boucle agentique qui consommait ~1 000 tokens pour réfléchir à une modification en consomme désormais ~700. À l’échelle, c’est une économie directe.
- Always-on thinking – le mode de raisonnement est activé en permanence et ne se désactive pas. Pour les tâches de code, c’est un atout (le modèle « réfléchit » toujours) ; pour des questions courtes, c’est une dépense de tokens superflue.
- 6x HighSpeed Mode – génération accélérée jusqu’à ~180 tokens/seconde, utile pour les boucles agentiques où le modèle enchaîne des dizaines d’appels.
- Appels d’outils fiables via MCP – le modèle invoque les outils externes via le protocole de façon fiable : vérifications CI, mises à jour de tickets et modifications multi-fichiers en une seule passe.
Prix – 0,95 $ / 4,00 $ par million de tokens entrée/sortie : un peu plus cher que K2.6, mais peu coûteux pour faire tourner un agent-développeur au quotidien.
Prudence avec les chiffres : tous les résultats publiés de K2.7-Code sont des benchmarks maison de Moonshot (Kimi Code Bench v2 : progression de 50,9 à 62,0 ; MCP Mark Verified – 81,1 contre 76,4 pour Claude Opus 4.8). Aucune vérification indépendante sur des suites publiques au moment de la sortie – comme dans l’histoire de GLM-5.2, les victoires annoncées par l’éditeur méritent d’être vérifiées.
Pour les managers : si vous visez le maximum de qualité, choisissez K3 – c’est désormais le meilleur modèle ouvert de notre benchmark. Si votre équipe écrit du code, K2.7-Code vaut un test comme agent-développeur peu coûteux ; pour le texte, l’analyse et la communication, la K2.6 plus abordable suffit. Nous analysons les trois modèles dans le benchmark ci-dessous.
Kimi Work et OK Computer : Kimi comme agent
Au-delà des modèles, Moonshot développe des produits agentiques – ici Kimi concurrence directement Perplexity Computer et Claude Cowork.
- OK Computer – mode agent directement dans le chat Kimi. À partir d’une requête textuelle, il construit des sites multi-pages et des diapositives éditables prêtes à l’emploi, traite jusqu’à 1 million de lignes de données d’un coup et produit texte, audio, images et vidéo. Pour un manager, c’est un premier jet rapide de présentation, de landing page ou de rapport de données à partir d’un seul prompt.
- Kimi Work (lancée le 10 juin 2026) – application de bureau (macOS Apple Silicon et Windows) qui tourne sur K2.6 et agit directement sur votre ordinateur. Vous fixez un objectif en mots – l’agent mène lui-même la recherche, en tire une note de marché synthétique sous forme de diapositives prêtes (les sections sont préparées en parallèle) et, via l’extension WebBridge, utilise votre navigateur comme un humain : il cherche, fait défiler, extrait des données et remplit des formulaires. À l’intérieur, on retrouve le même Agent Swarm, jusqu’à 300 sous-agents.
Pour les managers : l’association de Kimi Work et d’OK Computer transforme Kimi d’un simple chat en « collaborateur numérique » : vous confiez une tâche le soir, vous récupérez un brouillon de note ou de présentation le matin. La réserve principale : les données sont traitées par un service chinois, ce qui doit être pris en compte pour les informations sensibles.
Mise à jour : résultats du benchmark MySummit (juillet 2026)
Dans le benchmark MySummit (80 scénarios de tâches managériales réelles, deux juges indépendants), les trois modèles Kimi se classent dans le haut du tableau, et K3 place la barre plus haut :
- Kimi K3 – 2e place sur 47 modèles et meilleur modèle ouvert du classement. Premier dans quatre catégories d’un coup : planification, apprentissage, communication et analyse de décisions (rang, score et coût par test à jour dans la fiche ci-dessus). Seul GPT-5.6 Sol le devance.
- Kimi K2.6 – plusieurs fois moins cher que Claude Opus 4.7 pour un niveau de qualité proche. Il devance Claude Sonnet 4.6 en planification et en management d’équipe, pour un prix nettement inférieur. Un choix raisonnable quand le fleuron K3 est trop cher pour la tâche.
- Kimi K2.7 Code – quasiment au niveau de Claude Sonnet 4.6 sur les tâches managériales, mais bien moins cher sur les tokens de sortie. Optimal comme agent-développeur peu coûteux.
Les trois modèles sont ouverts (open-weight) et exécutables sur votre propre infrastructure – un vrai avantage face à Claude et GPT quand la souveraineté des données et le RGPD sont en jeu.
Verdict des juges pour K2.6 : adapté à la structuration complexe de projets (la planification est l’une des catégories les plus fortes du modèle), aux scripts d’entretiens d’équipe, à l’analyse quotidienne et aux rapports. Ne convient pas aux questions détaillées de droit du travail local (erreurs critiques), aux calculs financiers (faiblesse systématique), ni aux données de marché actualisées.
Verdict pour K2.7 Code : le meilleur planificateur à moins de 5 $ – rapports hebdomadaires, planification de sprints, plans trimestriels. Mêmes limites : droit du travail et modèles financiers.
Résultats de notre benchmark
Dans notre benchmark sur des tâches managériales réelles, Kimi K3 a pris la 2e place sur 47 modèles et s’impose comme le meilleur modèle ouvert du classement. Le seul modèle au-dessus de lui, GPT-5.6 Sol, est un fleuron propriétaire fermé. Les modèles qui, en début d’année, se tenaient encore près de Kimi ont, en six mois, reculé ou disparu du classement – la tête du tableau s’est entièrement recomposée.
L’écart avec le meilleur modèle russe du classement reste significatif. Ce n’est pas une nuance, mais une différence de qualité de fond.
Le radar montre ce qui maintient K3 aussi haut : la première place dans quatre catégories d’un coup – planification, apprentissage, communication et analyse de décisions – ainsi que la deuxième en management d’équipe. À noter aussi la connaissance du contexte régional : #4 sur 47, l’un des meilleurs résultats du benchmark, alors que cette catégorie était un point faible des versions précédentes de Kimi.
Kimi face aux autres modèles chinois
Pour un manager qui choisit parmi les outils disponibles, la comparaison au sein du « groupe chinois » compte plus qu’une compétition abstraite avec Claude. Tous les modèles ci-dessous sont ouverts ou accessibles directement, sans les blocages qui frappent GPT et Claude – résultats complets dans le benchmark.
| Modèle | Rang | Score | Coût/test | Point fort |
|---|---|---|---|---|
| Kimi K3 | #2 | 8.95 | $0.219 | Nouveau fleuron, meilleur modèle ouvert |
| MiMo v2.5 Pro (Xiaomi) | #9 | 8.37 | $0.027 | Management d’équipe et tâches RH |
| Kimi K2.6 | #12 | 8.27 | $0.036 | Planification (#11), management d’équipe (#9) |
| Kimi K2.7 Code | #16 | 8.05 | $0.028 | Agent-développeur peu coûteux |
| Qwen 3.6 Plus | #18 | 7.94 | $0.011 | Meilleur rapport qualité-prix du top 20 |
| MiMo v2.5 (Xiaomi) | #19 | 7.82 | $0.018 | Communication (#13), 25 fois moins cher que Claude Sonnet 5 |
| Qwen 3.7 Max | #20 | 7.77 | $0.037 | Planification et management d’équipe |
| DeepSeek V4 Pro | #21 | 7.75 | $0.005 | Le moins cher du top 25 |
| GLM 5.1 (Z.ai) | #29 | 7.38 | $0.016 | Management d’équipe |
Ce que révèle ce tableau :
Kimi K3 est le leader des modèles ouverts. Avec sa 2e place sur 47, il se détache de tout le « groupe chinois » : à ses côtés, on ne trouve que les fleurons occidentaux fermés.
MiMo v2.5 Pro de Xiaomi forme un solide second rideau. À la #9, il tient tête à MiniMax M3 (#8), Grok 4.5 (#10) et Claude Opus 4.7 (#11) – mais déjà nettement en dessous de K3. Efficace là où comptent le management d’équipe et les tâches RH.
Kimi K2.6 (#12) reste une valeur sûre. Elle ne rivalise pas avec K3 en qualité, mais coûte un ordre de grandeur de moins et demeure un modèle ouvert. Plus les atouts propres à la gamme : un chat gratuit avec modes agentiques et Agent Swarm avec 300 sous-agents.
DeepSeek V4 Pro est une anomalie tarifaire. Plusieurs fois moins cher que Kimi K2.6 pour un écart de qualité minime.
Tous les modèles chinois devancent encore largement les modèles russes – le meilleur modèle russe, GigaChat 3.5 Ultra, accuse un net retard sur Kimi K2.6.
Kimi, DeepSeek, GLM-5, Qwen – quel modèle est le meilleur pour vos tâches ? Module gratuit : 9 scénarios de travail managérial réel, choisissez le modèle que vous voulez. Gratuit, sans inscription.
Sans paiement requis • Notification au lancement
Essayez par vous-même : planification de projet sous contraintes réglementaires
Ce qu’il faut observer : Kimi K2.6 construit généralement une structure de sprints détaillée et décompose bien les dépendances (la planification est sa catégorie la plus forte, #11 sur 47 modèles). Mais sur les détails réglementaires français (RGPD, hébergement HDS, Mon Espace Santé, Code de la santé publique), le modèle commet souvent des erreurs – il confond les exigences ou cite des normes obsolètes (la connaissance du contexte régional est sa catégorie la plus faible). DeepSeek V4 Flash coûte 7 fois moins cher pour un problème similaire sur le droit local. Claude Sonnet sert de référence de qualité, mais reste un modèle propriétaire fermé, tandis que Kimi est exécutable sur votre propre infrastructure.
Comment accéder à Kimi
Interface web : kimi.com
Le site kimi.com fonctionne partout, sans VPN. Connexion via un compte Google – une dizaine de secondes suffisent.
L’interface n’existe qu’en anglais et en chinois, il n’y a pas d’UI en français. Mais le modèle comprend le français et y répond – la qualité des réponses en français est inférieure à celle en anglais (comme pour tous les modèles chinois), mais suffisante pour la plupart des tâches.

Deux modes de fonctionnement principaux :
- Instant – réponses rapides pour les tâches quotidiennes : correspondance, réponses aux questions, travail sur documents
- Thinking – analyse approfondie avec « chaîne de raisonnement », le modèle montre son cheminement de pensée
- Agent – exécution autonome de tâches : génération de documents (.docx, .pdf, .xlsx), recherche web, opérations multi-étapes. Si vous demandez de préparer un rapport avec des tableaux – c’est précisément ce mode
Applications mobiles
Kimi est disponible sur iOS et Android. Les fonctionnalités sont identiques à la version web, y compris tous les modes de fonctionnement.
Tarifs et abonnements
Niveau gratuit (Adagio)
- Requêtes textuelles illimitées en modes Instant et Thinking
- Jusqu’à 3 requêtes par mois vers les agents (documents, tableaux, présentations)
- 1 requête Deep Research par mois
- File d’attente aux heures de pointe
Le niveau gratuit suffit pour tester le modèle et déterminer s’il convient à vos besoins. Pour un usage quotidien – c’est trop limité.
Plans payants
| Plan | Prix | Ce qu’il offre |
|---|---|---|
| Moderato | 19 $/mois | Plus de requêtes agentiques, priorité, génération de présentations |
| Allegretto | 39 $/mois | Limites encore plus élevées, multitâche des agents, accès à Kimi Claw |
| Vivace | 199 $/mois | Agents illimités, vitesse maximale, contexte étendu |
Coût via API
| Option | Tokens en entrée | Tokens en sortie | ~Coût d’analyse d’un rapport de 100 pages |
|---|---|---|---|
| Moonshot API (direct) | 0,60 $ / 1M | 3,00 $ / 1M | ~0,50 $ |
| OpenRouter | 0,45 $ / 1M | 2,20 $ / 1M | ~0,35 $ |
Pour comparaison : Claude Opus 4.6 pour une tâche équivalente – environ 3 $, GPT-5.4 – 1,50 $. Kimi K2.6 est 6 à 8 fois moins cher que Claude.
Mais parmi les modèles chinois, Kimi n’est pas le plus économique. DeepSeek V4 Flash coûte 0,09 $/0,18 $ par million de tokens – 15 fois moins cher, et DeepSeek V4 Pro – 4 fois moins cher.
Limites et risques
Les langues autres que l’anglais – faiblesse prévisible. Comme GLM-5, Kimi fonctionne nettement mieux en anglais et en chinois. En français, le modèle s’en sort, mais avec une perte de nuances. Si la tâche le permet – formulez vos prompts en anglais.
Vitesse de réponse – Agent Swarm est rapide pour les tâches complexes, mais le mode Thinking classique est plus lent que Claude et GPT. Lors d’un test indépendant, le temps de réponse médian de Kimi K2.5 était de 29,2 secondes contre 4,6 pour Claude Sonnet 4.6. Cela fait réfléchir : si Agent Swarm promet la vitesse par le parallélisme, pourquoi le mode classique est-il 6 fois plus lent que la concurrence ? Pour des requêtes ponctuelles, c’est tolérable ; en usage intensif – c’est perceptible.
La censure chinoise fonctionne comme pour les autres modèles chinois : les sujets politiquement sensibles sont bloqués. Pour les tâches managériales, cela pose rarement problème.
Le traitement des données – par défaut, vos requêtes transitent par un service chinois. Pour les données sensibles soumises au RGPD, l’atout de Kimi est justement ses poids ouverts : la K2.6 (et bientôt K3) peut tourner sur votre propre infrastructure, où les données ne quittent pas votre périmètre.
La taille du modèle – 1 000 milliards de paramètres (2 800 pour K3) signifie qu’héberger le fleuron sur ses propres serveurs reste lourd pour une entreprise classique, même si les poids sont ouverts. Ce n’est pas Qwen3.5 9B, que l’on peut déployer sur un seul GPU.
Faut-il l’essayer ?
Kimi est objectivement la gamme de modèles chinois la plus forte de 2026. Le nouveau fleuron K3 a pris la 2e place sur 47 et s’impose comme le meilleur modèle ouvert du classement ; seul le GPT-5.6 Sol, propriétaire et fermé, le devance. Technologie unique d’Agent Swarm et poids ouverts – tout cela est confirmé par des tests indépendants.
Pour un manager, la recommandation dépend du contexte. Si vous visez le maximum de qualité et le travail avec plusieurs sources, des rapports ou des recherches multi-étapes – choisissez K3. Si les tâches sont plus simples et que le prix compte, la K2.6, plus abordable, reste un solide outil polyvalent.
Si le prix est déterminant, DeepSeek V4 Pro reste un excellent choix : il coûte plusieurs fois moins cher (0,005 $ par test) et gère bien le contexte régional. Si votre priorité est le management d’équipe, les tâches RH et le feedback – MiMo v2.5 Pro de Xiaomi est très solide (#9 au benchmark), même s’il cède à K3 sur la qualité globale.
Étonnamment, le modèle chinois le plus performant de 2026 n’est pas celui dont on a le plus parlé en début d’année. Kimi a dépassé aussi bien DeepSeek que Qwen sans déclarations tapageuses. Cela amène à se demander : dans quelle mesure le battage médiatique est-il un repère fiable pour choisir un outil de travail ?
Rendez-vous sur kimi.com, connectez-vous via Google et consacrez une heure aux tests. Le niveau gratuit suffit pour vous forger votre propre opinion.
Passez des revues à la pratique
Le programme complet du cours : du prompt engineering et de la pensée critique jusqu'aux spécialisations en gestion de projet et en analyse. Lancez les exercices sur Kimi K3 ou tout autre modèle – et constatez la différence entre un usage ponctuel et un usage systématique de l'IA.

Stanislav Belyaev
Engineering Leader chez Microsoft18 ans a diriger des equipes d'ingenieurs. Fondateur de mysummit.school. 700+ diplomes chez Yandex Practicum et Stratoplan.









