← Retour aux articles !
Ajouter aux favoris
OX Alpha : le modèle IA mystère qui bat GPT-5.6 en code — probablement chinois

OX Alpha : le modèle IA mystère qui bat GPT-5.6 en code — probablement chinois

Apparu anonymement sur OpenRouter le 20 août, OX Alpha bat GPT-5.6 Sol et Claude Fable 5 sur les benchmarks de code — 80 % sur DeepSWE. Gratuit jusqu'au 27 août, 1 M de tokens de contexte, multimodal. Enquête sur un cinquième modèle stealth qui pointe clairement vers Z.AI.

Par Équipe Gennn··3 min de lecture
🎧 Écouter le résumé
0:00 / 0:00

Le 20 août 2026, un modèle IA baptisé « stealth/ox-alpha » apparaît sans marque affichée sur OpenRouter et OpenCode. Cinquième stealth model lâché sur ces plateformes en six mois. Sauf que celui-ci fait immédiatement parler de lui : il écrase GPT-5.6 Sol et Claude Fable 5 sur plusieurs benchmarks de code. Et il est gratuit jusqu'au 27 août.

Les specs annoncées

  • Contexte : 1 048 576 tokens (1 M)
  • Multimodal en entrée : texte, image, vidéo
  • Function calling supporté
  • Tokens d'entrée ET de sortie gratuits pendant la preview publique

La performance qui fait le buzz

Le développeur Ben Davis passe OX Alpha à travers DeepSWE, un benchmark d'agent de code, et publie ses résultats : 80 % pour OX Alpha contre 65 % pour Claude Fable 5 et 52 % pour GPT-5.6 Sol. En moins de 24 heures, des éditeurs comme Cursor et Zed l'intègrent en A/B test pour leur assistant de code.

Un modèle inconnu, en preview publique gratuite, qui domine les leaders payants du marché en code. Ce genre d'événement n'était plus arrivé depuis DeepSeek V3.

La nuance importante : aucun benchmark officiel

Le chiffre de 80 % vient d'un test isolé, à faible échantillon, publié par un chercheur indépendant. Aucun benchmark officiel n'est disponible à ce jour. Plusieurs autres évaluations communautaires suivent — les résultats varient entre 65 et 85 % selon les configurations et les seed. Il faut traiter ces chiffres comme des signaux préliminaires, pas comme un classement définitif.

D'expérience, les vrais gaps se voient dans les edge cases (bugs complexes, refactorings massifs, contextes très longs) — pas dans les benchmarks académiques classiques.

D'où vient OX Alpha ?

La question passionne l'écosystème. Trois hypothèses circulent :

  • Z.AI (Zhipu AI, Chine) — Ben Davis se déclare « 99 % certain » qu'il s'agit d'une variante inédite de la série GLM-5.3. Signatures stylistiques, format des réponses, benchmarks très proches de GLM-5.2 Turbo sorti le 17 août.
  • Anthropic ou xAI testant Claude Opus 5.5 ou Grok 5 en anonymat public.
  • Nouveau laboratoire chinois indépendant (Baichuan, MiniMax, Moonshot) essayant un lancement viral.

La piste Z.AI est la plus documentée. Le pattern est cohérent avec la stratégie chinoise : sortir en stealth, laisser la communauté valider les performances, puis officialiser avec la marque une fois le buzz confirmé.

Pourquoi c'est important

Trois lectures se croisent :

  1. La domination américaine sur le code touche à sa fin. Les benchmarks tenus par OpenAI et Anthropic depuis 2023 se font grignoter par des acteurs chinois qui itèrent plus vite et publient en open-weights.
  2. Le pricing à zéro tue temporairement le marché. Cursor, Windsurf, Continue.dev doivent réviser leur mix modèles quand un outil supérieur est gratuit. La marge des intermédiaires se contracte encore.
  3. Les stealth releases deviennent une pratique standard. C'est le cinquième en six mois. Les grands labs testent leurs modèles en conditions réelles avant l'annonce officielle — pratique importée du monde des jeux vidéo.

Ce qu'il faut surveiller

La preview gratuite se termine le 27 août. Deux scénarios :

  • OX Alpha devient GLM-5.3 officiel de Z.AI dans les jours qui suivent, avec grille tarifaire et confirmation d'API — c'est la piste probable.
  • Le modèle disparaît sans explication, ce qui accréditerait une origine plus discrète (labo de recherche testant en conditions publiques).

À vérifier aussi : les benchmarks tiers indépendants (LiveCodeBench, SWE-Bench Verified, MMLU) qui vont tomber dans les prochains jours et confirmer — ou dégonfler — la performance annoncée.

Une chose est sûre : entre Kimi K3, Qwen 3.8 Max, GLM-5.2, DeepSeek V4 et maintenant OX Alpha, la couche modèles de code chinois open-weights devient la plus dynamique du monde en 2026. Les développeurs français seraient bien avisés de la tester.