
Codex vs. Claude Code vs. Kimi Code : J’ai testé les 3 sur un vrai projet
Les benchmarks publiés par les éditeurs sont nombreux, mais je les trouve souvent biaisés et surtout très loin de ce qu'on vit sur un vrai projet. Du coup, j'ai voulu me faire mon propre avis.
J’ai donc fait développer la même application web par 3 agents différents (Codex, Claude Code et Kimi Code), avec le même prompt pour chacun. L’application en question est une single page app en React qui reproduit un jeu de table nommé “LINKX” (un mélange de Tetris, de Puissance 4, et de Blokus).
Les résultats :
- Codex est cheap dans tous les sens du terme : rapide et pas cher, mais il fait la moitié du travail, et le code qu’il produit est difficile à relire et à corriger.
- Claude Code et Kimi K3 se tiennent dans un mouchoir de poche. Chacun a un inconvénient majeur : le prix pour Claude Code, le temps de développement pour Kimi K3. Mais la qualité du code est bonne dans les deux cas.
- Aucun des modèles n’est capable de produire une application prête à être mise en production. Il faut toujours un humain pour relire, corriger et compléter le code généré par les agents, notamment sur l’UI où ils ont tous du mal.
Perso, j’ai été déçu par Codex, qui à mon sens n’est tout simplement pas au niveau. Et j’ai été agréablement surpris par Kimi K3, qui sort un très bon résultat. En rapport qualité/prix, si le temps n’est pas un problème, il remporte la palme.
Évidemment, ce n’est qu’un test sur une application et un prompt. Ça ne permet pas de tirer des conclusions générales sur les agents.
Et vous, vous utilisez quel agent, et pourquoi ?