Kotlin logo

Kotlin

A concise multiplatform language developed by JetBrains

AI

Présentation du Kotlin Benchmark pour les agents de programmation IA

Read this post in other languages:

Les benchmarks du développement piloté par des agents se rapprochent de plus en plus des conditions réelles du développement logiciel. Pour les équipes Kotlin, la question la plus importante est de savoir dans quelle mesure les agents d’IA peuvent réaliser des tâches Kotlin de bout en bout, de la lecture d’un ticket à la production d’une solution qui passe les tests de validation.

Nous franchissons une première étape pour combler cette lacune avec le lancement de Kotlin Benchmark, le benchmark officiel de JetBrains destiné à évaluer les agents de programmation IA sur des tâches d’ingénierie logicielle en Kotlin. Notre objectif est de donner aux développeurs un moyen public et crédible d’évaluer les performances des différents agents sur Kotlin et de comparer leurs configurations à l’aide de tâches plus proches du travail quotidien des développeurs.

En parallèle de la sortie du benchmark, nous en publions les ressources sur GitHub et lançons un classement officiel pour suivre les résultats des évaluations.

Découvrir le benchmark sur GitHub

Consulter les premiers résultats du classement

Fonctionnement du Kotlin Benchmark

La première version publique de Kotlin Benchmark repose sur la méthodologie de SWE-bench et évalue des tâches d’ingénierie logicielle en Kotlin réalisées à l’échelle d’un dépôt.

Kotlin dispose déjà de ressources d’évaluation des modèles robustes, notamment Kotlin_HumanEval et Kotlin_QA, qui aident à mesurer la compréhension de la syntaxe du langage et de ses concepts fondamentaux par un modèle. Le Kotlin Benchmark porte sur un autre aspect : la capacité d’un agent de programmation IA à accomplir des tâches d’ingénierie logicielle validées dans des projets Kotlin existants.

L’ensemble de données présente 105 tâches d’ingénierie, provenant de référentiels open source actifs. Chaque tâche requiert que l’agent d’IA interprète la description d’un ticket réel, explore le contexte du projet et génère un correctif fonctionnel. Les solutions sont strictement vérifiées dans des environnements conteneurisés, et une tâche n’est considérée comme résolue que si la solution générée passe les tests de validation requis.

Pour en savoir plus sur notre configuration d’environnement et la collecte de données, consultez la page Méthodologie.

Premiers résultats

Les premières évaluations montrent que les principaux agents de programmation peuvent accomplir une grande partie des tâches actuelles du Kotlin Benchmark. Ces résultats reflètent la première itération publique du benchmark et n’incluent pas encore les dernières versions de modèles. Nous travaillons déjà sur la deuxième itération et mettrons à jour le classement au fur et à mesure que de nouvelles évaluations seront ajoutées.

Dans cette série d’évaluations, le meilleur résultat provient de Claude Code avec Opus 4.7 xhigh, qui a résolu 90 tâches sur 105, soit un taux de résolution de 85,71 %. JetBrains Junie avec Opus 4.7 max (81,9 %) et Codex avec GPT 5.5 xhigh (81,9 %) suivaient de près.

Vous trouverez le classement complet sur kotlinlang.org/benchmark, où vous pouvez comparer les agents et les configurations en détail.

Les résultats affichés ici reflètent la première itération publique du Kotlin Benchmark. Le classement sera mis à jour à mesure que de nouveaux modèles seront évalués.

Pour les équipes qui souhaitent évaluer des agents de programmation, le benchmark fournit un cadre de référence commun pour comparer les configurations sur des tâches en Kotlin, au lieu de se contenter des affirmations des fournisseurs. Les scores sont destinés à dégager des tendances, et ne constituent pas une garantie pour toutes les bases de code. Les résultats concrets dépendent de votre architecture, de vos API internes, de vos normes de programmation, de vos outils et de votre processus de validation.

Nouveautés à venir

Nous privilégions une approche ouverte, c’est pourquoi nous avons bâti ce benchmark sur l’infrastructure open source Multi-SWE-bench et rendu publics tous les jeux de données et ensembles de tests.

Nous traitons les benchmarks comme un pipeline continu d’évaluation de la qualité. À l’avenir, nous prévoyons d’étendre le framework aux éléments suivants :

  • Une couverture plus large de l’écosystème Kotlin : Nous souhaitons que l’ensemble des tâches reflète davantage les usages réels de Kotlin, notamment dans des domaines tels qu’Android et Kotlin Multiplatform, tout en couvrant un éventail plus large de niveaux de difficulté.
  • Davantage de critères d’évaluation : Réussir les tests est un indicateur pertinent de la validité d’une solution, mais ce n’est que l’un des aspects de l’évaluation d’un agent. Les itérations futures prendront en compte le coût, les performances, la facilité de maintenance et la qualité du code.
  • Davantage d’agents et de configurations de modèles : nous prévoyons d’évaluer davantage d’agents commerciaux, de configurations agent-modèle et de modèles à pondération ouverte, afin que les équipes puissent comparer une plus large palette de configurations.

Le benchmark est ouvert : vous pouvez consulter les tâches, comparer les résultats et nous faire part des scénarios Kotlin que nous devrions intégrer par la suite.

Auteur de l’article original en anglais :

Alyona Chernyaeva

Alyona Chernyaeva