{"id":725929,"date":"2026-07-23T15:26:04","date_gmt":"2026-07-23T14:26:04","guid":{"rendered":"https:\/\/blog.jetbrains.com\/?post_type=kotlin&#038;p=725929"},"modified":"2026-07-23T15:26:47","modified_gmt":"2026-07-23T14:26:47","slug":"presentation-du-kotlin-benchmark-pour-les-agents-de-programmation-ia","status":"publish","type":"kotlin","link":"https:\/\/blog.jetbrains.com\/fr\/kotlin\/2026\/07\/presentation-du-kotlin-benchmark-pour-les-agents-de-programmation-ia\/","title":{"rendered":"Pr\u00e9sentation du Kotlin Benchmark pour les agents de programmation IA"},"content":{"rendered":"<p>Les benchmarks du d\u00e9veloppement pilot\u00e9 par des agents se rapprochent de plus en plus des conditions r\u00e9elles du d\u00e9veloppement logiciel. Pour les \u00e9quipes Kotlin, la question la plus importante est de savoir dans quelle mesure les agents d&#8217;IA peuvent r\u00e9aliser des t\u00e2ches Kotlin de bout en bout, de la lecture d&#8217;un ticket \u00e0 la production d&#8217;une solution qui passe les tests de validation.<\/p>\n<p>Nous franchissons une premi\u00e8re \u00e9tape pour combler cette lacune avec le lancement de <a href=\"http:\/\/kotlinlang.org\/benchmark\/\" target=\"_blank\" rel=\"noopener\">Kotlin Benchmark<\/a>, le benchmark officiel de JetBrains destin\u00e9 \u00e0 \u00e9valuer les agents de programmation IA sur des t\u00e2ches d&#8217;ing\u00e9nierie logicielle en Kotlin. Notre objectif est de donner aux d\u00e9veloppeurs un moyen public et cr\u00e9dible d&#8217;\u00e9valuer les performances des diff\u00e9rents agents sur Kotlin et de comparer leurs configurations \u00e0 l&#8217;aide de t\u00e2ches plus proches du travail quotidien des d\u00e9veloppeurs.<\/p>\n<p>En parall\u00e8le de la sortie du benchmark, nous en publions les ressources sur GitHub et lan\u00e7ons un classement officiel pour suivre les r\u00e9sultats des \u00e9valuations.<\/p>\n<p><a href=\"https:\/\/github.com\/Kotlin\/kotlin-swe-bench\" target=\"_blank\" rel=\"noopener\">D\u00e9couvrir le benchmark sur GitHub<\/a><\/p>\n<p><a href=\"http:\/\/kotlinlang.org\/benchmark\/\" target=\"_blank\" rel=\"noopener\">Consulter les premiers r\u00e9sultats du classement<\/a><\/p>\n<h3 class=\"wp-block-heading\">Fonctionnement du Kotlin Benchmark<\/h3>\n<p>La premi\u00e8re version publique de Kotlin Benchmark repose sur la m\u00e9thodologie de SWE-bench et \u00e9value des t\u00e2ches d&#8217;ing\u00e9nierie logicielle en Kotlin r\u00e9alis\u00e9es \u00e0 l&#8217;\u00e9chelle d&#8217;un d\u00e9p\u00f4t.<\/p>\n<p>Kotlin dispose d\u00e9j\u00e0 de ressources d&#8217;\u00e9valuation des mod\u00e8les robustes, notamment <a href=\"https:\/\/huggingface.co\/datasets\/JetBrains\/Kotlin_HumanEval\" target=\"_blank\" rel=\"noopener\">Kotlin_HumanEval<\/a> et <a href=\"https:\/\/huggingface.co\/datasets\/JetBrains\/Kotlin_QA\" target=\"_blank\" rel=\"noopener\">Kotlin_QA<\/a>, qui aident \u00e0 mesurer la compr\u00e9hension de la syntaxe du langage et de ses concepts fondamentaux par un mod\u00e8le. Le Kotlin Benchmark porte sur un autre aspect\u00a0: la capacit\u00e9 d&#8217;un agent de programmation IA \u00e0 accomplir des t\u00e2ches d&#8217;ing\u00e9nierie logicielle valid\u00e9es dans des projets Kotlin existants.<\/p>\n<p>L&#8217;ensemble de donn\u00e9es pr\u00e9sente 105 t\u00e2ches d&#8217;ing\u00e9nierie, provenant de r\u00e9f\u00e9rentiels open source actifs. Chaque t\u00e2che requiert que l&#8217;agent d&#8217;IA interpr\u00e8te la description d&#8217;un ticket r\u00e9el, explore le contexte du projet et g\u00e9n\u00e8re un correctif fonctionnel. Les solutions sont strictement v\u00e9rifi\u00e9es dans des environnements conteneuris\u00e9s, et une t\u00e2che n&#8217;est consid\u00e9r\u00e9e comme r\u00e9solue que si la solution g\u00e9n\u00e9r\u00e9e passe les tests de validation requis.<\/p>\n<p>Pour en savoir plus sur notre configuration d&#8217;environnement et la collecte de donn\u00e9es, consultez la <a href=\"https:\/\/kotlinlang.org\/benchmark\/methodology\/\" target=\"_blank\" rel=\"noopener\">page M\u00e9thodologie<\/a>.<\/p>\n<h3 class=\"wp-block-heading\">Premiers r\u00e9sultats<\/h3>\n<p>Les premi\u00e8res \u00e9valuations montrent que les principaux agents de programmation peuvent accomplir une grande partie des t\u00e2ches actuelles du Kotlin Benchmark. Ces r\u00e9sultats refl\u00e8tent la premi\u00e8re it\u00e9ration publique du benchmark et n&#8217;incluent pas encore les derni\u00e8res versions de mod\u00e8les. Nous travaillons d\u00e9j\u00e0 sur la deuxi\u00e8me it\u00e9ration et mettrons \u00e0 jour le classement au fur et \u00e0 mesure que de nouvelles \u00e9valuations seront ajout\u00e9es.<\/p>\n<p>Dans cette s\u00e9rie d&#8217;\u00e9valuations, le meilleur r\u00e9sultat provient de Claude Code avec Opus\u00a04.7 xhigh, qui a r\u00e9solu 90\u00a0t\u00e2ches sur 105, soit un taux de r\u00e9solution de 85,71\u00a0%. JetBrains Junie avec Opus 4.7 max (81,9\u00a0%) et Codex avec GPT\u00a05.5 xhigh (81,9\u00a0%) suivaient de pr\u00e8s.<\/p>\n<p>Vous trouverez le classement complet sur <a href=\"http:\/\/kotlinlang.org\/benchmark\" target=\"_blank\" rel=\"noopener\">kotlinlang.org\/benchmark<\/a>, o\u00f9 vous pouvez comparer les agents et les configurations en d\u00e9tail.<\/p>\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" class=\"wp-image-720156\" src=\"https:\/\/blog.jetbrains.com\/wp-content\/uploads\/2026\/07\/SWE-Benchmark-Infographics-1920x1080-1.png\" alt=\"\" width=\"1920\" height=\"1080\" \/>\n<figcaption class=\"wp-element-caption\">Les r\u00e9sultats affich\u00e9s ici refl\u00e8tent la premi\u00e8re it\u00e9ration publique du Kotlin Benchmark. Le classement sera mis \u00e0 jour \u00e0 mesure que de nouveaux mod\u00e8les seront \u00e9valu\u00e9s.<\/figcaption>\n<\/figure>\n<p>Pour les \u00e9quipes qui souhaitent \u00e9valuer des agents de programmation, le benchmark fournit un cadre de r\u00e9f\u00e9rence commun pour comparer les configurations sur des t\u00e2ches en Kotlin, au lieu de se contenter des affirmations des fournisseurs. Les scores sont destin\u00e9s \u00e0 d\u00e9gager des tendances, et ne constituent pas une garantie pour toutes les bases de code. Les r\u00e9sultats concrets d\u00e9pendent de votre architecture, de vos API internes, de vos normes de programmation, de vos outils et de votre processus de validation.<\/p>\n<h3 class=\"wp-block-heading\">Nouveaut\u00e9s \u00e0 venir<\/h3>\n<p>Nous privil\u00e9gions une approche ouverte, c&#8217;est pourquoi nous avons b\u00e2ti ce benchmark sur l&#8217;infrastructure open source Multi-SWE-bench et rendu publics tous les jeux de donn\u00e9es et ensembles de tests.<\/p>\n<p>Nous traitons les benchmarks comme un pipeline continu d&#8217;\u00e9valuation de la qualit\u00e9. \u00c0 l&#8217;avenir, nous pr\u00e9voyons d&#8217;\u00e9tendre le framework aux \u00e9l\u00e9ments suivants\u00a0:<\/p>\n<ul class=\"wp-block-list\">\n<li><strong>Une couverture plus large de l&#8217;\u00e9cosyst\u00e8me Kotlin :<\/strong> Nous souhaitons que l&#8217;ensemble des t\u00e2ches refl\u00e8te davantage les usages r\u00e9els de Kotlin, notamment dans des domaines tels qu&#8217;Android et Kotlin Multiplatform, tout en couvrant un \u00e9ventail plus large de niveaux de difficult\u00e9.<\/li>\n<li><strong>Davantage de crit\u00e8res d&#8217;\u00e9valuation :<\/strong> R\u00e9ussir les tests est un indicateur pertinent de la validit\u00e9 d&#8217;une solution, mais ce n&#8217;est que l&#8217;un des aspects de l&#8217;\u00e9valuation d&#8217;un agent. Les it\u00e9rations futures prendront en compte le co\u00fbt, les performances, la facilit\u00e9 de maintenance et la qualit\u00e9 du code.<\/li>\n<li><strong>Davantage d&#8217;agents et de configurations de mod\u00e8les\u00a0: <\/strong>nous pr\u00e9voyons d&#8217;\u00e9valuer davantage d&#8217;agents commerciaux, de configurations agent-mod\u00e8le et de mod\u00e8les \u00e0 pond\u00e9ration ouverte, afin que les \u00e9quipes puissent comparer une plus large palette de configurations.<\/li>\n<\/ul>\n<p>Le benchmark est ouvert : vous pouvez consulter les t\u00e2ches, comparer les r\u00e9sultats et nous faire part des sc\u00e9narios Kotlin que nous devrions int\u00e9grer par la suite.<\/p>\n<p><em>Auteur de l&#8217;article original en anglais<\/em> :<\/p>\n\n    <div class=\"about-author \">\n        <div class=\"about-author__box\">\n            <div class=\"row\">\n                <div class=\"about-author__box-img\">\n                    <img decoding=\"async\" src=\"https:\/\/blog.jetbrains.com\/wp-content\/uploads\/2021\/08\/photo_2021-08-03_15-27-43-200x200.jpg\" width=\"200\" height=\"200\" alt=\"Alyona Chernyaeva\" loading=\"lazy\"  class=\"avatar avatar-200 wp-user-avatar wp-user-avatar-200 photo avatar-default\">\n                <\/div>\n                <div class=\"about-author__box-text\">\n                                            <h4>Alyona Chernyaeva<\/h4>\n                                                        <\/div>\n            <\/div>\n        <\/div>\n    <\/div>\n","protected":false},"author":813,"featured_media":725930,"comment_status":"closed","ping_status":"closed","template":"","categories":[8899],"tags":[],"cross-post-tag":[8396,6355],"class_list":["post-725929","kotlin","type-kotlin","status-publish","has-post-thumbnail","hentry","category-ai","cross-post-tag-ai","cross-post-tag-kotlin"],"acf":[],"_links":{"self":[{"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/kotlin\/725929","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/kotlin"}],"about":[{"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/types\/kotlin"}],"author":[{"embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/users\/813"}],"replies":[{"embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/comments?post=725929"}],"version-history":[{"count":8,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/kotlin\/725929\/revisions"}],"predecessor-version":[{"id":725962,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/kotlin\/725929\/revisions\/725962"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/media\/725930"}],"wp:attachment":[{"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/media?parent=725929"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/categories?post=725929"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/tags?post=725929"},{"taxonomy":"cross-post-tag","embeddable":true,"href":"https:\/\/blog.jetbrains.com\/fr\/wp-json\/wp\/v2\/cross-post-tag?post=725929"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}