Kotlin logo

Kotlin

A concise multiplatform language developed by JetBrains

AI

为 AI 编码智能体推出 Kotlin Benchmark

Read this post in other languages:

智能体化编码基准正逐步贴近真实软件开发。对于 Kotlin 团队而言,最重要的问题是 AI 智能体完成端到端 Kotlin 任务(从读取问题到生成可以通过验证的解决方案)的可靠性如何。

作为解决这一问题的第一步,我们发布了 Kotlin Benchmark,Kotlin Benchmark 是 JetBrains 用于评估 AI 编码智能体在处理 Kotlin 软件工程任务时表现的官方基准。我们的目标是为开发者提供一种可信、公开的方式来评估不同智能体在 Kotlin 上的表现,并使用更贴近日常开发工作的任务来比较不同的智能体设置。

伴随基准的发布,我们也将在 GitHub 上发布基准资源,并推出官方排行榜来跟踪评估结果。

在 GitHub 上探索基准

查看排行榜上的首批结果

Kotlin Benchmark 的运作方式

Kotlin Benchmark 的首个公开版本基于 SWE-bench 方法,且侧重于仓库级 Kotlin 软件工程任务。

Kotlin 已拥有强大的侧重于模型的评估资源,包括 Kotlin_HumanEvalKotlin_QA,这些评估资源可以帮助衡量模型对语言的语法与核心概念的理解。而 Kotlin Benchmark 则聚焦于另一层面:AI 编码智能体在现有 Kotlin 项目中完成已验证软件工程任务的能力。

数据集包含 105 个源自活跃开源仓库的工程任务。每项任务都要求 AI 智能体解读真实问题描述、梳理项目上下文,以及生成可用补丁。解决方案会在容器化环境中进行严格验证,只有生成的解决方案通过要求的测试验证,该任务才会被标记为已解决。

要详细了解我们的环境设置和数据采集,请参阅方法页面。

首批结果

首轮评估表明,领先的编码智能体可以完成当前 Kotlin Benchmark 任务中的大部分。这些结果反映了基准的首个公开版本,尚未包含最新发布的模型。我们已着手开发第二版基准,并将随着新增评估结果的加入更新排行榜。

在此次运行中,最好的结果来自搭配 Opus 4.7 xhigh 的 Claude Code,它解决了 105 个任务中的 90 个,解决率达到 85.71%。搭配 Opus 4.7 max 的 JetBrains Junie(解决率 81.9%)和搭配 GPT 5.5 xhigh 的 Codex(解决率 81.9%)紧随其后。

完整排行榜可以在 kotlinlang.org/benchmark 查看,您可以通过此排行榜详细比较不同智能体和配置的表现。

此处给出的结果反映了 Kotlin Benchmark 的首个公开版本的运行结果。排行榜将随着新增模型评估的加入进行更新。

对于评估编码智能体的团队,该基准提供了统一的参考框架‌,用于比较不同设置在 Kotlin 任务上的表现,而无需仅依赖厂商的说法。这些分数旨在作为参考,而非对每一个代码库的保证。实际结果取决于您的架构、内部 API、编码标准、工具和验证流程。

接下来有什么值得期待的?

我们重视开放的方式,因此,我们基于开源 Multi-SWE-bench 基础架构构建了此基准,并公开发布所有数据集和测试工具。

我们将基准视为持续的质量评估流水线。未来,我们计划在以下几个领域扩展该框架:

  • 扩展 Kotlin 生态系统覆盖范围:我们希望任务组合更贴合 Kotlin 的实际应用场景,包括 Android、Kotlin Multiplatform 等领域的任务,同时覆盖更广泛的任务难度级别。
  • 增加评估指标:通过测试只是衡量正确性的参考,但这只是智能体评估的其中一环。后续版本将注重成本、性能、可维护性和代码质量。
  • 增加智能体和模型设置:我们计划评估更多商业智能体、智能体-模型配置,以及开放权重模型,以便团队能够比较更广泛的设置。

该基准是开放的,因此您可以检查任务、比较结果,并告诉我们后续应涵盖哪些 Kotlin 场景。

Alyona Chernyaeva

Alyona Chernyaeva