Kotlin logo

Kotlin

A concise multiplatform language developed by JetBrains

AI

AI 코딩 에이전트 평가를 위한 Kotlin Benchmark 공개

Read this post in other languages:

에이전틱 코딩 벤치마크가 실제 소프트웨어 개발 환경에 한층 가까워지고 있습니다. Kotlin 개발 팀에게 가장 중요한 질문은 AI 에이전트가 문제를 파악하는 단계부터 검증을 통과하는 해결책을 내는 단계까지, Kotlin 작업을 처음부터 끝까지 얼마나 안정적으로 수행할 수 있는가입니다.

JetBrains는 이러한 답을 구하기 위한 첫걸음으로, Kotlin 소프트웨어 엔지니어링 작업에서 AI 코딩 에이전트를 평가하기 위한 공식 벤치마크인 Kotlin Benchmark를 공개합니다. 목표는 개발자들이 Kotlin에서 다양한 에이전트의 성능을 신뢰할 수 있는 공개된 방식으로 평가하고, 일상적인 개발 업무에 더 가까운 작업을 기준으로 다양한 에이전트 구성의 성능을 비교할 수 있도록 하는 것입니다.

벤치마크 공개와 함께 GitHub에 벤치마크 자산을 공개하고, 평가 결과를 추적할 수 있는 공식 리더보드를 선보입니다.

GitHub에서 벤치마크 살펴보기

리더보드에서 첫 번째 결과 보기

Kotlin Benchmark의 작동 방식

Kotlin Benchmark의 첫 번째 공개 버전은 SWE-bench 방법론을 기반으로 하며, 저장소 수준의 Kotlin 소프트웨어 엔지니어링 작업에 중점을 둡니다.

Kotlin에는 이미 Kotlin_HumanEvalKotlin_QA를 비롯해 모델 중심의 평가 자산이 잘 갖춰져 있으며, 이를 통해 모델이 Kotlin의 구문과 핵심 개념을 얼마나 잘 이해하는지 평가할 수 있습니다. Kotlin Benchmark는 다른 측면에 초점을 맞춥니다. 즉, 기존 Kotlin 프로젝트에서 AI 코딩 에이전트가 검증된 소프트웨어 엔지니어링 작업을 얼마나 잘 수행할 수 있는지를 평가합니다.

이 데이터세트에는 활발하게 개발 중인 오픈 소스 저장소에서 수집한 엔지니어링 작업 105개가 포함되어 있습니다. 각 작업에서는 AI 에이전트가 실제 문제 설명을 해석하고, 프로젝트의 컨텍스트를 파악한 뒤, 정상적으로 동작하는 패치를 생성해야 합니다. 해결책은 컨테이너화된 환경에서 엄격하게 검증되며, 생성된 해결책이 필수 테스트 검증을 통과한 경우에만 해당 작업이 해결된 것으로 간주됩니다.

환경 구성과 데이터 수집에 관한 자세한 내용은 방법론 페이지에서 확인할 수 있습니다.

첫 번째 결과

첫 평가 결과에 따르면, 주요 코딩 에이전트는 현재 Kotlin Benchmark 작업의 상당수를 성공적으로 완료할 수 있는 것으로 나타났습니다. 이번 결과는 벤치마크의 첫 번째 공개 버전을 기반으로 한 것이며, 최신 모델 릴리스는 아직 반영되지 않았습니다. 현재는 두 번째 버전을 개발 중이며, 새로운 평가 결과가 추가되는 대로 리더보드를 업데이트할 예정입니다.

이번 평가에서는 Claude Code(Opus 4.7 xhigh)가 가장 뛰어난 성과를 기록했습니다. 전체 105개 작업 중 90개를 해결해 해결률 85.71%를 달성했습니다. 그 뒤를 JetBrains Junie(Opus 4.7 max, 81.9%)와 Codex(GPT 5.5 xhigh, 81.9%)가 근소한 차이로 이었습니다.

전체 리더보드는 kotlinlang.org/benchmark에서 확인할 수 있으며, 다양한 에이전트와 구성의 성능을 자세히 비교할 수 있습니다.

여기에 표시된 결과는 Kotlin Benchmark의 첫 번째 공개 버전을 기반으로 합니다. 리더보드는 새로운 모델의 평가가 추가되는 대로 계속 업데이트될 예정입니다.

코딩 에이전트를 평가하는 팀에게 이 벤치마크는 공급자의 주장에만 의존하지 않고, Kotlin 작업에서 다양한 에이전트 구성을 비교할 수 있는 공통 기준을 제공합니다. 이러한 점수는 모든 코드베이스에서의 성능을 보장하는 것이 아니라, 참고 지표로 활용하기 위한 것입니다. 실제 환경에서의 성능은 아키텍처, 내부 API, 코딩 표준, 개발 도구, 검증 프로세스에 따라 달라집니다.

다음 단계

JetBrains는 개방적인 접근 방식을 중요하게 생각합니다. 그래서 이 벤치마크를 오픈 소스인 Multi-SWE-bench 인프라를 기반으로 구축했으며, 모든 데이터세트와 테스트 도구를 공개했습니다.

JetBrains는 벤치마크를 지속적인 품질 측정 파이프라인으로 보고 있습니다. 앞으로 다음과 같은 부분에서 프레임워크를 확장해 나갈 계획입니다.

  • 더 폭넓은 Kotlin 에코시스템 지원: Android와 Kotlin Multiplatform을 비롯해 실제로 Kotlin이 활용되는 다양한 영역을 더 잘 반영하도록 작업 구성을 확대하고, 다양한 난이도의 작업을 폭넓게 포함할 계획입니다.
  • 더 다양한 평가 메트릭: 테스트 통과는 정확성을 판단하는 데 유용한 지표이지만, 에이전트를 평가하는 기준 중 하나일 뿐입니다. 향후 버전에서는 비용, 성능, 유지 관리 편의성, 코드 품질도 함께 살펴볼 예정입니다.
  • 더 다양한 에이전트와 모델 구성: 더 많은 상용 에이전트, 에이전트 및 모델 구성, 그리고 오픈 웨이트 모델을 평가하여 더 다양한 구성을 비교할 수 있도록 할 계획입니다.

이 벤치마크는 공개되어 있으므로, 작업 내용을 직접 살펴보고 결과를 비교하며, 앞으로 어떤 Kotlin 상황을 추가로 다뤄야 할지 의견을 보내실 수 있습니다.

게시물 원문 작성자

Alyona Chernyaeva

Alyona Chernyaeva