智能体化编码基准正逐步贴近真实软件开发。对于 Kotlin 团队而言,最重要的问题是 AI 智能体完成端到端 Kotlin 任务(从读取问题到生成可以通过验证的解决方案)的可靠性如何。
作为解决这一问题的第一步,我们发布了 Kotlin Benchmark,Kotlin Benchmark 是 JetBrains 用于评估 AI 编码智能体在处理 Kotlin 软件工程任务时表现的官方基准。我们的目标是为开发者提供一种可信、公开的方式来评估不同智能体在 Kotlin 上的表现,并使用更贴近日常开发工作的任务来比较不同的智能体设置。
伴随基准的发布,我们也将在 GitHub 上发布基准资源,并推…