Agentic AI Coding JetBrains AI New Products

Junie 现在可以完全在 Mac 上运行 – 无需消耗点数,也无需在云端运行

Read this post in other languages:

我们迈向设备端编码智能体的第一步

Junie 提供连接本地模型运行时的功能已经有一段时间了。将其连接至 Ollama 或 LM Studio,加载本地模型,智能体即可基于该模型运行。已经有很多人在这样做。但这也意味着您必须选择模型、调整设置并完成大量手动设置,而小模型只能帮助处理有限的简单任务。

因此,我们为您完成了所有这些工作。推出 Junie Local:它随附我们针对自有智能体循环而选择并调试的模型,只需一条命令即可安装,并且完全在您的机器上运行。不消耗 token,无配额限制,代码也绝不会离开您的设备。而且完全免费。

一条命令,无需配置

在 Junie 中运行 /local。模型随即下载,本地服务器启动,Junie 会切换到本地模式。无需编写 JSON 配置文件,无需先安装运行时,也无需指定端点。

该模型是 4 位量化版 Qwen3.6-27B,下载文件大小约为 20 GB,您需要一台配备 64 GB RAM 的 M5 Mac。下载完成后,所有操作都在您的硬件上执行,因此提示、源代码和差异内容都会留在本地。

您现有的设置会沿用。计划模式、实时提示、准则、技能和您的 /commands 都会照常原来的方式运行。变的是引擎,智能体并没有改变。

我们在提速过程中学到的经验

所有人都会对生成速度进行基准测试。但对于编码智能体,这并不是应该追逐的指标,因为模型在读取文件梳理上下文逻辑时,大部分时间都用在了预填充上。优化预填充才会真正带来性能提升,这也是 Junie Local 要求最低配置为 Apple M5 的原因:M5 神经网络加速器拥有 M4 所不具备的 8 位算术指令,使用这些指令后,预填充吞吐量提高了约 40%。我们会将该补丁以 PR 的形式发送至 MLX-VLM。

我们还特意选择了 Qwen3.6,而不是较新的 3.8。为使 Qwen3.8 可靠运行,需要启用推理,而启用后,任务运行速度大约会慢四倍。在目前的 Mac 上,3.6 更胜一筹。

其中,它还有很多优势,包括跨任务重用 KV 缓存,以及让生成速度大致翻倍的推测解码设置。请点击此处阅读深度解读博文:我们如何针对 Junie 智能体优化 Qwen 3.6 模型

它的表现如何?

每个模型在用于 Junie 之前,我们都会使用 JetBrains 自己的私有测试集对其进行评估,Junie Local 也不例外。Qwen3.6-27B 的得分与 Sonnet 4.5(推理上限为 10,000 token)不相上下。中等推理强度的 GPT-5 得分略高。

需要说明的是得出这些数字的条件:我们提供的本地模型完全禁用了推理,因为测试发现,推理对质量提升的效果非常有限,却会消耗两到三倍的 token。因此,这些结果是在模型未启用推理的情况下得出的,与之对比的云端模型则启用了推理功能。

在日常工作中,您很可能察觉不到这种差距。但在复杂的架构推理任务中,您一定会感受到差异。

当一切都不再按量计费,会发生什么变化

基准测试可以告诉您模型是否可以完成工作。但它们不会告诉您,当这项工作可以免费完成时,会发生哪些变化。

成本效率一直是您可以在 Junie 中调节的变量:使用高性能模型进行规划,使用低成本模型实现。Junie Local 将成本降到了零。如果多进行一次迭代是免费的,对于那些平时您绝不会消耗点数去做的工作,现在也值得交给智能体来处理了。Junie Local 非常适合:

  • 过去不值得消耗点数进行的多文件重构和重命名。
  • 过去两个季度一直被您忽略的测试覆盖率缺口。
  • 依赖项升级和框架迁移。
  • 快速熟悉您接手的仓库。

耗时、重复而机械的工作正是智能体的用武之地,但只要您关注余额,就再也不会让智能体去干这些事了。

对一些团队而言,Junie Local 所能提供的隐私保护,就是他们阅读这篇博文的全部原因。无需审查供应商的数据政策,因为整个流程中没有供应商参与。如果您的工作受 NDA 约束,讨论重点就会从“我们已评估该提供商”转变为“没有任何提供商参与”。

即使完全没有网络,它也能正常工作。权重保存到磁盘后,无论您是在飞机上还是坐在办公桌前,Junie Local 的工作方式都完全相同。

是的,硬件要求很高

我们知道,要求设备为配备 64 GB RAM 的 M5 Mac 是一项比较高的要求。我们不会回避这一点,也清楚这会让很多阅读这篇帖子的用户无法体验 Junie Local。

这就是目前要顺畅运行 27B 模型所需的硬件成本,也是我们正全力降低的数字。我们的目标是降低最低内存要求、支持更多硬件,并进一步优化整个技术栈。如果过高的硬件要求让您暂时无法尝试 Junie Local,请放心,我们正在努力降低这些要求。

这只是第一步

一个模型,一个芯片系列,一个平台。我们从小范围入手,是因为在全技术栈调试一个模型,远好过勉强支持所有模型。

Mac 只是起点,并不是我们的全部计划。我们已经为 DGX Spark 和 RTX 5090 制作了可用原型,并在评估 24 GB 的显卡。预填充在独立 GPU 上的行为截然不同,因此大量优化工作会转向这类硬件。

如果您对下一个应支持的平台有任何想法,欢迎大家现在就向我们提出建议。

使用入门

Junie Local 完全免费 – 无需注册、无需订阅、不消耗点数,也无需提供银行卡。

打开 Junie,运行 /local,然后将您一直拖延的任务交给它。告诉我们哪里出了问题、哪些方面让您感到惊喜,以及您希望我们后续提供哪些功能。Junie 的每一项功能都源于这样的反馈循环,这次也不例外。

本博文英文原作者:

Dmitry Savelev

Dmitry Savelev