Agentic AI Coding JetBrains AI New Products

Junie kann jetzt komplett auf Ihrem Mac ausgeführt werden – ohne Credits, ohne Cloud

Read this post in other languages:

Unser erster Schritt in Richtung lokaler Coding-Agents 

Junie kann schon seit einiger Zeit lokale Modell-Runtimes einbinden. Sie verweisen Junie einfach auf Ollama oder LM Studio, laden Sie ein lokales Modell, und schon greift der Agent darauf zu. Viele nutzen diese Möglichkeit bereits. Dazu müssen Sie allerdings das passende Modell auswählen, die Einstellungen optimieren und eine Menge manuelle Konfigurationsarbeit leisten. Zudem sind kleinere Modelle nur für eine begrenzte Auswahl einfacher Aufgaben geeignet.

Genau diese Arbeit nehmen wir Ihnen jetzt ab. Das neue Junie Local bringt ein Modell mit, das wir speziell für unsere Agent-Schleife ausgewählt und optimiert haben, installiert es mit einem einzigen Befehl und führt es vollständig lokal auf Ihrem Computer aus. Keine Token, keine Kontingente und keine Übertragung von Code ins Internet. Und die Nutzung ist kostenlos.

Ein einziger Befehl, keine weitere Konfiguration

Geben Sie in Junie einfach /local ein. Junie lädt das Modell herunter, startet den lokalen Server und nimmt die Umstellung automatisch vor. Sie müssen weder ein JSON-Profil schreiben noch vorab eine Runtime installieren oder einen Endpunkt angeben.

Als Modell kommt Qwen3.6-27B in 4-Bit-Quantisierung zum Einsatz. Der Download umfasst ca. 20 GB, und Sie benötigen einen Mac mit M5-Chip und 64 GB RAM. Sobald der Download abgeschlossen ist, läuft alles lokal: Prompts, Quellcode und Diffs verlassen zu keinem Zeitpunkt Ihren Rechner.

Ihre bisherige Konfiguration wird nahtlos übernommen. Der Plan-Modus, Live-Prompting, Richtlinien, Skills und /Befehle funktionieren weiter wie gewohnt. Nur die Engine ist neu – der Agent bleibt gleich.

Was wir bei der Performance-Optimierung gelernt haben

Bei Benchmarks steht meist die Generierungsgeschwindigkeit im Mittelpunkt. Bei einem Coding-Agent ist dieser Wert jedoch irreführend, denn der Großteil der Zeit entfällt auf das sogenannte Prefill – den Vorbereitungsschritt, bei dem das Modell Dateien einliest, um die Ausgangslage zu verstehen. Die entscheidenden Performancegewinne wurden durch die Optimierung des Prefill-Vorgangs erzielt – und genau deshalb setzt Junie Local mindestens einen Apple-M5-Chip voraus: Der Neural Accelerator des M5 bietet 8-Bit-Arithmetikbefehle, die dem M4 fehlen – damit konnten wir den Prefill-Durchsatz um rund 40% erhöhen. Wir werden diesen Patch als Pull-Request für MLX-VLM einreichen.

Wir haben uns außerdem bewusst für Qwen3.6 und gegen die neuere Version 3.8 entschieden. Qwen3.8 funktioniert nur mit aktiviertem Reasoning zuverlässig, wodurch sich die Bearbeitungszeit der Aufgaben jedoch ungefähr vervierfacht. Auf aktuellen Macs ist 3.6 schlicht die bessere Wahl.

Hinzu kommen weitere Optimierungen wie eine aufgabenübergreifende Wiederverwendung des KV-Cache und spekulatives Decoding, das die Generierungsgeschwindigkeit annähernd verdoppelt. Die genauen technischen Details erfahren Sie hier: So haben wir das Modell Qwen 3.6 für unseren Agent Junie optimiert.

Wie gut funktioniert es?

Jedes Modell durchläuft bei uns ein proprietäres JetBrains-Testset, bevor es in Junie integriert wird. Das galt selbstverständlich auch für Junie Local. Die Ergebnisse von Qwen3.6-27B lagen auf Augenhöhe mit Sonnet 4.5 (bei einem Reasoning-Limit von 10.000 Token). GPT-5 erzielte bei „Medium“-Aufwand etwas bessere Werte.

Dabei ist der Kontext dieser Zahlen zu beachten: Wir liefern das lokale Modell mit komplett deaktiviertem Reasoning aus, da es in unseren Tests kaum Qualitätsvorteile brachte, aber zwei- bis dreimal so viele Token benötigte. Die Testergebnisse zeigen also die Leistung unseres lokalen Modells ohne Reasoning im Vergleich zu Cloud-Modellen mit aktiviertem Reasoning.

Im normalen Arbeitsalltag dürfte der Unterschied kaum auffallen. Bei komplexen Architekturüberlegungen hingegen sehr wohl.

Was sich ändert, wenn der Tokenverbrauch irrelevant ist

Benchmarks zeigen, ob ein Modell eine Aufgabe lösen kann. Sie zeigen jedoch nicht, was passiert, wenn diese Aufgaben kostenlos ausgeführt werden.

Junie bietet bereits seit Längerem Möglichkeiten zur Kostenkontrolle: etwa durch Planung mit einem leistungsstarken Modell und Umsetzung mit einem günstigeren Modell. Junie Local senkt die Kosten jetzt auf null. Wenn Iterationen nichts mehr kosten, können Sie auch Aufgaben an den Agent übergeben, für die der Einsatz von Credits zuvor unwirtschaftlich war. Junie Local ist ideal für:

  • Dateiübergreifende Refactorings und Umbenennungen, die den Kostenaufwand bisher nicht wert waren.
  • Lücken in der Test-Coverage, die Sie in den letzten Monaten aufgeschoben haben.
  • Aktualisierungen von Abhängigkeiten und Framework-Migrationen.
  • Einarbeitung in ein neu übernommenes Repository.

Für langwierige, monotone Fleißarbeit sind Agents wie geschaffen. Wer jedoch ständig sein Guthaben im Blick behalten muss, delegiert solche Tätigkeiten oft nicht.

Für manche Teams ist der Datenschutz, den Junie Local bietet, der einzige Grund, diesen Blogartikel zu lesen. Sie müssen keine Datenschutzrichtlinien von Drittanbietern prüfen, weil schlicht kein externer Anbieter beteiligt ist. Bei Projekten mit strengen Kunden-NDAs lautet die Antwort nun nicht mehr „Wir haben den Dienstleister auditiert“, sondern schlicht „Es sind keine externen Anbieter beteiligt“.

Außerdem wird keine Internetverbindung benötigt. Sobald die Modellgewichte auf der Festplatte liegen, funktioniert Junie Local im Flugzeug genauso wie am Schreibtisch.

Ja, die Systemanforderungen sind hoch

Wir wissen, dass ein M5-Mac mit 64 GB RAM eine große Hürde darstellt. Es ist klar: Vielen Leser*innen dieses Blogartikels bleibt Junie Local damit vorerst verwehrt.

Das ist schlicht der Hardwareaufwand, der heute nötig ist, um ein 27B-Modell reibungslos auszuführen, und wir arbeiten mit Hochdruck daran, diese Hürde zu senken. Wir möchten den RAM-Bedarf verringern, mehr Hardware unterstützen und den gesamten Stack weiter optimieren. Sollten die hohen Anforderungen Ihrem Test von Junie Local noch im Weg stehen: Wir setzen alles daran, die Einstiegsvoraussetzungen zu senken.

Das ist erst der Anfang

Ein Modell, eine Chipfamilie, eine Plattform. Wir haben den Fokus zunächst bewusst eng gewählt: Ein einziges Modell optimal auf den gesamten Stack abzustimmen bringt mehr, als viele Modelle nur halbherzig zu unterstützen.

Wir haben bei den Macs angefangen, planen aber weit über sie hinaus. Wir verfügen bereits über funktionierende Prototypen für DGX Spark und RTX 5090 und evaluieren Grafikkarten mit 24 GB Speicher. Auf einer dedizierten GPU verhält sich das Prefill grundlegend anders, wodurch sich ein Großteil der Optimierungsarbeit auf diese Hardwarearchitektur verlagert.

Teilen Sie uns gerne mit, für welche Plattformen Sie sich als Nächstes Unterstützung wünschen.

Erste Schritte

Junie Local ist völlig kostenlos – ohne Registrierung, ohne Abonnement, ohne Credits und ohne Kreditkarte.

Öffnen Sie Junie, geben Sie /local ein und lassen Sie den Agent eine Aufgabe erledigen, die Sie bisher aufgeschoben haben. Geben Sie uns anschließend Feedback: Was hat nicht geklappt, was hat Sie positiv überrascht und welche Funktionen wünschen Sie sich als Nächstes? Jedes Detail von Junie basiert auf diesem Feedback, und auch Junie Local ist da keine Ausnahme.

Autor des ursprünglichen Blogposts

Dmitry Savelev

Dmitry Savelev

Discover more