PC für lokalen KI-Agenten Hermes: Modell, Kontext und VRAM
Aktie
Die meisten KI-Tools vergessen alles, sobald Sie das Fenster schließen. Hermes, der quelloffene autonome Agent von Nous Research, tut das Gegenteil: Er erinnert sich, lernt aus jeder Aufgabe und verbessert sich mit der Zeit. Und er kann vollständig auf Ihrem eigenen Rechner laufen, ohne API-Schlüssel, ohne Cloud, ohne Kosten pro Token.
Einen KI-Agenten lokal laufen zu lassen, ist etwas ganz anderes, als einen einfachen Chatbot zu betreiben. Ein Agent durchläuft Dutzende von Schritten, ruft Tools auf, liest Ergebnisse, entscheidet über den weiteren Verlauf und behält diesen gesamten Kontext während der gesamten Sitzung im Speicher. Dies stellt präzise Hardware-Anforderungen, die oft missverstanden werden.
Dieser Leitfaden erklärt, was der Hermes-Agent ist, warum der Kontext der wahre entscheidende Faktor ist, welches Modell ihm zugeordnet werden sollte und welche Maschine am besten geeignet ist, um ihn problemlos zu Hause zu betreiben.
Was genau ist Hermes?
Man muss zwei Dinge unterscheiden, die denselben Namen tragen und oft verwechselt werden.
Einerseits gibt es das Hermes Agent Framework: einen quelloffenen autonomen Agenten unter MIT-Lizenz, entwickelt von Nous Research. Es ist die Software, die Aufgaben, Speicher und Tools orchestriert. Andererseits gibt es die Hermes-Modelle (die Hermes 4-Serie): Sprachmodelle, die vom selben Team speziell für agentisches Verhalten verfeinert wurden.
Der entscheidende Punkt: Das Hermes-Framework ist modellunabhängig. Es funktioniert mit jeder Engine, die eine API im OpenAI-Format bereitstellt. Sie können es also mit einem Hermes-Modell, aber auch mit Qwen, Gemma oder jedem anderen leistungsstarken lokalen Modell füttern.
Was das Hermes Framework leisten kann
Persistenter Speicher
Hermes behält den Kontext zwischen den Sitzungen bei. Es fängt nicht bei jedem Start von Null an: Es erinnert sich an Ihre Aufgaben, Ihre Vorlieben und das, was es bereits erledigt hat.
Mehr als 70 integrierte Fähigkeiten
Websuche, Dateimanipulation, Codeausführung, Nachrichtenversand: Hermes enthält Dutzende von gebrauchsfertigen Tools, die beliebig erweiterbar sind.
Selbstverbesserung
Aus erfolgreich abgeschlossenen Aufgaben erstellt Hermes wiederverwendbare Fähigkeitskarten, die in Markdown gespeichert werden und bei ähnlichen Situationen erneut geladen werden. Es bewertet sich regelmäßig selbst.
Geplante Automatisierungen
Hermes kann wiederkehrende Aufgaben nach einem Zeitplan ausführen: Überwachung, Berichte, Überwachung, ohne Ihr Eingreifen.
Verbindung zu Messaging-Diensten
Telegram, Discord, Slack, WhatsApp, Signal, E-Mail: Sie steuern Ihren Agenten über Ihre gewohnten Tools, und er antwortet Ihnen dort, wo Sie sind.
Modellunabhängig
Jede OpenAI-kompatible Engine funktioniert. Der Lernzyklus funktioniert identisch mit einem lokalen Modell auf Ihrem Computer.
Der wahre entscheidende Faktor: der Kontext, nicht die Modellgröße
Dies ist der häufigste Fehler, wenn man eine Maschine für einen Agenten dimensioniert. Man denkt zuerst an die Modellgröße. In Wirklichkeit ist für einen Agenten das Kontextfenster der treibende Faktor für den Speicherbedarf.
Hermes verbraucht den Kontext aggressiv. Jeder Tool-Aufruf, jedes beobachtete Ergebnis, jeder Denkprozessschritt sammelt sich im Kontext an. Die offizielle Dokumentation schreibt ein Minimum von 64.000 Token vor, und Modelle mit einem kleineren Fenster werden beim Start einfach abgelehnt.
Konkret kann ein Modell, das für einfachen Chat 8 GB benötigt, 12 GB oder mehr erfordern, sobald das 64K-Fenster aktiviert ist. Und je mehr Spielraum Sie für mehrstufige Überlegungen (128K und darüber hinaus) wünschen, desto höher steigt der VRAM.
Welches Modell sollte man lokal mit Hermes verbinden?
Das wichtigste Kriterium für einen Agenten ist nicht das allgemeine Wissen des Modells, sondern die Zuverlässigkeit des Tool-Calling: seine Fähigkeit, die richtigen Tools aufzurufen, Antworten zu lesen und sich in langen Schleifen nicht zu verlieren. Hier sind die besten Optionen im Jahr 2026, nach VRAM-Budget.
| VRAM-Budget | Empfohlenes Modell | Warum | 64K Kontext |
|---|---|---|---|
| 8 GB | Qwen3 8B | Bestes Tool-Calling seiner Klasse | 10 bis 12 GB, knapp |
| 16 GB | Qwen 3.5 / 3.6 27B | Zuverlässiges Tool-Calling, gute Argumentation | Komfortabel |
| 16 GB | Gemma 4 26B MoE | Bestes Gleichgewicht zwischen Geschwindigkeit und Qualität | Komfortabel |
| 24 GB | Hermes 4.3 36B | Für Agenten optimiert, neutral, bis zu 512K Kontext | Großer Spielraum |
| 24 GB | Hermes 4 35B-A3B (MoE) | Hält eine 100-Schritte-Aufgabe ohne Abweichung | 128K möglich |
Hermes lokal installieren, Schritt für Schritt
Auf einem Rechner mit einer aktuellen NVIDIA-Karte ist der Prozess einfach. Hermes basiert auf Ollama als lokaler Inferenz-Engine.
- Installieren Sie Ollama (aktuelle Version) und laden Sie das gewünschte Modell herunter.
- Konfigurieren Sie das Modell mit einem Kontextfenster von mindestens 64K Tokens.
- Installieren Sie das Hermes Agent Framework (aktuelle Python-Version erforderlich).
- Zeigen Sie Hermes auf Ihre lokale Ollama-Instanz (OpenAI-kompatibler Endpunkt).
- Verbinden Sie Ihre Messaging-Dienste (Telegram, Discord, E-Mail) und starten Sie Ihre erste Aufgabe.
# Beispiel: Ein 27B-Modell mit 64K Kontext unter Ollama vorbereiten ollama pull qwen3.6:27b # Eine Variante mit erweitertem Kontext für Hermes erstellen cat > Modelfile <<'EOF' FROM qwen3.6:27b PARAMETER num_ctx 65536 PARAMETER temperature 0.6 PARAMETER top_p 0.95 EOF ollama create qwen3.6-agent -f Modelfile # Hermes zeigt dann auf http://localhost:11434/v1
Warum Ihren Agenten lokal statt in der Cloud betreiben?
Ein autonomer Agent, der mit Ihren Dateien, Messaging-Diensten und Tools verbunden ist, verarbeitet naturgemäß sensible Daten. Ihn lokal zu betreiben, bietet entscheidende Vorteile.
- Vertraulichkeit. Ihre Daten, Dateien und Konversationen verlassen niemals Ihren Computer.
- Keine Nutzungskosten. Ein Agent, der kontinuierlich läuft und Aufgaben nacheinander erledigt, wäre mit einer API teuer. Lokal ist die Nutzung unbegrenzt, ohne Abrechnung pro Token.
- Verfügbarkeit. Keine Quoten, keine Anforderungslimits, keine Dienstausfälle seitens des Anbieters.
- Volle Kontrolle. Sie wählen das Modell, die Tools, die zugänglichen Daten und behalten die Kontrolle über die gesamte Umgebung.
- Kontinuierlicher Betrieb. Ein lokaler Agent kann Tag und Nacht laufen, für Überwachungs- oder geplante Automatisierungsaufgaben, ohne zusätzliche Kosten.
Welche Maschine für einen lokalen Hermes-Agenten?
Die richtige Dimensionierung hängt vom gewünschten Modell und dem gewünschten Kontextfenster ab. Denken Sie daran: der 64K-Kontext, oder sogar 128K, ist der wahre Treiber des VRAM-Bedarfs. Hier sind unsere angepassten Workstations, die in Auriol (13390) montiert und in die gesamte EU geliefert werden, auf Wunsch mit Ollama und der Agenten-Umgebung vorkonfiguriert.
CoreAI 16 — RTX 5060 Ti 16 GBHermes + 27B Modell in 64K. Der ideale Einstiegspunkt. 1 703 €
CoreAI 32 — RTX 5070 Ti 16 GBReaktionsschneller Agent, komfortabler Kontext, Ryzen 9 für Tool-Use. 2 442 €
CoreAI 64 — RTX 5090 32 GBDedizierte Hermes 4 Modelle, 128K Kontext, lange Agenten-Schleifen. 6 042 €
Mini KI-Server NVIDIA GB10Agent im kontinuierlichen 24/7-Betrieb, sehr langer Kontext, 128 GB Unified Memory. 3 999 €
Kurz gesagt
Ist Hermes Agent kostenlos?
Ja, quelloffen unter MIT-Lizenz. Ollama und die offenen Modelle (Qwen, Gemma, Hermes) sind ebenfalls kostenlos. Die einzigen Kosten sind Hardware und Strom.
Was ist der wahre Dimensionierungsfaktor?
Das Kontextfenster. Hermes benötigt mindestens 64K Tokens, was den VRAM viel mehr in die Höhe treibt als die Modellgröße allein.
Wie viel VRAM ist mindestens erforderlich?
8 GB für ein 8B-Modell in 64K (knapp), 16 GB für ein komfortables 27B-Modell, 24 bis 32 GB für die dedizierten Hermes 4-Modelle und 128K Kontext.
Welches Modell sollte man mit Hermes wählen?
Für den Anfang ein 27B-Modell wie Qwen 3.5/3.6 auf 16 GB. Für maximale Zuverlässigkeit bei langen Schleifen ein dichtes Modell anstelle eines MoE. Für fortgeschrittene Anwendungen die dedizierten Hermes 4-Modelle.
Benötigt man eine Internetverbindung?
Nein für die Inferenz: Alles läuft lokal. Eine Verbindung ist nur für Funktionen nützlich, die das Web abfragen, wenn Sie diese aktivieren.
Kann es kontinuierlich laufen?
Ja. Ein lokaler Agent kann Tag und Nacht für Überwachungs- und Automatisierungsaufgaben laufen. Der Mini-Server GB10 ist für diese Art des kontinuierlichen Betriebs konzipiert.




