PC pour agent IA Hermes local : modèle, contexte et VRAM

PC für lokalen KI-Agenten Hermes: Modell, Kontext und VRAM

Die meisten KI-Tools vergessen alles, sobald Sie das Fenster schließen. Hermes, der quelloffene autonome Agent von Nous Research, tut das Gegenteil: Er erinnert sich, lernt aus jeder Aufgabe und verbessert sich mit der Zeit. Und er kann vollständig auf Ihrem eigenen Rechner laufen, ohne API-Schlüssel, ohne Cloud, ohne Kosten pro Token.

Einen KI-Agenten lokal laufen zu lassen, ist etwas ganz anderes, als einen einfachen Chatbot zu betreiben. Ein Agent durchläuft Dutzende von Schritten, ruft Tools auf, liest Ergebnisse, entscheidet über den weiteren Verlauf und behält diesen gesamten Kontext während der gesamten Sitzung im Speicher. Dies stellt präzise Hardware-Anforderungen, die oft missverstanden werden.

Dieser Leitfaden erklärt, was der Hermes-Agent ist, warum der Kontext der wahre entscheidende Faktor ist, welches Modell ihm zugeordnet werden sollte und welche Maschine am besten geeignet ist, um ihn problemlos zu Hause zu betreiben.


Was genau ist Hermes?

Man muss zwei Dinge unterscheiden, die denselben Namen tragen und oft verwechselt werden.

Einerseits gibt es das Hermes Agent Framework: einen quelloffenen autonomen Agenten unter MIT-Lizenz, entwickelt von Nous Research. Es ist die Software, die Aufgaben, Speicher und Tools orchestriert. Andererseits gibt es die Hermes-Modelle (die Hermes 4-Serie): Sprachmodelle, die vom selben Team speziell für agentisches Verhalten verfeinert wurden.

Der entscheidende Punkt: Das Hermes-Framework ist modellunabhängig. Es funktioniert mit jeder Engine, die eine API im OpenAI-Format bereitstellt. Sie können es also mit einem Hermes-Modell, aber auch mit Qwen, Gemma oder jedem anderen leistungsstarken lokalen Modell füttern.

Warum Hermes Aufsehen erregt hat: Das schlecht gehütete Geheimnis offener Modelle ist, dass die meisten auf Konversationsdaten trainiert werden – Fragen-Antworten, Zusammenfassungen, Textverfassung. Agentisches Verhalten (Beschreibung eines Tools lesen, entscheiden, es aufzurufen, JSON-Antwort analysieren, nächste Aktion wählen) ist dort sehr wenig vertreten. Hermes wurde speziell auf realen agentischen Spuren trainiert. Es ist einer der ersten lokalen Agenten, der eine hundertstufige Suchaufgabe ohne Abweichungen bewältigen kann.


Was das Hermes Framework leisten kann

Persistenter Speicher

Hermes behält den Kontext zwischen den Sitzungen bei. Es fängt nicht bei jedem Start von Null an: Es erinnert sich an Ihre Aufgaben, Ihre Vorlieben und das, was es bereits erledigt hat.

Mehr als 70 integrierte Fähigkeiten

Websuche, Dateimanipulation, Codeausführung, Nachrichtenversand: Hermes enthält Dutzende von gebrauchsfertigen Tools, die beliebig erweiterbar sind.

Selbstverbesserung

Aus erfolgreich abgeschlossenen Aufgaben erstellt Hermes wiederverwendbare Fähigkeitskarten, die in Markdown gespeichert werden und bei ähnlichen Situationen erneut geladen werden. Es bewertet sich regelmäßig selbst.

Geplante Automatisierungen

Hermes kann wiederkehrende Aufgaben nach einem Zeitplan ausführen: Überwachung, Berichte, Überwachung, ohne Ihr Eingreifen.

Verbindung zu Messaging-Diensten

Telegram, Discord, Slack, WhatsApp, Signal, E-Mail: Sie steuern Ihren Agenten über Ihre gewohnten Tools, und er antwortet Ihnen dort, wo Sie sind.

Modellunabhängig

Jede OpenAI-kompatible Engine funktioniert. Der Lernzyklus funktioniert identisch mit einem lokalen Modell auf Ihrem Computer.


Der wahre entscheidende Faktor: der Kontext, nicht die Modellgröße

Dies ist der häufigste Fehler, wenn man eine Maschine für einen Agenten dimensioniert. Man denkt zuerst an die Modellgröße. In Wirklichkeit ist für einen Agenten das Kontextfenster der treibende Faktor für den Speicherbedarf.

Hermes verbraucht den Kontext aggressiv. Jeder Tool-Aufruf, jedes beobachtete Ergebnis, jeder Denkprozessschritt sammelt sich im Kontext an. Die offizielle Dokumentation schreibt ein Minimum von 64.000 Token vor, und Modelle mit einem kleineren Fenster werden beim Start einfach abgelehnt.

Die entscheidende Einschränkung: Hermes benötigt mindestens 64K Tokens Kontext. Dieser Kontext befindet sich im GPU-Speicher, zusätzlich zum Modellgewicht. Es ist dieser Kontext-Cache (der KV-Cache), der den benötigten VRAM in die Höhe treibt, viel mehr als das Modell selbst. Eine Maschine für einen Agenten zu dimensionieren, ohne den Kontext zu berücksichtigen, führt systematisch zu Enttäuschungen.

Konkret kann ein Modell, das für einfachen Chat 8 GB benötigt, 12 GB oder mehr erfordern, sobald das 64K-Fenster aktiviert ist. Und je mehr Spielraum Sie für mehrstufige Überlegungen (128K und darüber hinaus) wünschen, desto höher steigt der VRAM.


Welches Modell sollte man lokal mit Hermes verbinden?

Das wichtigste Kriterium für einen Agenten ist nicht das allgemeine Wissen des Modells, sondern die Zuverlässigkeit des Tool-Calling: seine Fähigkeit, die richtigen Tools aufzurufen, Antworten zu lesen und sich in langen Schleifen nicht zu verlieren. Hier sind die besten Optionen im Jahr 2026, nach VRAM-Budget.

VRAM-Budget Empfohlenes Modell Warum 64K Kontext
8 GB Qwen3 8B Bestes Tool-Calling seiner Klasse 10 bis 12 GB, knapp
16 GB Qwen 3.5 / 3.6 27B Zuverlässiges Tool-Calling, gute Argumentation Komfortabel
16 GB Gemma 4 26B MoE Bestes Gleichgewicht zwischen Geschwindigkeit und Qualität Komfortabel
24 GB Hermes 4.3 36B Für Agenten optimiert, neutral, bis zu 512K Kontext Großer Spielraum
24 GB Hermes 4 35B-A3B (MoE) Hält eine 100-Schritte-Aufgabe ohne Abweichung 128K möglich
Das empfohlene Paar für den Start: Hermes Agent + ein 27B-Modell wie Qwen 3.5/3.6 auf einer 16-GB-Karte. Dies ist der beste Gleichgewichtspunkt zwischen Zuverlässigkeit, Geschwindigkeit und Budget. Um die dedizierten Hermes 4-Modelle und lange Kontextfenster voll auszunutzen, wechseln Sie zu 24 oder 32 GB.
Ein ehrliches Wort zu MoE-Varianten. Mixture-of-Experts-Modelle wie der 35B-A3B sind schnell, aber Community-Rückmeldungen zeigen, dass sie bei sehr langen Agenten-Schleifen Tool-Aufrufe wiederholen oder überspringen können. Dichte Modelle (27B) sind bei diesen Aufgaben oft gleichmäßiger. Wenn Zuverlässigkeit für Ihre Agenten Vorrang vor Geschwindigkeit hat, bevorzugen Sie ein dichtes Modell und testen Sie Ihre Kette, bevor Sie sie industrialisieren.


Hermes lokal installieren, Schritt für Schritt

Auf einem Rechner mit einer aktuellen NVIDIA-Karte ist der Prozess einfach. Hermes basiert auf Ollama als lokaler Inferenz-Engine.

  1. Installieren Sie Ollama (aktuelle Version) und laden Sie das gewünschte Modell herunter.
  2. Konfigurieren Sie das Modell mit einem Kontextfenster von mindestens 64K Tokens.
  3. Installieren Sie das Hermes Agent Framework (aktuelle Python-Version erforderlich).
  4. Zeigen Sie Hermes auf Ihre lokale Ollama-Instanz (OpenAI-kompatibler Endpunkt).
  5. Verbinden Sie Ihre Messaging-Dienste (Telegram, Discord, E-Mail) und starten Sie Ihre erste Aufgabe.
# Beispiel: Ein 27B-Modell mit 64K Kontext unter Ollama vorbereiten
ollama pull qwen3.6:27b

# Eine Variante mit erweitertem Kontext für Hermes erstellen
cat > Modelfile <<'EOF'
FROM qwen3.6:27b
PARAMETER num_ctx 65536
PARAMETER temperature 0.6
PARAMETER top_p 0.95
EOF
ollama create qwen3.6-agent -f Modelfile

# Hermes zeigt dann auf http://localhost:11434/v1
Die stille Falle: Bei einem Agenten führt ein falsches Template-Format oder ein zu kurzer Kontext nicht zu einem klaren Fehler, sondern zu stillen Misserfolgen – ignorierte Tool-Aufrufe, Schleifen, die ins Leere laufen. Das Modell, die Engine und der Client müssen sich darüber einigen, wie die Tool-Schemata serialisiert werden. Auf unseren Maschinen ist die Umgebung vorkonfiguriert und getestet, um genau diese Art von Problemen zu vermeiden.


Warum Ihren Agenten lokal statt in der Cloud betreiben?

Ein autonomer Agent, der mit Ihren Dateien, Messaging-Diensten und Tools verbunden ist, verarbeitet naturgemäß sensible Daten. Ihn lokal zu betreiben, bietet entscheidende Vorteile.

  • Vertraulichkeit. Ihre Daten, Dateien und Konversationen verlassen niemals Ihren Computer.
  • Keine Nutzungskosten. Ein Agent, der kontinuierlich läuft und Aufgaben nacheinander erledigt, wäre mit einer API teuer. Lokal ist die Nutzung unbegrenzt, ohne Abrechnung pro Token.
  • Verfügbarkeit. Keine Quoten, keine Anforderungslimits, keine Dienstausfälle seitens des Anbieters.
  • Volle Kontrolle. Sie wählen das Modell, die Tools, die zugänglichen Daten und behalten die Kontrolle über die gesamte Umgebung.
  • Kontinuierlicher Betrieb. Ein lokaler Agent kann Tag und Nacht laufen, für Überwachungs- oder geplante Automatisierungsaufgaben, ohne zusätzliche Kosten.
Das wirtschaftliche Argument ist real. Ein intensiv genutzter Agent über eine Cloud-API kann mehrere Dutzend Euro pro Monat kosten, oder sogar deutlich mehr bei kontinuierlicher Nutzung. Eine lokale Station ist eine einmalige Investition: Einmal angeschafft, läuft Ihr Agent so oft Sie möchten, ohne wiederkehrende Kosten pro Token.


Welche Maschine für einen lokalen Hermes-Agenten?

Die richtige Dimensionierung hängt vom gewünschten Modell und dem gewünschten Kontextfenster ab. Denken Sie daran: der 64K-Kontext, oder sogar 128K, ist der wahre Treiber des VRAM-Bedarfs. Hier sind unsere angepassten Workstations, die in Auriol (13390) montiert und in die gesamte EU geliefert werden, auf Wunsch mit Ollama und der Agenten-Umgebung vorkonfiguriert.

Radiance CoreAI 16 CoreAI 16 — RTX 5060 Ti 16 GBHermes + 27B Modell in 64K. Der ideale Einstiegspunkt. 1 703 € Radiance CoreAI 32 CoreAI 32 — RTX 5070 Ti 16 GBReaktionsschneller Agent, komfortabler Kontext, Ryzen 9 für Tool-Use. 2 442 € Radiance CoreAI 64 RTX 5090 CoreAI 64 — RTX 5090 32 GBDedizierte Hermes 4 Modelle, 128K Kontext, lange Agenten-Schleifen. 6 042 € ASUS Ascent GX10 GB10 Mini KI-Server NVIDIA GB10Agent im kontinuierlichen 24/7-Betrieb, sehr langer Kontext, 128 GB Unified Memory. 3 999 €

Für einen Agenten, der ständig läuft, ist der Mini-Server GB10 besonders geeignet: leise, energieeffizient und für den kontinuierlichen Betrieb konzipiert, ohne einen Arbeitsplatzrechner zu beanspruchen. Dies ist die ideale Maschine für einen Überwachungs- oder Automatisierungsagenten, der Tag und Nacht in Ihrem Netzwerk arbeitet.


Kurz gesagt

Ist Hermes Agent kostenlos?
Ja, quelloffen unter MIT-Lizenz. Ollama und die offenen Modelle (Qwen, Gemma, Hermes) sind ebenfalls kostenlos. Die einzigen Kosten sind Hardware und Strom.

Was ist der wahre Dimensionierungsfaktor?
Das Kontextfenster. Hermes benötigt mindestens 64K Tokens, was den VRAM viel mehr in die Höhe treibt als die Modellgröße allein.

Wie viel VRAM ist mindestens erforderlich?
8 GB für ein 8B-Modell in 64K (knapp), 16 GB für ein komfortables 27B-Modell, 24 bis 32 GB für die dedizierten Hermes 4-Modelle und 128K Kontext.

Welches Modell sollte man mit Hermes wählen?
Für den Anfang ein 27B-Modell wie Qwen 3.5/3.6 auf 16 GB. Für maximale Zuverlässigkeit bei langen Schleifen ein dichtes Modell anstelle eines MoE. Für fortgeschrittene Anwendungen die dedizierten Hermes 4-Modelle.

Benötigt man eine Internetverbindung?
Nein für die Inferenz: Alles läuft lokal. Eine Verbindung ist nur für Funktionen nützlich, die das Web abfragen, wenn Sie diese aktivieren.

Kann es kontinuierlich laufen?
Ja. Ein lokaler Agent kann Tag und Nacht für Überwachungs- und Automatisierungsaufgaben laufen. Der Mini-Server GB10 ist für diese Art des kontinuierlichen Betriebs konzipiert.

 

Zurück zum Blog

Ihr Angebot für eine maßgeschneiderte KI-Lösung innerhalb von 24–48 Stunden

Jedes Radiance-Projekt beginnt mit einem Gespräch. Füllen Sie dieses Formular aus und ein Experte wird sich umgehend mit einer auf Ihr Unternehmen und Ihr Budget zugeschnittenen Lösung bei Ihnen melden.

Antwort innerhalb von 24–48 Arbeitsstunden
Lieferung innerhalb Europas (EU)
2 Jahre Garantie inklusive
Installation vor Ort möglich
Keine Verpflichtung auf Abruf
Dedizierter Support vor und nach dem Kauf
01 Was ist Ihr Hauptverwendungszweck für KI?
Multiple Choice.
02 In welchem Kontext wird das System verwendet?
Nur eine Wahlmöglichkeit.
03 Welche Art von System suchen Sie?
Nur eine Wahlmöglichkeit.
04 Welches Betriebssystem bevorzugen Sie?
Nur eine Wahlmöglichkeit.
05 Welche Erwartungen haben Sie an die Software?
Multiple Choice.
06 Was ist Ihr Richtbudget?
Nur eine Wahlmöglichkeit.
07 Wann möchten Sie Ihr System erhalten?
Nur eine Wahlmöglichkeit.
08 Wünschen Sie eine Begleitung bei der Umsetzung?
Einzelne Auswahl. Ein Radiance-Techniker kann Sie vor Ort oder per Fernzugriff unterstützen.
09 Lieferland (nur EU) *
Wir liefern ausschließlich innerhalb der Europäischen Union (EU).
10 Zusätzliche Informationen (optional, aber sehr nützlich)
Beschreiben Sie kurz Ihr Projekt, etwaige spezifische Einschränkungen oder sonstige relevante Informationen.
11 Möchten Sie kontaktiert werden, um Ihr Projekt zu besprechen?
Wenn Sie „Nur Kostenvoranschlag“ auswählen, können Sie auf unsere E-Mail antworten, um Ihre Fragen zu stellen und den Kostenvoranschlag zu verfeinern.
12 E-Mail *
Wir senden Ihnen das Angebot an diese Adresse.

Weitere Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr) innerhalb von 3 Stunden.

📞 +33 4 65 84 48 21