Rang #2 KI-Agenten — Software, die arbeitet, während Sie schlafen
Nous Research

Hermes Agent

Ein MIT-lizenzierter Agent von Nous Research, der wiederverwendbare Skills lernt, Coding-Ziele überprüft und in Terminal, Desktop, Web, Sprache und Messengern arbeitet. Das Herald-Release v0.20 macht seine wichtigste Verheißung deutlich praktischer: Auch kleinere lokale Modelle sollen weniger Kontext und weniger nutzlose Schleifen für längere Agentenarbeit verschwenden.

Aktualisiert 4. August 2026 MIT Open SourceSelf-ImprovingSelf-Hosted
Am besten für

Ein MIT-lizenzierter Agent von Nous Research, der wiederverwendbare Skills lernt, Coding-Ziele überprüft und in Terminal, Desktop, Web, Sprache und Messengern arbeitet. Das Herald-Release v0.20 macht seine wichtigste Verheißung deutlich praktischer: Auch kleinere lokale Modelle sollen weniger Kontext und weniger nutzlose Schleifen für längere Agentenarbeit verschwenden.

Warum es gewinnt

Geschlossener Lernkreislauf mit `/learn`; überprüfbare `/goal`-Verträge; lokale und gehostete Modelle; Selbstheilung bei Werkzeugen; Mikro-Kompression pro Turn; 90→500 Werkzeugiterationen; belegte Recherche; Stimme, A2A und Webhooks; laut Nous Kaltstart von etwa 14 auf 1,8 Sekunden.

Zu beachten

Hermes erhält weiterhin weitreichenden Zugriff auf Befehle, Dateien, Browser und Messenger-Konten. Die starken Effizienzwerte stammen von den Maintainers, Smart Approval ist keine Sicherheitsgrenze, und ein mächtiger Agent kann bei lockeren Rechten Kosten und Fehler schnell vervielfachen.

01

Was es wirklich ist

Die meisten KI-Agenten beginnen jeden Montag mit Gedächtnisschwund. Vielleicht erinnern sie sich an einen Chat, doch aus dem mühsam erarbeiteten Ablauf der Vorwoche wird nicht automatisch eine zuverlässige Routine. Hermes Agent verspricht etwas Interessanteres: Wenn ein Arbeitsweg funktioniert, kann der Agent die Lektion als lesbaren Skill festhalten, später passende Erfahrungen abrufen und sein wachsendes Gedächtnis zur Prüfung offenlegen. Das ähnelt weniger einem brillanten Leiharbeiter als einem Werkstattbuch, das sich nach jedem Projekt besser ordnet.

Dieser Lernkreislauf bleibt der wichtigste Unterschied. /learn kann aus einem Ablauf, einem Verzeichnis oder einer Quelle wiederverwendbares Verfahrenswissen erstellen. Mit /journey werden Zusammenhänge im Gedächtnis sichtbar, während die Desktop-App daraus einen bearbeitbaren Graphen macht. Für Coding-Aufgaben bringt /goal eine zweite Disziplin hinein: Vor dem Triumph kann Hermes Belege verlangen, etwa bestandene Projekttests. Das macht nicht jede Antwort richtig, aber „fertig“ bedeutet damit mehr als eine überzeugend formulierte Schlussnachricht.

Version 0.20, das Herald-Release, ersetzt diese Idee nicht. Es macht die Schleife des Agenten weniger verschwenderisch. Nous gibt an, 250.000 Hermes-Unterhaltungen zusammen mit NVIDIA Nemo Relay analysiert zu haben, und stellte fest, dass der teure Fehler oft kein gigantischer Prompt ist, sondern ein kleines Leck, das sich über viele Runden wiederholt: sperrige Schemata, Werkzeugausgaben, die nicht mehr nützlich sind, ein Patch, der fast passt, oder eine Suche, die bei einer Schreibweise zu früh aufgibt. Herald stutzt Schemata, bereinigt veraltete Werkzeugausgaben, verdichtet den Kontext schrittweise, behält aktuelle Benutzernachrichten bei und gibt Werkzeugen Möglichkeiten, sich zu erholen, bevor das Modell einen neuen Plan erfindet. Das ist besonders dann wichtig, wenn das Modell ein kleineres lokales Modell ist, das weniger Spielraum hat, um einen chaotischen Arbeitsablauf zu absorbieren.

Die folgenreichste Änderung ist, dass Werkzeuge nun helfen, sich von ihren eigenen alltäglichen Fehlern zu erholen. Ein abgeschnittenes Terminal-Ergebnis wird in einer Datei gespeichert, anstatt zu einem blinden Fleck zu werden. patch weiß, wie man eine bereits angewendete Änderung oder eine Nichtübereinstimmung von Leerzeichen erklärt. Schreibvorgänge werden auf der Festplatte überprüft. Suchen ohne Ergebnis suchen nach Beinahetreffern. Und die standardmäßige Obergrenze für Werkzeugaufrufe steigt von 90 auf 500, sodass eine lange Aufgabe seltener aufgrund eines willkürlichen Zählers stoppt. Nichts davon macht Hermes unfehlbar; es räumt lediglich vertraute mechanische Fehler aus dem Weg des Modells. Genau das ist die Art von Verbesserung, die ein schwächeres Modell von “fast nützlich” in einen brauchbaren Assistenten verwandeln kann.

Auch bei der Sicherheit geht die Richtung nach vorn. Hermes kann Geheimnisse aus Bitwarden und 1Password beziehen, wodurch eine ausufernde Klartext-Umgebungsdatei weniger nötig wird. Explizite Sperrmuster blockieren ausgewählte Befehle auch dann, wenn andere Prüfungen gelockert sind. Engere Credential-Bereiche, Redaction, gemeinsame Dateizugriffskontrollen und Request-Limits schließen weitere Lücken. Der neue Standardmodus „Smart Approval“ muss trotzdem nüchtern beschrieben werden: Ein zweites Sprachmodell bewertet einen markierten Befehl und kann ihn automatisch zulassen. Das erspart Rückfragen, ist aber weder Sandbox noch Betriebssystemgrenze.

Herald lässt Hermes auch weniger wie ein Terminal-Experiment wirken und mehr wie einen Mitarbeiter, den man am richtigen Ort erreichen kann. Es fügt fließende konversationelle Stimme hinzu, die natürlich unterbrochen werden kann, geräteinterne Aktivierungswörter (Wake Words), Agent-to-Agent v1.0, signierte Webhooks, fundierte Recherche mit Zitaten, die gegen den Quelltext geprüft werden, Desktop-Artefakte und Plugins sowie die Möglichkeit, eine aktive Runde umzuleiten, anstatt anzuhalten und neu zu starten. Die neuen Befehle sind ungewöhnlich praktisch: !command vermeidet es, einen Modell-Zug für eine Shell-Aktion auszugeben, /context zeigt, was das Fenster füllt, und /diff zeigt, was sich geändert hat. Importwerkzeuge für Claude Code und Codex senken die Kosten, Hermes neben einer bestehenden Konfiguration auszuprobieren.

Die ehrliche Schlussfolgerung ist abgewogen. Herald ist ein bedeutender Leistungssprung, weil es denselben agentischen Ehrgeiz billiger, weniger anfällig und leichter steuerbar macht – insbesondere mit einem Modell wie DeepSeek V4 Flash 0731 oder einem anderen lokalen Endpunkt. Wir heben Hermes auf 8,5 an, behalten aber den zweiten Platz bei: Nous hat ein ungewöhnlich detailliertes Release-Engineering vorgelegt, keinen unabhängigen Vergleich von Token-Verbrauch, Latenz und Aufgabenerfolg. Wählen Sie Hermes, wenn inspizierbare Selbstverbesserung, überprüfbare Ziele, die Freiheit lokaler Modelle und tiefgehende Orchestrierung die betriebliche Belastung überwiegen. Wenn Sie eine Appliance suchen, bei der ein einziger Anbieter für jede Berechtigung und jeden Fehler verantwortlich ist, verlangt Hermes immer noch mehr von Ihnen als das.

Dieses Urteil zur v0.19 ist inzwischen überholt. Herald v0.20 zielt nicht bloß auf eine hübschere Oberfläche, sondern auf die kleinen Reibungen, aus denen bei Agenten große Kosten werden. Ein abgeschnittenes Terminal-Ergebnis landet in einer Datei zum Nachlesen; patch erklärt bereits angewandte Änderungen und Leerzeichenkonflikte; Schreibvorgänge werden kontrolliert; erfolglose Suchen versuchen passende Treffer; und die Standardgrenze steigt von 90 auf 500 Werkzeugschritte. Das ist besonders für lokale Modelle wichtig: Sie haben oft weniger Reserven, um aus einem schlecht beschriebenen Werkzeugfehler einen guten nächsten Schritt zu erraten.

Herald erweitert zugleich den Arbeitsraum: laufende Sprachantworten lassen sich unterbrechen, Wake Words bleiben auf dem Gerät, A2A v1.0 verbindet andere Agenten, signierte Webhooks melden Ereignisse, und die neue Recherche-Skill prüft Zitate gegen den Quelltext. Mit /context, /diff, !command und Redirects während eines laufenden Turns wird die Zusammenarbeit weniger zu „stoppen und neu erklären“. Deshalb steigt Hermes auf 8,5. Die Warnung bleibt: Die Release Notes beweisen bessere Werkzeuge, nicht unabhängig mehr gelöste Aufgaben. Ein sinnvoller Test ist derselbe lokale Workflow vor und nach dem Update—mit gemessenen Tokens, Turns, Zeit und überprüftem Ergebnis.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Lernen mit einem brauchbaren Ergebnis: Hermes kann erfolgreiche Abläufe in lesbare, wiederverwendbare Skills verwandeln und Projektwissen sitzungsübergreifend behalten. /journey und der Gedächtnisgraph der Desktop-App machen dieses Lernen prüfbar; mit /goal lassen sich Tests oder andere Nachweise verlangen, bevor eine Coding-Aufgabe als abgeschlossen gilt.
  • Herald bekämpft verlorene Turns statt nur Wartezeit: Nous sagt, dass 250.000 Hermes-Gespräche und NVIDIA Nemo Relay untersucht wurden. Schlankere Schemas, Tool-Ergebnis-Pruning, Mikro-Kompression, Caching und Recovery-Hinweise sollen Kontextlast und die kostspieligen Werkzeugfehler senken, die kleine lokale Modelle besonders hart treffen.
  • Parallele Arbeit ist sichtbar und geht seltener verloren: Hintergrund-Subagenten schreiben Live-Transkripte, sodass ihre Werkzeugaufrufe während der Arbeit nachvollziehbar sind. Ergebnisse überstehen Prozessneustarts, und ein separates Zustellungsjournal kann eine fertige Gateway-Antwort nach einem Absturz erneut senden, statt sie stillschweigend zu verlieren.
  • Große Modellauswahl plus anspruchsvolle Orchestrierung: Hermes arbeitet mit den großen Cloud-APIs, lokalen Laufzeiten, Nous Portal und OpenAI-kompatiblen Endpunkten. MoA-Räte bleiben ein besonderes Merkmal; dank Steuerung des Reasoning-Aufwands pro Modell und Rolle müssen teure Berater und der abschließende Synthesizer nicht alle mit demselben Denkbudget laufen.
  • Zugangsdaten und Befehle werden sinnvoller geschützt: Bitwarden und 1Password können Geheimnisse liefern, ohne jeden Schlüssel in eine unverschlüsselte .env zu kopieren. Eigene Sperrregeln gelten selbst in großzügigen Modi; zusätzlich verringern Credential-Scoping, Redaction, gemeinsame Dateizugriffswächter und Größenlimits für Webhooks mehrere reale Angriffsflächen.
  • Breite Einsatzmöglichkeiten: Mehr als 60 integrierte Werkzeuge decken Dateien, Terminal, Webrecherche, Browser-Automatisierung, Medien, Zeitpläne und Delegation ab. Ein Gateway verbindet über 20 Messenger-Plattformen; profilbasiertes Routing kann Arbeit und Privates mit getrennten Einstellungen, Erinnerungen und Geheimnissen über denselben Bot bedienen.
  • Einfacherer Einstieg, ohne das offene System zu schließen: Desktop-Installer und hermes setup --portal sind wesentlich kürzer als das manuelle Zusammensuchen aller Modell- und Tool-Schlüssel. Nous Portal kann Modellzugang sowie verwaltete Web-, Bild-, Sprach-, Browser- und Sandbox-Dienste bündeln; Self-Hosting und eigene Provider bleiben trotzdem möglich.

Ehrliche Einschränkungen

  • Smart Approval ist Komfort, keine Eindämmung: Im standardmäßigen Smart-Modus darf ein Hilfsmodell einen als risikoarm bewerteten Befehl automatisch freigeben. Harte Sperrregeln helfen, doch bei Shell-, Browser- oder Postfachzugriff bleiben Isolation, enge Rechte, Backups und menschliche Kontrolle für folgenreiche Aktionen unverzichtbar.
  • Die stärksten Effizienzangaben stammen vom Hersteller: Nous meldet rund 14 auf 1,8 Sekunden Kaltstart und weniger verlorene Turns. Das sind überzeugende Implementierungsbelege, aber v0.20 liefert keinen unabhängigen Vergleich von Tokens pro Erfolg oder Erfolgsquote bei realen Agentenaufgaben.
  • Die Komplexität für Power-User bleibt: Installer und Portal-Login vereinfachen die erste Stunde, ernsthafte Installationen benötigen dennoch Provider, Profile, Gateways, Rechte, Logs, Updates und manchmal entfernte Infrastruktur. Das enorme Entwicklungstempo beeindruckt, lässt Dokumentation und Konfiguration aber ebenfalls rasch wandern.
  • Parallele Intelligenz kann parallele Kosten bedeuten: MoA-Räte, Hilfsprüfer, Kompressionsmodelle und Hintergrund-Subagenten können für eine einzige Anfrage mehrere Modellaufrufe erzeugen. Nous Portal vereinfacht die Abrechnung, beseitigt sie jedoch nicht; Budgets, günstigere Modelle für Nebenrollen und regelmäßige Nutzungsberichte sind ratsam.
03

Das Fazit

Hermes bleibt der intellektuell ehrgeizigste selbstlernende Agent in unserem Vergleich. v0.20 verbessert die unspektakuläre Technik, von der lokale Agentenarbeit lebt: Recovery, Kontextdisziplin, Startzeit und Steuerbarkeit. Das rechtfertigt einen moderaten Anstieg auf 8,5 bei Rang 2. Ohne unabhängige Aufgabenmessungen bleibt der Vorsprung bewusst begrenzt. Hermes passt zu technischen Nutzern, denen nachvollziehbares Lernen, lokale Modellfreiheit und tiefe Orchestrierung den Betriebsaufwand wert sind.

04

Häufig gestellte Fragen