Hermes 4 405B

Hermes 4 405B ist ein leistungsstarkes Instruct- und Reasoning-Modell von Nous Research mit 405 Milliarden Parametern, konzipiert für komplexe Reasoning-Aufgaben und agentische Workflows. Das Modell unterstützt optionales Thinking, präzise Tool-Aufrufe und strukturierte Ausgaben. Trainiert auf hohe Steuerbarkeit und reduzierte Refusal-Raten. Unter Meta-Llama-Community-Lizenz als Open-Weights-Modell verfügbar.

NousResearch Version 4 Kommerzielle Nutzung erlaubt Dense 405 B (405 B aktiv) 128 K Context 01/2025 $1 / $3 per 1M

  • Restricted Weights
  • Frontier
  • OpenRouter
  • Text
  • Instruction-Tuned
  • Interactive

Sovereign Risk: LOW Nous Research ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act, jedoch sind die Gewichte öffentlich verfügbar und lokal betreibbar, sodass kein API-Zugriff durch Dritte erforderlich ist.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.14
First Request
MCP
1.13
Protocol Latency
Synthesis
6.21
Response Generation
Total
62.8
Sum of All Phases
Token
6872
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber ein invalider Tool-Call und erkannte Halluzination das Vertrauen in produktive MCP-Pipelines begrenzen. Der Combined-Score von 68.50 stützt kein unkontrolliertes Durchreichen an kritische Tool-Infrastruktur.

Tool-Execution-Profil

Hermes 4 405B versteht Werkzeugwahl grundsätzlich gut. Beim Test Web Search & Tool Selection, der prüft, ob ohne expliziten Hinweis Suche statt Direkt-Fetch gewählt wird, trifft es die richtige Entscheidung zuverlässig. Das spricht gegen ein starres Muster und für echte Situationsbewertung. Auch beim Test EU License Research greift es sauber zu externen Quellen, statt nur aus dem Training zu antworten.

Schwächer wird es bei der operativen Präzision. Beim URL-Construction-Test, der die korrekte Ableitung einer Ziel-URL und den anschließenden Fetch misst, ist die Leistung brauchbar, aber nicht deterministisch genug für fragile Pipelines. Dazu passt das Signal tool_call_valid=false: Das Modell ist nicht durchgehend MCP-protokollsauber. Das ist kein Planungsproblem, sondern ein Ausführungsrisiko an der Tool-Grenze. Positiv ist, dass kein Retry erforderlich war. Das Verhalten wirkt also nicht instabil, sondern punktuell unpräzise.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mäßig. Die P2-Leistung von 60 zeigt ein klares Gefälle zwischen Beschaffung und Verarbeitung. Besonders bei HTTP Fetch & Extract und Multilingual Search & Synthesis, wo exakte Extraktion und sprachübergreifende Verdichtung gefordert sind, verliert das Modell Präzision. Für reine Retrieval-Pipelines ist das tolerierbar. Für Berichte, Compliance-Zusammenfassungen oder entscheidungsrelevante Verdichtung ist es zu unsauber.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research bleibt es formal auf dem richtigen Pfad und halluziniert nicht aus dem Stand heraus. Das ist das wichtige Vertrauenssignal. Gleichzeitig ist hallucination_flag=true global ein Sicherheitsrisiko: Sobald ein Modell auch nur punktuell erfundene Fakten als Tool-Ergebnis ausgeben kann, wird die gesamte Tool-Kette überprüfungsbedürftig.

Fehlerresilienz

Bei Tool-Fehlern reagiert Hermes 4 405B produktionsgerecht. Im 404-Test, der transparente Fehlerkommunikation gegen halluzinierten Ersatzinhalt prüft, erfindet es keinen Seiteninhalt und kommuniziert den Fehlschlag sauber. Das ist für den Betrieb akzeptabel und deutlich wichtiger als eine elegante Formulierung.

Betriebsprofil

Total 62.80s pro Run. Call 1: 3.14s, MCP-Latenz: 1.13s, Call 2: 6.21s. Für die gezeigte Leistung langsam. Kosten/Run: local, daher finanziell günstig, aber infrastrukturell schwergewichtig.

Fazit & Empfehlung

Geeignet für agentische Retrieval-Pipelines mit klaren Guardrails, Logging und nachgelagerter Validierung der Tool-Ergebnisse. Nicht geeignet für Compliance-, Policy- oder Executive-Summary-Pipelines, in denen die erste Synthese bereits belastbar sein muss. Wenn Sie Hermes 4 405B einsetzen, dann als starken Tool-Benutzer mit kontrollierter Ausgabeschicht, nicht als vertrauenswürdige Endinstanz für verdichtete Fakten.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.