Swift Qwen 3.8 27B (Thinking)

Swift Qwen 3.8 27B ist UkisAIs Reasoning-Effizienz-Finetune auf Qwen 3.8 27B: bis zu 58 Prozent weniger Thinking-Tokens bei unter einem Prozent Performance-Verlust und rund doppelt so hoher Durchsatz auf Reasoning-Aufgaben. NVFP4-Quantisierung mit 262.000 Tokens Kontext, MTP-Head für Speculative Decoding und dokumentiertem Tool-Use — Lizenz mit kommerzieller ARR-Schwelle.

UkisAI Version 3.8 Kommerzielle Nutzung erlaubt Dense 28 B 262 K Context 12/2025 local getestet

  • Restricted Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Batch

Sovereign Risk: MEDIUM This checkpoint is a UkisAI fine-tune and NVFP4 quantization of Qwen/Qwen3.8-27B. The base lineage is documented, but the weights are distributed under the gated Swift Open License v1.0 with an ARR threshold and are optimized for Blackwell/vLLM deployment, so provenance is clear but not fully open in the OSS sense.[page:1]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
7.3
First Request
MCP
1.05
Protocol Latency
Synthesis
53.41
Response Generation
Total
370.58
Sum of All Phases
Token
13731
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, aber ein invalider Tool-Call und ein gesetzter Halluzinations-Flag das Vertrauen in produktive MCP-Pipelines begrenzen.

Tool-Execution-Profil

Swift Qwen 3.8 27B zeigt echte Werkzeugintelligenz, nicht nur starres Fetch-Verhalten. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, erkennt das Modell den Bedarf für web_search sauber und erreicht volle Ausführungssicherheit. Das spricht für brauchbare Planung in offenen Retrieval-Szenarien. Beim URL-Construction-Test, der die Ziel-URL aus Eigenwissen ableiten und dann korrekt abrufen lässt, bleibt es brauchbar, aber nicht deterministisch genug für sensible Pipelines. P1 80 heißt hier: funktional, aber nicht robust. Kritisch ist weniger die Auswahl als die Protokolltreue. Der globale Befund „Tool-Call valide: false“ bedeutet, dass mindestens ein Aufruf nicht sauber MCP-konform war. Da kein Retry nötig war, wirkt das nicht wie ein wiederkehrendes Formatproblem, sondern wie punktuelle Unsauberkeit in der Ausführung.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt verlässlich. Die P2-Leistung von 59.17 liegt deutlich unter der Ausführungsstärke. Das Modell extrahiert Web-Inhalte im Test HTTP Fetch & Extract sehr gut, verdichtet aber in Such- und Rechercheaufgaben zu unpräzise. Besonders sichtbar ist das bei Web Search & Tool Selection, wo die Werkzeugwahl richtig ist, die Zusammenführung der Funde aber schwach bleibt. Für Pipelines, in denen nicht nur abgerufen, sondern belastbar zusammengefasst werden muss, ist das die eigentliche Grenze.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der aktuelle Lizenzrestriktionen aus Web-Quellen erzwingen soll, halluziniert es nicht, aber es bleibt auch nicht eng genug an den abgerufenen Befunden. P2 40 ohne Halluzination ist kein Entwarnungssignal, sondern ein Vertrauensdefizit. Der gesetzte Halluzinations-Flag ist deshalb als Sicherheitsrisiko zu lesen: Sobald ein Modell erfundene Fakten als Tool-Ergebnis rahmt, beschädigt es die Verlässlichkeit der gesamten Infrastruktur.

Fehlerresilienz

Beim 404-Test, der transparentes Verhalten bei fehlschlagendem Abruf misst, erfindet Swift Qwen 3.8 27B keinen Seiteninhalt. Das ist produktionsrelevant positiv. P2 60 zeigt keine elegante Fehlerbehandlung, aber die Reaktion bleibt akzeptabel: lieber unvollständig als erfunden.

Betriebsprofil

Call 1: 7.30s. MCP-Latenz: 1.05s. Call 2: 53.41s. Total: 370.58s.
Lokal und ohne API-Kosten. Für die gelieferte Qualität zu langsam. Für Batch- oder Backoffice-Jobs vertretbar, für interaktive Tool-Pipelines grenzwertig.

Fazit & Empfehlung

Geeignet für lokale Recherche- und Abrufpipelines mit menschlicher Nachkontrolle, besonders wenn Souveränität und Tool-Ausführung wichtiger sind als präzise Verdichtung. Nicht geeignet für Compliance-, Policy- oder Entscheidungsstrecken, in denen die Antwort selbst als verlässliches Endprodukt dient. Wenn Sie es einsetzen, dann als Tool-Operator mit nachgelagerter Validierung, nicht als autonomes Synthese-Modell.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.