Qwen 3.6 Plus

Qwen 3.6 Plus ist Alibabas proprietäres Flagship-Modell der Qwen-3.6-Serie mit hybrider MoE-Architektur und Schwerpunkt auf agentisches Coding und multimodale Verarbeitung. Mit einem Kontextfenster von einer Million Tokens, konfigurierbarem Thinking-Modus und nativen Agentic-Fähigkeiten richtet sich das Modell an anspruchsvolle produktive Anwendungen. Ausschliesslich über Cloud-APIs verfügbar, die chinesische Jurisdiktion ist zu beachten.

Alibaba Version 3.6 Plus Kommerzielle Nutzung erlaubt MoE 1000 K Context 02/2026 $0.325 / $1.95 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Agentic Orchestrator
  • Batch

Sovereign Risk: HIGH Das Modell wird ausschließlich über die Alibaba Cloud API betrieben. Daten, die über die API übertragen werden, unterliegen dem chinesischen National Security Law (NSL), das staatlichen Zugriff auf Daten ermöglichen kann. Lokales Deployment ist nicht möglich – kein Gewichts-Download verfügbar.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
6.54
First Request
MCP
0.68
Protocol Latency
Synthesis
34.23
Response Generation
Total
248.76
Sum of All Phases
Token
22861
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung meist stark ist, aber die Synthesetreue zu unzuverlässig bleibt und der Tool-Call im Lauf nicht durchgängig valide war.

Tool-Execution-Profil

Qwen 3.6 Plus zeigt echte Werkzeugintelligenz statt bloßer Schablonen-Nutzung. Beim Web Search & Tool Selection-Test, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, erkennt es den Bedarf für web_search sehr sicher. Auch beim URL-Construction-Test, der die Ableitung einer Ziel-URL aus internem Wissen und anschließendes fetch misst, arbeitet es brauchbar, aber weniger deterministisch. Das spricht für flexible Planung, nicht für starres Musterfolgen.

Für eine MCP-Pipeline ist das Bild trotzdem nicht vollständig sauber. P1 ist mit 68.33 solide, aber das Signal „Tool-Call valide: false“ ist relevant. Das heißt praktisch: Das Modell versteht den Ablauf meist, produziert aber nicht in jedem Schritt protokollsaubere Aufrufe. Da kein Retry nötig war, liegt das Problem eher in Ausführungspräzision als in grundsätzlichem Missverständnis.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur begrenzt zuverlässig. P2 liegt bei 50.00, und die Streuung ist hoch. HTTP Fetch & Extract ist noch ordentlich, Tool Failure Handling (404) und URL Construction & Fetch sind gut, aber EU License Research fällt in der Verdichtung deutlich ab. Kritisch ist vor allem Multilingual Search & Synthesis: Bei sprachübergreifender Recherche mit deutscher Zusammenfassung bricht die Qualität stark ein. Für Pipelines, die knappe, belastbare Ergebnisverdichtung brauchen, ist das zu schwankend.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen beantwortet werden, halluziniert es nicht. Das ist das wichtigste Vertrauenssignal. Der P2-Wert von 40 zeigt aber, dass es das beschaffte Material nicht sauber genug in eine belastbare Antwort überführt. Vertrauen in die Herkunft ist also besser als Vertrauen in die Verdichtung.

Fehlerresilienz

Beim 404-Test, der transparentes Scheitern gegen erfundenen Ersatzinhalt abgrenzt, reagiert Qwen 3.6 Plus produktionsgerecht. Es kommuniziert den Fehlschlag statt Seiteninhalt zu erfinden. Das ist für reale Tool-Ketten akzeptabel und deutlich wichtiger als stilistische Antwortqualität.

Betriebsprofil

Total 248.76s pro Run. Call 1 6.54s, Call 2 34.23s, MCP-Latenz 0.68s. Langsam für die gezeigte Leistung. Preis: $0.325 pro 1M Input-Tokens, $1.95 pro 1M Output-Tokens. API-seitig günstig bis moderat, aber die Laufzeit verschlechtert die Wirtschaftlichkeit.

Fazit & Empfehlung

Geeignet für agentische Recherche-Pipelines mit menschlicher Nachkontrolle, besonders dort, wo Tool-Auswahl und transparente Fehlerbehandlung wichtiger sind als perfekte Endverdichtung. Nicht geeignet für Compliance-, Policy- oder mehrsprachige Synthese-Pipelines, in denen die letzte Antwort ohne Review direkt weiterverarbeitet wird. Zusätzlich ist das Cloud-only-Betriebsmodell unter chinesischer Jurisdiktion für sensible Tool-Daten ein eigenständiger Ausschlussgrund.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.