Verfügbar – veröffentlicht am 30. Juni 2026

Claude Sonnet 5 API: Schnellstart in wenigen Minuten

Was Sie benötigen, um claude-sonnet-5 über die Messages API aufzurufen – Modell-ID, curl- und Python-Beispiele, Effort, adaptives Denken, Neuanpassung von max_tokens. Stand 2026-09-29 ist die neueste Sonnet Sonnet 5.5 (veröffentlicht 2026-09-28).

#claude-sonnet-5 #Messages API #Effort-Parameter #Adaptives Denken #QCode Relay

Schnellstart

Sonnet 5 ist ein direkter Ersatz in der Standard-Messages-API. Wenn Sie bereits Opus 4.8 oder Sonnet 4.6 aufrufen, sind es nur drei kleine Schritte.

1

Modell-ID festlegen

Verwenden Sie claude-sonnet-5 – eine fixierte, datumslose Momentaufnahme ohne -v1-Suffix. Für einen grundlegenden Aufruf sind keine weiteren Änderungen erforderlich.

2

Sampling-Parameter entfernen

Entfernen Sie temperature, top_p und top_k. Sonnet 5 lehnt sie mit HTTP 400 ab, genau wie Opus 4.7 und neuer.

3

Adaptives Denken beibehalten

Adaptives Denken ist standardmäßig aktiv. Senden Sie keine manuelle Extended-Thinking-Konfiguration – explizites Thinking liefert HTTP 400. Stellen Sie die Tiefe stattdessen über Effort ein.

Claude-API-Modell-ID
claude-sonnet-5
Amazon-Bedrock-ID
anthropic.claude-sonnet-5
OpenRouter-Slug
anthropic/claude-sonnet-5-20260630
curl – grundlegende Messages-Anfrage
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 4096,
    "thinking": { "type": "adaptive" },
    "effort": "high",
    "messages": [
      { "role": "user", "content": "Refactor this module and add tests." }
    ]
  }'
# NOTE: do NOT send temperature / top_p / top_k -> HTTP 400
Python – anthropic SDK
from anthropic import Anthropic

client = Anthropic()  # reads ANTHROPIC_API_KEY

resp = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    thinking={"type": "adaptive"},  # on by default
    effort="high",                  # low | medium | high | xhigh | max
    messages=[
        {"role": "user", "content": "Explain this stack trace and propose a fix."}
    ],
    # temperature / top_p / top_k omitted -> sending them returns HTTP 400
)
print(resp.content[0].text)

Beide Beispiele lassen temperature, top_p und top_k bewusst weg: Jede dieser Angaben an claude-sonnet-5 liefert HTTP 400. Adaptives Denken (thinking={"type":"adaptive"}) ist der Standardwert, und das effort-Feld steuert, wie viel Reasoning das Modell pro Anfrage aufwendet.

Passen Sie Ihre max_tokens an

Sonnet 5 bringt einen neuen Tokenizer mit. Derselbe Text verbraucht etwa 30 % mehr Tokens als bei Sonnet 4.6, daher werden aus älterem Code übernommene Limits und Budgets zum Problem.

Erhöhen Sie Ihre Output-Obergrenze

Ein max_tokens-Wert, der eine Sonnet-4.6-Antwort locker abdeckte, kann nun abgeschnitten werden. Geben Sie sich rund 30 % mehr Spielraum, bis zur Output-Grenze von 128K (300K über den Batches-Beta-Header output-300k-2026-03-24).

Kontextbudgets erneut prüfen

Das Kontextfenster umfasst 1M Tokens – sowohl Standardwert als auch Maximum, ohne kleinere Variante –, aber Prompts, die früher in Tokens bemessen wurden, packen nun dichter. Messen Sie daher per Token-Counting nach, statt zu schätzen.

Kosten pro Anfrage neu kalkulieren

Da derselbe Text ca. 30 % mehr Tokens ergibt, ist der Preis von $2/MTok Input + $10/MTok Output am ehesten als kostenneutral im Vergleich zu den $3/$15 von Sonnet 4.6 für identischen Text zu lesen – kein pauschaler Rabatt von 33 %.

Die Standardpreise betragen $2/MTok Input + $10/MTok Output, am 2026-08-10 als Langfristpreis bestätigt, nachdem die Erhöhung zum 2026-09-01 zurückgenommen wurde. Cache-Lesungen kosten $0.20, ein 5-Minuten-Cache-Schreiben liegt beim 1,25-Fachen des Basis-Input-Preises und ein 1-Stunden-Cache-Schreiben beim 2-Fachen. Sonnet 5.5 (veröffentlicht 2026-09-28) hat denselben Preis wie Sonnet 5. Bemessen Sie max_tokens stets am neuen Tokenizer, nicht an Ihren alten Zählungen.

Effort-Stufen

Der Effort-Parameter steuert, wie viel Reasoning Sonnet 5 pro Anfrage aufwendet. Er akzeptiert fünf Stufen; der Standardwert ist high.

effort Geeignet für Latenz & Output-Tokens
low Klassifikation, Extraktion, kurzer Chat und andere latenzkritische, klar abgegrenzte Aufrufe. Niedrigste Latenz, wenigste Reasoning-Tokens.
medium Alltägliche Unterstützung und leichteres Coding, bei dem Sie etwas mehr Überlegung brauchen, ohne volle Tiefe. Mittlere Latenz und Tokenverbrauch.
high Standardwert Die meisten Agent- und Coding-Aufgaben – der ausgewogene Standardwert, der Geschwindigkeit mit starkem Reasoning verbindet. Ausgewogen; der empfohlene Startpunkt.
xhigh Anspruchsvolles Multi-Step-Debugging, Architektur und lange Agent-Läufe, die von tieferem Reasoning profitieren. Höhere Latenz, mehr Reasoning-Tokens.
max Die anspruchsvollsten Reasoning- und Urteilsaufgaben, bei denen Sie maximale Tiefe unabhängig von den Kosten brauchen. Höchste Latenz und höchster Tokenverbrauch.

Starten Sie mit high und reduzieren Sie nur für günstige, latenzkritische Aufgaben; erhöhen Sie für die schwierigsten Probleme. Sonnet 5 nähert sich dem Opus-Tier zu einem günstigeren Preis. Stand 2026-09-29 ist die neueste Opus Opus 5.5 (veröffentlicht 2026-09-22, $4 / $20), laut Anthropic entwickelt für komplexe Aufgaben, die sorgfältiges Urteilsvermögen erfordern – greifen Sie dazu, wenn max Effort bei Sonnet 5 nicht ausreicht.

Sonnet 5 über QCode nutzen

QCode leitet die gleiche Messages API weiter, sodass Ihr Sonnet-5-Code unverändert bleibt – nur die Basis-URL und der API-Key unterscheiden sich.

Identische API-Oberfläche

Gleiche Modell-ID claude-sonnet-5, gleicher Effort-Parameter, gleiches adaptives Thinking. Richten Sie das SDK auf die Relay-Basis-URL, und Ihr vorhandener Code funktioniert sofort.

Ein API-Key, viele Modelle

Ein einziger QCode-Key bietet Zugang zu Claude, Codex und chinesischen Modellen – kein Hantieren mit separaten Anbieter-Konten und Zahlungen.

Stabiler China-Zugang

Der Relay-Dienst bietet niedrige Latenz und zuverlässigen Zugang vom chinesischen Festland, sodass Sonnet 5 funktioniert, ohne dass Sie mit grenzüberschreitender Konnektivität kämpfen müssen.

Direkt einsetzbar für Tools

Funktioniert mit dem anthropic SDK, Claude Code und jedem Client, der die Messages API spricht – Basis-URL setzen und loslegen.

Python – Sonnet 5 über den QCode-Relay-Dienst
from anthropic import Anthropic

client = Anthropic(
    base_url="https://relay.qcode.cc",  # QCode relay
    api_key="qk-..."                     # one key for Claude / Codex / Gemini
)

resp = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    thinking={"type": "adaptive"},
    effort="high",
    messages=[{"role": "user", "content": "Ship it."}],
)

Häufig gestellte Fragen

Wie lautet die Modell-ID von Claude Sonnet 5?

Die Modell-ID lautet claude-sonnet-5 – eine feste, datumslose Momentaufnahme ohne -v1-Suffix. Bei Amazon Bedrock ist sie anthropic.claude-sonnet-5, und bei OpenRouter lautet der Slug anthropic/claude-sonnet-5-20260630. Übergeben Sie claude-sonnet-5 im model-Feld jeder Messages-API-Anfrage.

Muss ich meinen Code ändern, um Sonnet 5 aufzurufen?

Meistens nicht – tauschen Sie die Modell-ID auf claude-sonnet-5, und Ihr vorhandener Messages-API-Code funktioniert weiterhin. Zwei Punkte sind zu prüfen: Entfernen Sie alle temperature-, top_p- oder top_k-Felder (sie geben bei Sonnet 5 HTTP 400 zurück, wie bei Opus 4.7+), und senden Sie keine manuelle extended-thinking-Konfiguration – adaptives Thinking ist standardmäßig aktiviert, und eine explizite Thinking-Konfiguration gibt 400 zurück. Passen Sie außerdem max_tokens an, da der neue Tokenizer etwa 30 % mehr Tokens für denselben Text erzeugt.

Welche Effort-Stufe sollte ich für Sonnet 5 verwenden?

Die Standardeinstellung ist high, was den meisten agentischen und Coding-Aufgaben entspricht. Verwenden Sie low oder medium für günstige, latenzkritische Aufrufe wie Klassifikation, Extraktion und kurzen Chat, sowie xhigh oder max für die anspruchsvollsten mehrstufigen Schlussfolgerungen, bei denen Sie maximale Tiefe benötigen. Effort tauscht Latenz und Output-Tokens gegen Schlussfolgertiefe, also beginnen Sie mit high und passen Sie den Wert je nach Arbeitslast an.

Kann ich Claude Sonnet 5 über QCode nutzen?

Ja. QCode stellt über seinen Relay-Dienst dieselbe Messages-API-Oberfläche bereit, sodass die Modell-ID claude-sonnet-5, der Effort-Parameter und das adaptive Thinking unverändert bleiben – nur die Basis-URL und der API-Key unterscheiden sich. claude-sonnet-5-5 ist seit 2026-09-29 auf QCode verfügbar, parallel zu claude-sonnet-5 und claude-opus-5-5.

Beginnen Sie mit Claude Sonnet 5 zu entwickeln

Holen Sie sich einen API-Key für Claude, Codex und chinesische Modelle – mit stabilem Zugang und derselben Messages API, die Sie bereits nutzen.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.