Quelle: OpenAI, Anthropic und Google — abgerufen am 21. August 2026, an allen drei Quellen gegengeprüft am 24. August 2026. Modellgenerationen und Preise wechseln in diesem Feld im Monatstakt; prüfen Sie die Angaben vor einer Architekturentscheidung am Original.Die Wahl des richtigen Large Language Models (LLM) gehört zu den folgenreichsten technischen Entscheidungen einer AI Automation. Ein falsch gewähltes Modell bedeutet entweder überhöhte Kosten, unzureichende Qualität oder beides. Im Jahr 2026 stehen Schweizer Unternehmen vor einer breiten Auswahl: Sieben grosse LLM-Familien konkurrieren um die Gunst der Automation-Entwickler — jede mit eigenen Stärken, Schwächen und Preismodellen.
Dieser Guide analysiert jedes Modell durch die Brille der AI Automation: Nicht theoretische Benchmarks zählen, sondern wie gut ein LLM in realen Automation-Workflows funktioniert — beim Tool Calling, bei der Code-Generierung, beim Instruction Following und bei der Verarbeitung grosser Datenmengen.
Warum die LLM-Wahl über den Erfolg Ihrer Automation entscheidet
In einer typischen AI Automation Pipeline interagiert das LLM mit APIs, verarbeitet strukturierte und unstrukturierte Daten, trifft Entscheidungen und generiert Outputs. Die Anforderungen sind fundamental anders als bei einem einfachen Chatbot:
- Zuverlässigkeit: Ein Agentic Workflow, der regelmässig versagt, ist für Produktions-Automation unbrauchbar
- Strukturierte Outputs: JSON, XML und Funktionsaufrufe müssen konsistent und fehlerfrei sein
- Context-Verarbeitung: RAG-Systeme benötigen grosse Context Windows für präzise Antworten
- Kosten-Effizienz: Bei tausenden täglichen API-Calls summieren sich selbst kleine Preisunterschiede
- Latenz: Echtzeit-Automationen erfordern schnelle Antwortzeiten
Die 7 wichtigsten LLMs für AI Automation 2026
1. Claude (Anthropic)
Claude umfasst vier Modelle: Claude Fable 5 (seit 9. Juni 2026, adaptives Reasoning dauerhaft aktiv, ausgelegt auf langlaufende Agenten), Claude Opus 5 für komplexes agentisches Programmieren, Claude Sonnet 5 für die Kombination aus Tempo und Intelligenz, Claude Haiku 4.5 als schnellstes Modell. Fable 5, Opus 5 und Sonnet 5 fassen 1 Mio. Token Kontext, Haiku 4.5 200'000.
Stärken für Automation: grosse Kontextfenster, adaptives Reasoning bei Fable 5, Auslegung auf langlaufende Agenten und agentisches Programmieren.
Idealer Einsatz: Code-Generierung, RAG-Agents, komplexe Reasoning-Chains, Datenextraktion, Content-Pipelines.
2. GPT-5.6 (OpenAI)
GPT tritt in drei Stufen an: GPT-5.6 Sol (4 USD ein / 20 USD aus je 1 Mio. Token), GPT-5.6 Terra (2 / 12) und GPT-5.6 Luna (0.20 / 1.20). Alle drei fassen 1,05 Mio. Token Kontext, geben bis 128'000 Token aus, Wissensstand 16. Februar 2026.
Stärken für Automation: Functions, Websuche, Dateisuche und Computer Use als eingebaute Werkzeuge; Module für Make, n8n und Zapier sind verbreitet.
Idealer Einsatz: Workflow-Orchestration, Sales-Agents, E-Mail-Automation, Datenanalyse.
3. Gemini (Google)
Gemini umfasst Gemini 3.7 Flash als neuestes Modell — Google führt Gemini 3.6 Flash ausdrücklich als Vorgängergeneration — sowie Gemini 3.5 Flash, Gemini 3.5 Flash-Lite und Gemini 3.1 Flash-Lite; daneben rechnet Google weiterhin Gemini 2.5 Flash-Lite und die ältere 2.0er-Reihe ab. Unter den Modellen der Vergleichstabelle beginnt Text in der kostenpflichtigen Stufe bei 0.10 USD ein und 0.40 USD aus je 1 Mio. Token — das ist Gemini 2.5 Flash-Lite aus der Vorgängergeneration (Text/Bild/Video). Der tiefste Satz der Preisseite ist das nicht: Schon in der Echtzeitabrechnung liegt die ältere 2.0er-Reihe darunter, Gemini 2.0 Flash-Lite kostet dort 0.075 ein und 0.30 aus. Und die Batch-Verarbeitung halbiert beide Sätze noch einmal — Gemini 2.5 Flash-Lite kostet dort 0.05 ein und 0.20 aus, Gemini 2.0 Flash-Lite 0.0375 und 0.15. Die aktuelle Flash-Lite-Reihe liegt über all diesen Sätzen: Gemini 3.1 Flash-Lite bei 0.25 ein und 1.50 aus, Gemini 3.5 Flash-Lite bei 0.30 und 2.50. Gemini 3.7 und 3.6 Flash kosten 0.75 ein und 3.75 aus, dieser Satz allerdings nur bis zum 31. Dezember 2026 — ab 1. Januar 2027 nennt Google 1.50 und 7.50; Gemini 3.5 Flash liegt bei 1.50 und 9.00. Die genannten Sätze decken Text, Bild und Video ab; Audio wird abweichend berechnet: bei Gemini 2.5 Flash-Lite (Vorgängergeneration) etwa kostet Audio-Eingabe 0.30 statt 0.10 USD. In der kostenlosen Stufe nutzt Google die Inhalte zur Produktverbesserung, in der kostenpflichtigen nicht.
Stärken für Automation: Audio- und Bildverarbeitung, Batch-API zum halben Preis, kostenlose Stufe für Prototyping, schnelle Flash-Lite-Varianten.
Idealer Einsatz: Document Processing, Vision-Agents, Chatbots, Audio-Auswertung.
4. Llama 4 (Meta)
Llama 4 stellt seine Gewichte offen bereit und erlaubt damit Self-Hosting in der eigenen Umgebung. Die Llama 4 Community License ist allerdings keine von der Open Source Initiative anerkannte Open-Source-Lizenz: Wer am Release-Datum über 700 Millionen monatlich aktive Nutzer hat, muss eine gesonderte Lizenz bei Meta beantragen, und Produkte müssen «Built with Llama» sichtbar ausweisen.
Stärken für Automation: Self-Hosting, keine Anbieterbindung, offen verfügbare Gewichte, aktive Community.
Idealer Einsatz: Datenschutzkritische Automation, Edge-Deployment, Custom Fine-Tuning.
5. Mistral Large 3 (Mistral AI)
Mistral aus Frankreich bietet mit Mistral Large 3 (API-Name mistral-large-3-25-12) ein europäisches LLM. Die Anbieterdokumentation beschreibt es als «state-of-the-art, open-weight, general-purpose multimodal model» — eine besondere Stärke in der Mehrsprachigkeit schreibt sie dem Modell an dieser Stelle nicht zu.
Stärken für Automation: offen verfügbare Gewichte, multimodale und allgemein einsetzbare Auslegung.
Idealer Einsatz: Self-Hosting-Szenarien mit europäischem Anbieter, allgemeine Automation.
6. Kimi K3 (Moonshot AI)
Kimi K3 von Moonshot AI wird vor allem für Coding-Aufgaben und lange Dokumente eingesetzt; die Anbieterdoku führt kimi-k3 als das leistungsfähigste Modell der Reihe. Zu den Vorgängern hält sie fest, dass kimi-k2.5 und die moonshot-v1-Serie für neu registrierte Nutzer nicht mehr verfügbar sind und am 31. August abgeschaltet werden — eine Jahreszahl nennt die Seite an dieser Stelle nicht.
Stärken für Automation: Coding-Fähigkeiten, Auslegung auf lange Eingaben.
Idealer Einsatz: sehr grosse Dokumente, Code-Analyse, Forschungs-Agents.
7. MiniMax-M3
MiniMax-M3 (Juni 2026) positioniert sich preisorientiert und mit Fokus auf strukturierte Aufgaben; die Vorgängerstufen MiniMax-M2.7 und -M2.5 bleiben verfügbar. Die offizielle Schreibweise trägt das «M», die Kurzform «MiniMax 2.7» kommt in der Anbieterdokumentation nicht vor.
Stärken für Automation: strukturierte Outputs, Auslegung auf hohes Anfragevolumen.
Idealer Einsatz: hochvolumige Automation-Tasks, Batch-Verarbeitung.
Für Llama 4, Mistral Large 3, Kimi K3 und MiniMax-M3 liegen uns keine an der Quelle geprüften Preisangaben vor; die Tabelle führt deshalb nur die drei geprüften Anbieter. Die Modellnamen, die Llama-4-Lizenz und die Abschalt- und Erscheinungsdaten sind gegen die vier unten verlinkten Anbieterdokumentationen geprüft (Stand 24. August 2026) — die Belege stehen einzeln in der Quellenzeile, damit Sie sie nachschlagen können.
Quelle: OpenAI, Anthropic, Google — Modelle und Google — Preise; für die vier übrigen Familien: Llama 4 Community License («greater than 700 million monthly active users … you must request a license from Meta»; «prominently display 'Built with Llama'»), Mistral — Models overview (Mistral Large 3,mistral-large-3-25-12, «A state-of-the-art, open-weight, general-purpose multimodal model»), Moonshot AI — Model List («Following the Kimi K3 launch,kimi-k2.5and themoonshot-v1series are no longer available to newly registered users (full platform sunset on August 31)») und MiniMax — Models (MiniMax-M3, «Jun. 1, 2026»; MiniMax-M2.7 und MiniMax-M2.5 weiterhin gelistet) — alle abgerufen am 24. August 2026.
Vergleichstabelle: Preise und Kontextfenster
| Modell | Kontextfenster | Input / 1 Mio. Token | Output / 1 Mio. Token |
|---|---|---|---|
| Claude Fable 5 | 1 Mio. Token | 10 USD | 50 USD |
| Claude Opus 5 | 1 Mio. Token | 5 USD | 25 USD |
| Claude Sonnet 5 | 1 Mio. Token | 2 USD | 10 USD |
| Claude Haiku 4.5 | 200'000 Token | 1 USD | 5 USD |
| GPT-5.6 Sol | 1,05 Mio. Token | 4 USD | 20 USD |
| GPT-5.6 Terra | 1,05 Mio. Token | 2 USD | 12 USD |
| GPT-5.6 Luna | 1,05 Mio. Token | 0.20 USD | 1.20 USD |
| Gemini 3.5 Flash-Lite | 1'048'576 Token | 0.30 USD | 2.50 USD |
| Gemini 3.1 Flash-Lite | 1'048'576 Token | 0.25 USD | 1.50 USD |
| Gemini 2.5 Flash-Lite (Vorgängergeneration) | 1'048'576 Token | 0.10 USD | 0.40 USD |
Quelle: OpenAI, Anthropic und Google — Preise; die Gemini-Kontextfenster von den Modell-Unterseiten Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite und Gemini 2.5 Flash-Lite (je «Input token limit 1,048,576» und «Output token limit 65,536») — alle abgerufen am 24. August 2026.
Entscheidungsmatrix: Welches LLM für welchen Use Case
RAG und Knowledge Management
Empfehlung: Claude Sonnet 5 1 Mio. Token Kontext verarbeiten umfangreiche Wissensbasen in einem Durchgang; Anthropic positioniert Sonnet 5 als Kombination aus Tempo und Intelligenz. Für RAG-Systeme ein guter Ausgangspunkt.Chatbot und Kundeninteraktion
Empfehlung: GPT-5.6 Luna oder Gemini 3.5 Flash-Lite Für Chatbots zählen Geschwindigkeit und Kosten. GPT-5.6 Luna kostet als günstigste der drei GPT-Stufen 0.20 USD ein und 1.20 USD aus, Gemini 3.5 Flash-Lite 0.30 und 2.50 — beim Ausgabepreis liegt Luna also gut die Hälfte tiefer. Noch günstiger, aber eine Generation älter, ist Gemini 2.5 Flash-Lite mit 0.10 und 0.40 USD; rechnen Sie diesen Satz nicht auf die 3.5er-Empfehlung an. Googles kostenlose Stufe erlaubt Prototyping — dort werden die Inhalte allerdings zur Produktverbesserung genutzt.Code-Agents und Entwickler-Tools
Empfehlung: Claude Opus 5 Anthropic legt Opus 5 ausdrücklich auf komplexes agentisches Programmieren aus. Für Agenten, die über Stunden laufen, ist Claude Fable 5 die Alternative — ausgelegt auf langlaufende Agenten.Content-Generierung und Marketing
Empfehlung: GPT-5.6 Terra GPT integriert sich in Marketing-Tools und Content-Plattformen; Websuche und Dateisuche sind eingebaut.Datenanalyse und Reporting
Empfehlung: GPT-5.6 Terra oder Claude Sonnet 5 Beide Modelle liegen preislich gleichauf beim Input. GPT punktet mit nativen Make- und n8n-Modulen, Claude mit dem etwas günstigeren Output-Preis.Multimodale Verarbeitung
Empfehlung: Gemini Google rechnet Audio- und Bildinhalte gesondert ab. Für Automationen, die Dokumente scannen oder Audio auswerten, ist die Gemini-Familie der naheliegende Startpunkt.Datenschutzkritische Automation
Empfehlung: Llama 4 (Self-Hosted) Für Unternehmen mit strengen Datenschutzanforderungen — insbesondere im Schweizer Finanz- und Gesundheitssektor — hält Self-Hosting die Daten in der eigenen Umgebung und entscheidet damit über den Bearbeitungsort. Bearbeitungsgrundsätze, Informationspflicht, Betroffenenrechte, Bearbeitungsverzeichnis und Datensicherheit bleiben davon unberührt und liegen weiter beim Unternehmen. Llama 4 ist dafür eine etablierte Option mit offen verfügbaren Gewichten.Multi-Model-Strategie: Warum nicht nur ein LLM
Für die meisten grösseren Automationen trägt die Kombination mehrerer Modelle weiter als ein einzelnes. Bei erdinc.ai setzen wir selbst auf eine Multi-Model-Architektur:
Routing nach Komplexität
- Einfache Tasks (Klassifikation, Extraktion, Formatierung): GPT-5.6 Luna (0.20 / 1.20 USD) oder Gemini 3.5 Flash-Lite (0.30 / 2.50 USD) → unterste Kostenstufe des Routings unter den aktuellen Generationen; wer die Vorgängergeneration zulässt, kommt mit Gemini 2.5 Flash-Lite auf 0.10 / 0.40 USD
- Standard-Tasks (Zusammenfassungen, Q&A, Standard-Agents): Claude Haiku 4.5 oder GPT-5.6 Terra → gutes Preis-Leistungs-Verhältnis
- Komplexe Tasks (Reasoning, Coding, Analyse): Claude Opus 5 oder GPT-5.6 Sol → höchste Qualität
- Langlaufende Agenten: Claude Fable 5 → dauerhaft aktives adaptives Reasoning
Vertiefen Sie Ihr Wissen:
Vorteile der Multi-Model-Strategie
- Kostenreduktion: Zwischen GPT-5.6 Luna und GPT-5.6 Sol liegt beim Input der Faktor 20 (siehe Tabelle) — jede Aufgabe eine Stufe tiefer senkt die Rechnung
- Ausfallsicherheit: kein Single Point of Failure bei Anbieterausfällen
- Best-of-Breed: Jedes Modell wird dort eingesetzt, wo es am stärksten ist
- Zukunftssicherheit: Neue Modelle können einfach integriert werden
Implementierung mit AI Agent Frameworks
AI Agent Frameworks wie LangChain und CrewAI unterstützen Multi-Model-Routing nativ. Ein typisches Setup:
Router Agent (Claude Haiku 4.5) → Klassifiziert die Aufgabe
├── Einfach → GPT-5.6 Luna oder Gemini 3.5 Flash-Lite
├── Standard → GPT-5.6 Terra oder Claude Sonnet 5
├── Komplex → Claude Opus 5 oder GPT-5.6 Sol
└── Langlaufend → Claude Fable 5
Kosten-Optimierung: LLM-Ausgaben im Griff
Für Schweizer Unternehmen, die AI Automation im grossen Stil betreiben, wird die Token-Rechnung zu einem eigenen Kostenposten. Wie hoch er ausfällt, ergibt sich aus dem Volumen und den Preisen der Tabelle oben. Effektive Strategien zur Optimierung:
Caching und Prompt-Optimierung
- Prompt Caching: Wiederkehrende System-Prompts lassen sich cachen — die Konditionen dafür stehen in der Preisliste des jeweiligen Anbieters
- Prompt-Komprimierung: Kürzere, präzisere Prompts reduzieren Token-Verbrauch durch gezieltes Prompt Engineering
- Response-Caching: Identische Anfragen aus dem Cache bedienen statt erneut das LLM aufzurufen
Batch-Verarbeitung
Googles Batch-API kostet die Hälfte des Echtzeitpreises; für die übrigen Anbieter prüfen Sie die jeweilige Preisseite. Ideal für:
- Nächtliche Datenverarbeitung
- Content-Generierung in Bulk
- Periodische Analyse-Jobs
Modell-Downsizing
Nicht jede Aufgabe braucht das leistungsstärkste Modell. Ein systematisches Evaluieren, welche Tasks mit günstigeren Modellen gleich gut funktionieren, spart erheblich. Messen Sie die Qualität mit automatisierten Evals, bevor Sie downgraden.
Praktische Empfehlung für Schweizer Unternehmen
Als Ausgangspunkt für ein Automation-Setup empfehlen wir folgende Aufteilung:
- Primary Stack: Claude Sonnet 5 — für anspruchsvolle Aufgaben, AI Agents und Code-Generierung; bei komplexem agentischem Programmieren Claude Opus 5
- Speed/Cost Layer: GPT-5.6 Luna oder Gemini 3.5 Flash-Lite — für Chatbots, einfache Klassifikation und hochvolumige Tasks
- Integration Layer: GPT-5.6 Terra — für native Make/n8n-Module und Standard-Workflows
- Datenschutz Layer: Llama 4 — für Self-Hosted-Anforderungen in regulierten Branchen
Häufig gestellte Fragen
- Welches LLM ist das beste für AI Automation im Jahr 2026?
Es gibt kein einzelnes «bestes» LLM — die Wahl hängt vom Use Case ab. Anthropic legt Claude Opus 5 auf agentisches Programmieren aus, Claude Sonnet 5 auf Tempo und Intelligenz. OpenAI staffelt GPT-5.6 in Sol, Terra und Luna, alle mit 1,05 Mio. Token Kontext. Google deckt mit Gemini den Einstieg über eine kostenlose Stufe ab. Am tragfähigsten ist eine Multi-Model-Architektur.
- Was kostet ein LLM für AI Automation pro Monat?
Szenario, kein Kundenprojekt. Die Kosten folgen direkt aus den Token-Preisen der Tabelle. Beispiel mit angenommenem Volumen: 50'000 Aufrufe im Monat zu je 2'000 Eingabe- und 500 Ausgabe-Token ergeben 100 Mio. Eingabe- und 25 Mio. Ausgabe-Token — mit Claude Sonnet 5 rund 450 USD, mit GPT-5.6 Luna rund 50 USD. Die Volumenannahmen sind Beispielwerte, keine Messung.
Quelle: Anthropic und OpenAI — abgerufen am 24. August 2026.
- Ist ein Open-Weight-LLM wie Llama 4 für Unternehmen geeignet?
Llama 4 lässt sich im Unternehmen betreiben — vorausgesetzt, Ihr Unternehmen hat die Kapazität für Self-Hosting. Vorteile: die Daten bleiben in der eigenen Umgebung, keine laufenden API-Kosten, Unabhängigkeit von Cloud-Anbietern. Nachteile: Betriebsaufwand für GPU-Infrastruktur, keine Managed Services. Zu beachten ist die Lizenz: Llama 4 steht unter der Llama 4 Community License, nicht unter einer von der Open Source Initiative anerkannten Open-Source-Lizenz — sie verlangt den Hinweis «Built with Llama», und wer am Release-Datum von Llama 4 über 700 Millionen monatlich aktive Nutzer hat, muss eine gesonderte Lizenz bei Meta beantragen. Für regulierte Branchen wie Fintech oder Pharma kann Self-Hosting die praktikabelste Option sein.
- Wie implementiere ich eine Multi-Model-Strategie?
Der einfachste Einstieg ist ein Router-Pattern: Ein günstiges Modell (z.B. Claude Haiku 4.5) klassifiziert eingehende Anfragen nach Komplexität und leitet sie weiter. Frameworks wie LangChain und CrewAI bieten dafür native Unterstützung. Alternativ implementieren Plattformen wie Make und n8n Multi-Model-Routing über bedingte Verzweigungen in Workflows. Starten Sie mit zwei Modellen (ein Premium- und ein Budget-Modell) und erweitern Sie schrittweise.
- Welche Rolle spielt der Datenschutz bei der LLM-Wahl in der Schweiz?
Das Schweizer Datenschutzgesetz (nDSG) erfordert eine sorgfältige Prüfung, wohin Daten bei API-Calls gesendet werden. Wie ein Anbieter Ihre Daten verarbeitet, steht in dessen aktuellen Vertragsbedingungen; eine Einschätzung zur Rechtslage einzelner Anbieter geben wir hier nicht ab. Belegt ist die Stufen-Unterscheidung bei Google: In der kostenlosen Stufe nutzt Google die Inhalte zur Produktverbesserung, in der kostenpflichtigen nicht. Die weitgehendste Kontrolle über den Bearbeitungsort gibt Self-Hosting, etwa mit Llama 4 — die übrigen Pflichten des nDSG nimmt es Ihnen nicht ab.
Quellen
- OpenAI, Anthropic und Google — abgerufen am 21. August 2026, an allen drei Quellen gegengeprüft am 24. August 2026. Modellgenerationen und Preise wechseln in diesem Feld im Monatstakt; prüfen Sie die Angaben vor einer Architekturentscheidung am Original.
- OpenAI, Anthropic, Google — Modelle und Google — Preise; für die vier übrigen Familien: Llama 4 Community License («greater than 700 million monthly active users … you must request a license from Meta»; «prominently display 'Built with Llama'»), Mistral — Models overview (Mistral Large 3, `mistral-large-3-25-12`, «A state-of-the-art, open-weight, general-purpose multimodal model»), Moonshot AI — Model List («Following the Kimi K3 launch, `kimi-k2.5` and the `moonshot-v1` series are no longer available to newly registered users (full platform sunset on August 31)») und MiniMax — Models (MiniMax-M3, «Jun. 1, 2026»; MiniMax-M2.7 und MiniMax-M2.5 weiterhin gelistet) — alle abgerufen am 24. August 2026.
- OpenAI, Anthropic und Google — Preise; die Gemini-Kontextfenster von den Modell-Unterseiten Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite und Gemini 2.5 Flash-Lite (je «Input token limit 1,048,576» und «Output token limit 65,536») — alle abgerufen am 24. August 2026.
- Anthropic und OpenAI — abgerufen am 24. August 2026.

