Open-Weight-Modelle 2026 DeepSeek V4, Qwen3.8, gpt-oss, Llama.
Open-Weight-Modelle sind KI-Sprachmodelle, deren Gewichte frei herunterladbar sind und die Sie auf eigener Hardware oder in einer Cloud Ihrer Wahl betreiben können. Stand Oktober 2026 sind die wichtigsten Kandidaten DeepSeek V4 (MIT-Lizenz), Qwen3.8 von Alibaba (27B unter Apache 2.0, das große Modell unter eigener Lizenz), OpenAIs gpt-oss (Apache 2.0) und Metas Llama 4 (eigene Community-Lizenz); Mistral hat für Large 4 offene Gewichte bis Ende Oktober angekündigt. Für IT-Leitungen entscheiden drei Dinge über die Eignung: Lizenz, Hardwarebedarf und die Frage, ob Daten das eigene Haus verlassen. Dieser Vergleich ordnet die Modelle nach Größe, aktiven Parametern, Kontext und Lizenz, zeigt den groben Hardwarebedarf und trennt sauber zwischen offenem Gewicht und der App des Herstellers. Modelle und Versionen ändern sich derzeit im Monatstakt; prüfen Sie Details vor einer Entscheidung auf der jeweiligen Modellseite.
Hinweis: Dieser Beitrag gibt den Rechts- und Steuerstand zum unten angegebenen Datum allgemein wieder. Er ist keine Rechts- oder Steuerberatung und ersetzt nicht die Prüfung Ihres Einzelfalls durch eine Rechtsanwältin, einen Rechtsanwalt, eine Steuerberaterin oder einen Steuerberater. Alle Angaben ohne Gewähr für Vollständigkeit und Aktualität.
Was sind Open-Weight-Modelle und was nicht?
Ein Sprachmodell besteht im Kern aus Milliarden von Zahlenwerten, den Gewichten (englisch „weights“). Bei einem Open-Weight-Modell veröffentlicht der Hersteller diese Gewichte zum Herunterladen, meist auf Hugging Face. Damit können Sie das Modell auf eigenen Servern, in einem deutschen Rechenzentrum oder bei einem Cloud-Anbieter Ihrer Wahl betreiben, es an eigene Daten anpassen (Fine-Tuning) und es ohne Verbindung zum Hersteller nutzen.
Was Open-Weight-Modelle nicht sind:
- Nicht automatisch Open Source. Trainingsdaten und Trainingscode bleiben in aller Regel unveröffentlicht. Sie bekommen das fertige Ergebnis, nicht das Rezept.
- Nicht automatisch frei nutzbar. Die Lizenz entscheidet, was erlaubt ist. Zwischen einer MIT-Lizenz und einer Herstellerlizenz mit Ausschlussklauseln liegen Welten.
- Nicht dasselbe wie die App des Herstellers. Wer die DeepSeek-App oder die Weboberfläche eines Anbieters nutzt, schickt Daten an dessen Server. Das hat mit dem selbst betriebenen Modell nichts zu tun.
Ein Begriff taucht in diesem Vergleich ständig auf: Mixture of Experts (MoE). Solche Modelle bestehen aus vielen Teilnetzen („Experten“), von denen pro Wort nur ein kleiner Teil rechnet. Die Gesamtzahl der Parameter bestimmt, wie viel Speicher Sie brauchen. Die Zahl der aktiven Parameter bestimmt, wie schnell das Modell antwortet. Ein MoE-Modell mit 1,6 Bio. Parametern muss also komplett in den Speicher passen, rechnet aber pro Token nur mit einem Bruchteil davon.
Welche offenen KI-Modelle sind im Oktober 2026 relevant?
Die folgende Tabelle fasst die relevanten Modelle zusammen. Grundlage sind die Modellseiten der Hersteller auf Hugging Face und deren Ankündigungen, Stand 06.10.2026. „Kontext“ meint die maximale Textmenge, die das Modell in einem Durchgang verarbeitet, gemessen in Tokens (in englischen Texten entspricht ein Token grob einem Dreiviertelwort, im Deutschen ist das Verhältnis ungünstiger).
| Modell | Parameter gesamt / aktiv | Kontext | Lizenz | Grober Hardwarebedarf |
|---|---|---|---|---|
| DeepSeek V4-Pro | rund 1,6 Bio. / 49 Mrd. (MoE) | 1 Mio. | MIT | GPU-Cluster; Hersteller nennt einen Knoten mit 4 × NVIDIA GB300 als Beispiel |
| DeepSeek V4-Flash | 284 Mrd. / 13 Mrd. (MoE) | 1 Mio. | MIT | Mehrere Rechenzentrums-GPUs |
| Qwen3.8-2.4T-A95B | 2,4 Bio. / 95 Mrd. (MoE) | 262.144, erweiterbar auf rund 1 Mio. | eigene Qwen-Lizenz (Qwen3.8-Max License) | Mehrere GPU-Knoten |
| Qwen3.8-27B | 27 Mrd. (dicht), mit Bild- und Videoeingabe | 262.144, erweiterbar auf 1 Mio. | Apache 2.0 | Eine GPU, je nach Quantisierung ab etwa 16–32 GB |
| gpt-oss-120b | 117 Mrd. / 5,1 Mrd. (MoE) | 131.072 | Apache 2.0 | Eine 80-GB-GPU (z. B. H100) |
| gpt-oss-20b | 21 Mrd. / 3,6 Mrd. (MoE) | 131.072 | Apache 2.0 | 16 GB Speicher, auch Workstation oder Laptop |
| Llama 4 Scout | 109 Mrd. / 17 Mrd. (MoE) | 10 Mio. | Llama 4 Community License | Eine H100 mit int4-Quantisierung |
| Llama 4 Maverick | 400 Mrd. / 17 Mrd. (MoE) | 1 Mio. | Llama 4 Community License | Ein H100-Server (DGX) in FP8 |
Einige Einordnungen zur Tabelle:
- DeepSeek hat V4 im April 2026 als Vorschau vorgestellt, die Gewichte standen schon damals unter MIT-Lizenz bereit. Die finalen Fassungen folgten Ende Juli (V4-Flash) und Mitte August (V4-Pro), ebenfalls unter MIT. Inzwischen gibt es mit V4.1-Flash eine neuere, multimodale Flash-Variante, ebenfalls unter MIT. Benchmark-Werte, die in sozialen Medien kursieren, sollten Sie nur übernehmen, wenn sie aus offiziellen Kanälen stammen.
- Qwen3.8 erschien im August 2026. Für den Eigenbetrieb ist das 27B-Modell die interessante Größe: Apache 2.0, Bild- und Videoeingabe, sehr langer Kontext, und es läuft laut Modellseite mit gängigen Werkzeugen wie vLLM, SGLang, llama.cpp, Ollama und LM Studio.
- gpt-oss stammt vom August 2025. Einen Nachfolger hat OpenAI bisher nicht veröffentlicht; in der gpt-oss-Familie kamen auf Hugging Face nur die darauf aufbauenden Sicherheitsmodelle gpt-oss-safeguard hinzu. Die Modelle sind also nicht mehr neu, aber gut dokumentiert und effizient.
- Llama 4 (April 2025) ist weiterhin die neueste offene Llama-Generation auf Hugging Face. Metas Modell Muse Spark vom April 2026 ist nicht als offene Gewichte erschienen, sondern über Meta AI und eine private API-Vorschau zugänglich. Im August 2026 hat Meta aber mit Muse Glimmer ein kleineres offenes Modell veröffentlicht: rund 30 Mrd. Parameter (dicht), Text- und Bildeingabe, Apache 2.0, laut Modellseite in 4-Bit-Quantisierung unter 20 GB groß.
- Mistral Large 4 ist seit dem 06.10.2026 als Public Preview über die API verfügbar: 1 Bio. Parameter, davon 49 Mrd. aktiv, multimodal, trainiert und betrieben in Mistrals europäischen Rechenzentren. Offene Gewichte sind für Ende Oktober angekündigt, eine konkrete Lizenz hat Mistral noch nicht genannt. Das ist ein Ausblick, kein verfügbares Angebot.
Die Auswahl ist nicht vollständig. Weitere offene Modellfamilien, etwa Gemma von Google oder GLM von Z.ai, kommen in Frage, und neue Versionen erscheinen laufend.
Lizenzen im Vergleich: MIT, Apache 2.0 und Herstellerlizenzen.
Für Unternehmen ist die Lizenz oft wichtiger als ein paar Benchmark-Punkte. Drei Lizenztypen spielen derzeit eine Rolle:
| Lizenz | Modelle | Was das praktisch bedeutet |
|---|---|---|
| MIT | DeepSeek V4-Pro, V4-Flash, V4.1-Flash | Sehr freizügig: kommerzielle Nutzung, Anpassung und Weitergabe erlaubt; Copyright- und Lizenzhinweis müssen erhalten bleiben. |
| Apache 2.0 | Qwen3.8-27B, gpt-oss-120b, gpt-oss-20b, Muse Glimmer | Ebenfalls freizügig, zusätzlich mit ausdrücklicher Patentlizenz; Änderungen am Modell sind kenntlich zu machen. |
| Herstellerlizenz | Llama 4 (Community License), Qwen3.8-2.4T-A95B (Qwen3.8-Max License) | Individuelle Bedingungen: Nutzungsrichtlinien, Schwellenwerte, regionale Einschränkungen. Vor dem Einsatz von der Rechtsabteilung prüfen lassen. |
Bei Llama 4 sind zwei Klauseln für deutsche Unternehmen entscheidend. Erstens müssen Anbieter mit mehr als 700 Mio. monatlich aktiven Nutzern eine gesonderte Lizenz bei Meta anfragen; das betrifft praktisch niemanden im Mittelstand. Zweitens, und das ist relevanter: Die Llama-4-Nutzungsrichtlinie gewährt Personen mit Wohnsitz und Unternehmen mit Hauptsitz in der EU die Rechte aus der Lizenz für die multimodalen Llama-4-Modelle nicht. Da Scout und Maverick nativ multimodal sind, scheidet Llama 4 für den Eigenbetrieb durch ein Unternehmen mit Sitz in Deutschland faktisch aus. Laut Richtlinie gilt die Einschränkung nicht für Endnutzer von Produkten, in die das Modell eingebaut ist.
Eine Lizenzprüfung ersetzt dieser Überblick nicht. Er zeigt aber, wo Sie genauer hinsehen sollten: Bei MIT und Apache 2.0 geht es meist um Formalien, bei Herstellerlizenzen um die Frage, ob Sie das Modell überhaupt einsetzen dürfen.
Welche Hardware brauchen offene Modelle?
Für den Speicherbedarf gibt es eine einfache Faustregel: Parameter mal Bytes pro Parameter. Im üblichen Auslieferungsformat BF16 braucht jeder Parameter 2 Bytes, in FP8 1 Byte, bei 4-Bit-Quantisierung etwa ein halbes Byte. Quantisierung heißt, die Zahlenwerte mit weniger Stellen zu speichern; das spart Speicher und kostet meist etwas Qualität. Hinzu kommt Speicher für den Kontext, den sogenannten KV-Cache, der bei langen Dokumenten erheblich wachsen kann.
Rechenbeispiel: Qwen3.8-27B belegt in BF16 rund 54 GB, in FP8 rund 27 GB und in 4 Bit rund 14 GB, jeweils ohne KV-Cache. DeepSeek V4-Flash mit 284 Mrd. Parametern bräuchte in FP8 rechnerisch rund 284 GB nur für die Gewichte, Qwen3.8-2.4T-A95B etwa 2,4 TB. DeepSeek liefert die Experten-Gewichte bereits in FP4 aus, was den Bedarf senkt, an der Größenordnung Rechenzentrum aber nichts ändert.
Daraus ergeben sich drei realistische Stufen:
- Workstation oder Laptop mit 16–32 GB Grafikspeicher: gpt-oss-20b, quantisiertes Qwen3.8-27B. Gut für Pilotprojekte, Einzelplatz-Assistenten und Tests.
- Ein Server mit einer 80-GB-GPU: gpt-oss-120b, Qwen3.8-27B in BF16, Llama 4 Scout quantisiert. Damit lassen sich interne Assistenten für Abteilungen betreiben.
- GPU-Cluster im Rechenzentrum: DeepSeek V4-Pro und V4-Flash, Qwen3.8-2.4T-A95B, absehbar auch Mistral Large 4. Das bedeutet eine erhebliche Investition oder eine Mietlösung bei einem GPU-Anbieter, die sich nur bei hoher Auslastung rechnet.
Die aktiven Parameter helfen bei der Geschwindigkeit, nicht beim Speicher. gpt-oss-120b mit 5,1 Mrd. aktiven Parametern antwortet deshalb deutlich flotter als ein dichtes Modell ähnlicher Gesamtgröße, braucht aber trotzdem die volle 80-GB-Karte. Wie viele Nutzer gleichzeitig bedient werden können, hängt zusätzlich von Kontextlänge, Software (etwa vLLM oder SGLang) und Lastprofil ab und lässt sich nur im Test sauber bestimmen.
Offenes Gewicht vs. App des Herstellers: der Datenschutzunterschied.
Viele Diskussionen über DeepSeek oder Qwen werfen zwei Dinge zusammen, die rechtlich und technisch getrennt sind:
- Die App oder API des Herstellers: Ihre Eingaben, Dokumente und Chatverläufe gehen an dessen Server. Für die DSGVO zählt dann, wo diese Server stehen und ob ein Drittlandtransfer zulässig ist.
- Die selbst betriebenen Gewichte: Das Modell läuft auf Ihrer Hardware oder bei einem Hoster Ihrer Wahl. Das Modell selbst baut keine Verbindung zum Hersteller auf; welche Daten wohin fließen, bestimmen Ihre Infrastruktur und die eingesetzte Software.
Wie ernst der Unterschied ist, zeigt ein Fall aus Berlin. Die Berliner Beauftragte für Datenschutz und Informationsfreiheit hat die DeepSeek-App am 27.06.2025 bei Apple und Google nach Art. 16 des Digital Services Act als rechtswidrigen Inhalt gemeldet. Begründung: Die App übermittelt Nutzerdaten wie Eingaben, Chatverläufe und hochgeladene Dateien an Server in China, ohne dass ein der EU gleichwertiges Schutzniveau nachgewiesen sei. Das betrifft die App, nicht die MIT-lizenzierten Gewichte auf Ihrem Server.
Daraus folgt nicht, dass der Eigenbetrieb automatisch unbedenklich ist. Sie übernehmen dann selbst die Verantwortung für Zugriffsrechte, Protokollierung, Löschkonzepte und die Absicherung der Server. Auch Hosting-Anbieter, die ein offenes Modell als Dienst anbieten, sind wieder Auftragsverarbeiter mit eigenem Vertrag und Standort. Mehr zu diesem Thema finden Sie im Beitrag zu selbst gehosteten LLMs und Datenschutz.
Wann lohnt sich der Eigenbetrieb und wann nicht?
Eigenbetrieb lohnt sich vor allem in vier Situationen:
- Daten dürfen das Haus nicht verlassen: Personaldaten, Gesundheitsdaten, Geschäftsgeheimnisse, Entwicklungsunterlagen.
- Hohes, planbares Volumen: etwa die automatische Klassifizierung von Tausenden Dokumenten täglich, bei der API-Kosten schnell steigen.
- Anpassung an eigene Daten: Fine-Tuning für Fachsprache oder feste Ausgabeformate, das bei geschlossenen Modellen nur eingeschränkt möglich ist.
- Unabhängigkeit vom Anbieter: Ein Modell, das auf Ihrem Server läuft, wird nicht über Nacht abgekündigt oder im Verhalten verändert.
Dagegen sprechen ebenso handfeste Gründe. Die stärksten offenen Modelle brauchen Hardware, die sich nur bei hoher Auslastung rechnet. Betrieb, Updates, Monitoring und Sicherheit binden Personal. Und für viele Büroaufgaben ist ein geschlossenes Modell mit europäischer Datenverarbeitung und Unternehmensvertrag schlicht einfacher. Eine Abwägung zwischen beiden Welten finden Sie im Beitrag KI in der Cloud vs. On-Premise.
Grenzen und Risiken, die Sie vor einer Entscheidung kennen sollten:
- Qualitätsabstand: Kleine Modelle, die auf einer GPU laufen, erreichen bei komplexen Aufgaben meist nicht das Niveau der großen geschlossenen Modelle. Benchmarks der Hersteller sind kein Ersatz für eigene Tests.
- Sicherheit und Missbrauch: Offene Gewichte lassen sich verändern, auch Schutzmechanismen. Sie sind selbst dafür verantwortlich, was Ihr System ausgibt und wer es nutzen darf.
- Tempo: Modellversionen wechseln im Monatstakt. Planen Sie die Infrastruktur so, dass ein Modellwechsel kein Großprojekt wird.
- Herkunft und Inhalte: Modelle spiegeln Trainingsdaten und Vorgaben ihres Herstellers wider, etwa bei politisch sensiblen Themen. Für Faktenfragen gehört eine Prüfung gegen eigene Quellen dazu.
- Regulierung: Wer ein offenes Modell in eigene Produkte einbaut, sollte prüfen, welche Pflichten aus dem EU AI Act für den konkreten Einsatz folgen. Die Transparenzpflichten nach Art. 50 gelten seit 02.08.2026.
So testen Sie ein offenes Modell für Ihren Anwendungsfall.
Ein strukturierter Test lässt sich oft in wenigen Wochen durchführen und beantwortet die Frage besser als jede Tabelle. So gehen Sie vor:
- Anwendungsfall eng festlegen: etwa „Eingangsrechnungen klassifizieren“ oder „interne Richtlinien beantworten“, nicht „KI für alles“.
- Testset aufbauen: 50 bis 200 echte, anonymisierte Beispiele mit erwarteter Antwort. Das ist die Grundlage für jeden fairen Vergleich.
- Lizenz vorab klären: Herstellerlizenzen und Nutzungsrichtlinien prüfen lassen, bevor Zeit in die Technik fließt.
- Klein starten: Mit gpt-oss-20b oder einem quantisierten Qwen3.8-27B lokal testen, zum Beispiel über Ollama oder LM Studio. Erst wenn die Qualität reicht, über größere Modelle und Server nachdenken.
- Gegen ein geschlossenes Modell messen: Dasselbe Testset mit einem Unternehmensmodell durchlaufen lassen. So sehen Sie den Abstand in Qualität und Kosten.
- Betrieb mitdenken: Wer betreibt den Server, wer spielt Updates ein, wie werden Zugriffe protokolliert, was passiert bei einem Modellwechsel?
Wenn Sie diese Schritte nicht allein gehen wollen: In der KI-Beratung klären wir gemeinsam Anwendungsfall, Testaufbau und die Frage, ob Eigenbetrieb oder ein Unternehmensdienst besser passt.
Häufige Fragen.
Was ist der Unterschied zwischen Open Source und Open Weight bei KI?
Bei Open-Weight-Modellen veröffentlicht der Hersteller die fertigen Modellgewichte, sodass Sie das Modell selbst betreiben und anpassen können. Trainingsdaten und Trainingscode bleiben meist geheim. Open Source im engeren Sinn würde auch diese offenlegen. Was Sie mit den Gewichten tun dürfen, regelt die jeweilige Lizenz, etwa MIT, Apache 2.0 oder eine Herstellerlizenz.
Ist DeepSeek datenschutzkonform nutzbar?
Das hängt davon ab, wie Sie es nutzen. Die DeepSeek-App überträgt Daten nach China; die Berliner Datenschutzbeauftragte hat sie deshalb 2025 bei Apple und Google gemeldet. Die MIT-lizenzierten Gewichte von DeepSeek V4 können Sie dagegen auf eigener Hardware ohne Verbindung zum Hersteller betreiben. Dann tragen Sie selbst die Verantwortung für Datenschutz und Sicherheit.
Welches offene KI-Modell läuft auf einem normalen Rechner?
Stand Oktober 2026 eignen sich vor allem gpt-oss-20b, das laut OpenAI mit 16 GB Speicher auskommt, und eine quantisierte Fassung von Qwen3.8-27B. Beide lassen sich mit Werkzeugen wie Ollama oder LM Studio lokal starten. Für den produktiven Einsatz mehrerer Nutzer ist ein Server mit leistungsfähiger GPU sinnvoller.
Dürfen Unternehmen in der EU Llama 4 nutzen?
Für den Eigenbetrieb ist das schwierig. Die Llama-4-Nutzungsrichtlinie gewährt Unternehmen mit Hauptsitz in der EU keine Rechte an den multimodalen Llama-4-Modellen, und Scout sowie Maverick sind multimodal. Endnutzer von Produkten, die das Modell enthalten, sind ausgenommen. Lassen Sie die Lizenz im Zweifel juristisch prüfen und ziehen Sie Alternativen wie Qwen3.8-27B, gpt-oss oder Metas Muse Glimmer in Betracht.
Wann kommen die offenen Gewichte von Mistral Large 4?
Mistral hat Large 4 am 06.10.2026 als Public Preview über die API gestartet und offene Gewichte bis Ende Oktober 2026 angekündigt. Die Lizenz ist noch nicht bekannt. Mit 1 Bio. Parametern, davon 49 Mrd. aktiv, wird das Modell für den Eigenbetrieb Rechenzentrums-Hardware benötigen.
Quellen und Stand.
- Qwen3.8-27B Model Card — Qwen (Alibaba) / Hugging Face
- Qwen3.8-2.4T-A95B Model Card — Qwen (Alibaba) / Hugging Face
- DeepSeek-V4-Pro-0813 Model Card — DeepSeek / Hugging Face
- DeepSeek-V4-Pro (Preview) Model Card — DeepSeek / Hugging Face
- gpt-oss-120b Model Card — OpenAI / Hugging Face
- Llama 4 Scout 17B-16E Instruct Model Card — Meta / Hugging Face
- Llama 4 Acceptable Use Policy — Meta
- Muse-Glimmer-30B Model Card — Meta / Hugging Face
- Berlin Commissioner for Data Protection notifies Apple and Google of AI app DeepSeek as illegal content — Berliner Beauftragte für Datenschutz und Informationsfreiheit
- Mistral Large 4 — Mistral AI
Stand: 6. Oktober 2026. Produkte, Funktionen und Preise ändern sich schnell; maßgeblich sind die Angaben der Anbieter und Behörden.
Sie überlegen, ein offenes KI-Modell im eigenen Haus zu betreiben? Unverbindlich anfragen — wir klären Anwendungsfall, Testaufbau und ob Eigenbetrieb oder ein Unternehmensdienst für Sie besser passt. Mehr zu meinem Angebot: KI-Workshops für Unternehmen und KI-Beratung.