← Alle Insights

Open-Weight-Modelle 2026 DeepSeek V4, Qwen3.8, gpt-oss, Llama.

Open-Weight-Modelle sind KI-Sprachmodelle, deren Gewichte frei herunterladbar sind und die Sie auf eigener Hardware oder in einer Cloud Ihrer Wahl betreiben können. Stand Oktober 2026 sind die wichtigsten Kandidaten DeepSeek V4 (MIT-Lizenz), Qwen3.8 von Alibaba (27B unter Apache 2.0, das große Modell unter eigener Lizenz), OpenAIs gpt-oss (Apache 2.0) und Metas Llama 4 (eigene Community-Lizenz); Mistral hat für Large 4 offene Gewichte bis Ende Oktober angekündigt. Für IT-Leitungen entscheiden drei Dinge über die Eignung: Lizenz, Hardwarebedarf und die Frage, ob Daten das eigene Haus verlassen. Dieser Vergleich ordnet die Modelle nach Größe, aktiven Parametern, Kontext und Lizenz, zeigt den groben Hardwarebedarf und trennt sauber zwischen offenem Gewicht und der App des Herstellers. Modelle und Versionen ändern sich derzeit im Monatstakt; prüfen Sie Details vor einer Entscheidung auf der jeweiligen Modellseite.

Hinweis: Dieser Beitrag gibt den Rechts- und Steuerstand zum unten angegebenen Datum allgemein wieder. Er ist keine Rechts- oder Steuerberatung und ersetzt nicht die Prüfung Ihres Einzelfalls durch eine Rechtsanwältin, einen Rechtsanwalt, eine Steuerberaterin oder einen Steuerberater. Alle Angaben ohne Gewähr für Vollständigkeit und Aktualität.

Was sind Open-Weight-Modelle und was nicht?

Ein Sprachmodell besteht im Kern aus Milliarden von Zahlenwerten, den Gewichten (englisch „weights“). Bei einem Open-Weight-Modell veröffentlicht der Hersteller diese Gewichte zum Herunterladen, meist auf Hugging Face. Damit können Sie das Modell auf eigenen Servern, in einem deutschen Rechenzentrum oder bei einem Cloud-Anbieter Ihrer Wahl betreiben, es an eigene Daten anpassen (Fine-Tuning) und es ohne Verbindung zum Hersteller nutzen.

Was Open-Weight-Modelle nicht sind:

Ein Begriff taucht in diesem Vergleich ständig auf: Mixture of Experts (MoE). Solche Modelle bestehen aus vielen Teilnetzen („Experten“), von denen pro Wort nur ein kleiner Teil rechnet. Die Gesamtzahl der Parameter bestimmt, wie viel Speicher Sie brauchen. Die Zahl der aktiven Parameter bestimmt, wie schnell das Modell antwortet. Ein MoE-Modell mit 1,6 Bio. Parametern muss also komplett in den Speicher passen, rechnet aber pro Token nur mit einem Bruchteil davon.

Welche offenen KI-Modelle sind im Oktober 2026 relevant?

Die folgende Tabelle fasst die relevanten Modelle zusammen. Grundlage sind die Modellseiten der Hersteller auf Hugging Face und deren Ankündigungen, Stand 06.10.2026. „Kontext“ meint die maximale Textmenge, die das Modell in einem Durchgang verarbeitet, gemessen in Tokens (in englischen Texten entspricht ein Token grob einem Dreiviertelwort, im Deutschen ist das Verhältnis ungünstiger).

ModellParameter gesamt / aktivKontextLizenzGrober Hardwarebedarf
DeepSeek V4-Prorund 1,6 Bio. / 49 Mrd. (MoE)1 Mio.MITGPU-Cluster; Hersteller nennt einen Knoten mit 4 × NVIDIA GB300 als Beispiel
DeepSeek V4-Flash284 Mrd. / 13 Mrd. (MoE)1 Mio.MITMehrere Rechenzentrums-GPUs
Qwen3.8-2.4T-A95B2,4 Bio. / 95 Mrd. (MoE)262.144, erweiterbar auf rund 1 Mio.eigene Qwen-Lizenz (Qwen3.8-Max License)Mehrere GPU-Knoten
Qwen3.8-27B27 Mrd. (dicht), mit Bild- und Videoeingabe262.144, erweiterbar auf 1 Mio.Apache 2.0Eine GPU, je nach Quantisierung ab etwa 16–32 GB
gpt-oss-120b117 Mrd. / 5,1 Mrd. (MoE)131.072Apache 2.0Eine 80-GB-GPU (z. B. H100)
gpt-oss-20b21 Mrd. / 3,6 Mrd. (MoE)131.072Apache 2.016 GB Speicher, auch Workstation oder Laptop
Llama 4 Scout109 Mrd. / 17 Mrd. (MoE)10 Mio.Llama 4 Community LicenseEine H100 mit int4-Quantisierung
Llama 4 Maverick400 Mrd. / 17 Mrd. (MoE)1 Mio.Llama 4 Community LicenseEin H100-Server (DGX) in FP8

Einige Einordnungen zur Tabelle:

Die Auswahl ist nicht vollständig. Weitere offene Modellfamilien, etwa Gemma von Google oder GLM von Z.ai, kommen in Frage, und neue Versionen erscheinen laufend.

Lizenzen im Vergleich: MIT, Apache 2.0 und Herstellerlizenzen.

Für Unternehmen ist die Lizenz oft wichtiger als ein paar Benchmark-Punkte. Drei Lizenztypen spielen derzeit eine Rolle:

LizenzModelleWas das praktisch bedeutet
MITDeepSeek V4-Pro, V4-Flash, V4.1-FlashSehr freizügig: kommerzielle Nutzung, Anpassung und Weitergabe erlaubt; Copyright- und Lizenzhinweis müssen erhalten bleiben.
Apache 2.0Qwen3.8-27B, gpt-oss-120b, gpt-oss-20b, Muse GlimmerEbenfalls freizügig, zusätzlich mit ausdrücklicher Patentlizenz; Änderungen am Modell sind kenntlich zu machen.
HerstellerlizenzLlama 4 (Community License), Qwen3.8-2.4T-A95B (Qwen3.8-Max License)Individuelle Bedingungen: Nutzungsrichtlinien, Schwellenwerte, regionale Einschränkungen. Vor dem Einsatz von der Rechtsabteilung prüfen lassen.

Bei Llama 4 sind zwei Klauseln für deutsche Unternehmen entscheidend. Erstens müssen Anbieter mit mehr als 700 Mio. monatlich aktiven Nutzern eine gesonderte Lizenz bei Meta anfragen; das betrifft praktisch niemanden im Mittelstand. Zweitens, und das ist relevanter: Die Llama-4-Nutzungsrichtlinie gewährt Personen mit Wohnsitz und Unternehmen mit Hauptsitz in der EU die Rechte aus der Lizenz für die multimodalen Llama-4-Modelle nicht. Da Scout und Maverick nativ multimodal sind, scheidet Llama 4 für den Eigenbetrieb durch ein Unternehmen mit Sitz in Deutschland faktisch aus. Laut Richtlinie gilt die Einschränkung nicht für Endnutzer von Produkten, in die das Modell eingebaut ist.

Eine Lizenzprüfung ersetzt dieser Überblick nicht. Er zeigt aber, wo Sie genauer hinsehen sollten: Bei MIT und Apache 2.0 geht es meist um Formalien, bei Herstellerlizenzen um die Frage, ob Sie das Modell überhaupt einsetzen dürfen.

Welche Hardware brauchen offene Modelle?

Für den Speicherbedarf gibt es eine einfache Faustregel: Parameter mal Bytes pro Parameter. Im üblichen Auslieferungsformat BF16 braucht jeder Parameter 2 Bytes, in FP8 1 Byte, bei 4-Bit-Quantisierung etwa ein halbes Byte. Quantisierung heißt, die Zahlenwerte mit weniger Stellen zu speichern; das spart Speicher und kostet meist etwas Qualität. Hinzu kommt Speicher für den Kontext, den sogenannten KV-Cache, der bei langen Dokumenten erheblich wachsen kann.

Rechenbeispiel: Qwen3.8-27B belegt in BF16 rund 54 GB, in FP8 rund 27 GB und in 4 Bit rund 14 GB, jeweils ohne KV-Cache. DeepSeek V4-Flash mit 284 Mrd. Parametern bräuchte in FP8 rechnerisch rund 284 GB nur für die Gewichte, Qwen3.8-2.4T-A95B etwa 2,4 TB. DeepSeek liefert die Experten-Gewichte bereits in FP4 aus, was den Bedarf senkt, an der Größenordnung Rechenzentrum aber nichts ändert.

Daraus ergeben sich drei realistische Stufen:

Die aktiven Parameter helfen bei der Geschwindigkeit, nicht beim Speicher. gpt-oss-120b mit 5,1 Mrd. aktiven Parametern antwortet deshalb deutlich flotter als ein dichtes Modell ähnlicher Gesamtgröße, braucht aber trotzdem die volle 80-GB-Karte. Wie viele Nutzer gleichzeitig bedient werden können, hängt zusätzlich von Kontextlänge, Software (etwa vLLM oder SGLang) und Lastprofil ab und lässt sich nur im Test sauber bestimmen.

Offenes Gewicht vs. App des Herstellers: der Datenschutzunterschied.

Viele Diskussionen über DeepSeek oder Qwen werfen zwei Dinge zusammen, die rechtlich und technisch getrennt sind:

Wie ernst der Unterschied ist, zeigt ein Fall aus Berlin. Die Berliner Beauftragte für Datenschutz und Informationsfreiheit hat die DeepSeek-App am 27.06.2025 bei Apple und Google nach Art. 16 des Digital Services Act als rechtswidrigen Inhalt gemeldet. Begründung: Die App übermittelt Nutzerdaten wie Eingaben, Chatverläufe und hochgeladene Dateien an Server in China, ohne dass ein der EU gleichwertiges Schutzniveau nachgewiesen sei. Das betrifft die App, nicht die MIT-lizenzierten Gewichte auf Ihrem Server.

Daraus folgt nicht, dass der Eigenbetrieb automatisch unbedenklich ist. Sie übernehmen dann selbst die Verantwortung für Zugriffsrechte, Protokollierung, Löschkonzepte und die Absicherung der Server. Auch Hosting-Anbieter, die ein offenes Modell als Dienst anbieten, sind wieder Auftragsverarbeiter mit eigenem Vertrag und Standort. Mehr zu diesem Thema finden Sie im Beitrag zu selbst gehosteten LLMs und Datenschutz.

Wann lohnt sich der Eigenbetrieb und wann nicht?

Eigenbetrieb lohnt sich vor allem in vier Situationen:

Dagegen sprechen ebenso handfeste Gründe. Die stärksten offenen Modelle brauchen Hardware, die sich nur bei hoher Auslastung rechnet. Betrieb, Updates, Monitoring und Sicherheit binden Personal. Und für viele Büroaufgaben ist ein geschlossenes Modell mit europäischer Datenverarbeitung und Unternehmensvertrag schlicht einfacher. Eine Abwägung zwischen beiden Welten finden Sie im Beitrag KI in der Cloud vs. On-Premise.

Grenzen und Risiken, die Sie vor einer Entscheidung kennen sollten:

So testen Sie ein offenes Modell für Ihren Anwendungsfall.

Ein strukturierter Test lässt sich oft in wenigen Wochen durchführen und beantwortet die Frage besser als jede Tabelle. So gehen Sie vor:

  1. Anwendungsfall eng festlegen: etwa „Eingangsrechnungen klassifizieren“ oder „interne Richtlinien beantworten“, nicht „KI für alles“.
  2. Testset aufbauen: 50 bis 200 echte, anonymisierte Beispiele mit erwarteter Antwort. Das ist die Grundlage für jeden fairen Vergleich.
  3. Lizenz vorab klären: Herstellerlizenzen und Nutzungsrichtlinien prüfen lassen, bevor Zeit in die Technik fließt.
  4. Klein starten: Mit gpt-oss-20b oder einem quantisierten Qwen3.8-27B lokal testen, zum Beispiel über Ollama oder LM Studio. Erst wenn die Qualität reicht, über größere Modelle und Server nachdenken.
  5. Gegen ein geschlossenes Modell messen: Dasselbe Testset mit einem Unternehmensmodell durchlaufen lassen. So sehen Sie den Abstand in Qualität und Kosten.
  6. Betrieb mitdenken: Wer betreibt den Server, wer spielt Updates ein, wie werden Zugriffe protokolliert, was passiert bei einem Modellwechsel?

Wenn Sie diese Schritte nicht allein gehen wollen: In der KI-Beratung klären wir gemeinsam Anwendungsfall, Testaufbau und die Frage, ob Eigenbetrieb oder ein Unternehmensdienst besser passt.

Häufige Fragen.

Was ist der Unterschied zwischen Open Source und Open Weight bei KI?

Bei Open-Weight-Modellen veröffentlicht der Hersteller die fertigen Modellgewichte, sodass Sie das Modell selbst betreiben und anpassen können. Trainingsdaten und Trainingscode bleiben meist geheim. Open Source im engeren Sinn würde auch diese offenlegen. Was Sie mit den Gewichten tun dürfen, regelt die jeweilige Lizenz, etwa MIT, Apache 2.0 oder eine Herstellerlizenz.

Ist DeepSeek datenschutzkonform nutzbar?

Das hängt davon ab, wie Sie es nutzen. Die DeepSeek-App überträgt Daten nach China; die Berliner Datenschutzbeauftragte hat sie deshalb 2025 bei Apple und Google gemeldet. Die MIT-lizenzierten Gewichte von DeepSeek V4 können Sie dagegen auf eigener Hardware ohne Verbindung zum Hersteller betreiben. Dann tragen Sie selbst die Verantwortung für Datenschutz und Sicherheit.

Welches offene KI-Modell läuft auf einem normalen Rechner?

Stand Oktober 2026 eignen sich vor allem gpt-oss-20b, das laut OpenAI mit 16 GB Speicher auskommt, und eine quantisierte Fassung von Qwen3.8-27B. Beide lassen sich mit Werkzeugen wie Ollama oder LM Studio lokal starten. Für den produktiven Einsatz mehrerer Nutzer ist ein Server mit leistungsfähiger GPU sinnvoller.

Dürfen Unternehmen in der EU Llama 4 nutzen?

Für den Eigenbetrieb ist das schwierig. Die Llama-4-Nutzungsrichtlinie gewährt Unternehmen mit Hauptsitz in der EU keine Rechte an den multimodalen Llama-4-Modellen, und Scout sowie Maverick sind multimodal. Endnutzer von Produkten, die das Modell enthalten, sind ausgenommen. Lassen Sie die Lizenz im Zweifel juristisch prüfen und ziehen Sie Alternativen wie Qwen3.8-27B, gpt-oss oder Metas Muse Glimmer in Betracht.

Wann kommen die offenen Gewichte von Mistral Large 4?

Mistral hat Large 4 am 06.10.2026 als Public Preview über die API gestartet und offene Gewichte bis Ende Oktober 2026 angekündigt. Die Lizenz ist noch nicht bekannt. Mit 1 Bio. Parametern, davon 49 Mrd. aktiv, wird das Modell für den Eigenbetrieb Rechenzentrums-Hardware benötigen.

Quellen und Stand.

Stand: 6. Oktober 2026. Produkte, Funktionen und Preise ändern sich schnell; maßgeblich sind die Angaben der Anbieter und Behörden.

Sie überlegen, ein offenes KI-Modell im eigenen Haus zu betreiben? Unverbindlich anfragen — wir klären Anwendungsfall, Testaufbau und ob Eigenbetrieb oder ein Unternehmensdienst für Sie besser passt. Mehr zu meinem Angebot: KI-Workshops für Unternehmen und KI-Beratung.