• Link zu LinkedIn
  • English English Englisch en
  • Deutsch Deutsch Deutsch de
AT: +43 1 714 00 20 | DE: +49 69 348763610 | Mo-Fr 8-17 Uhr
Spirit in Projects
  • Training / AKADEMIE
  • Blog
  • Innovation
  • Zertifizierungen
  • Beratung
  • Über uns
  • Jobs
  • Englisch
  • Click to open the search input field Click to open the search input field Suche
  • Menü Menü
large language model

Open Source bei Large Language Models: Wie offen ist „offen“ wirklich?

20. April 2026/von Karl Schott

Die Begriffe „Open Source“ und „offen“ werden in der LLM-Welt inflationär verwendet –  hinter den Marketingaussagen verbergen sich jedoch massive Unterschiede. Ich möchte in diesem Beitrag das Spektrum der Offenheit dieser Systeme einordnen und zeigen, welche relevanten Modelle in welche Kategorie fallen. Gerade für vertrauenswürdige KI-Anwendungen ist volle Transparenz entscheidend – wie wir sehen werden, ist sie jedoch selten.

Das Spektrum der Offenheit: 5 Stufen

Die Open Source Initiative (OSI) hat 2024 mit der Open Source AI Definition (OSAID 1.0) erstmals einen Standard geschaffen. Ergänzend bietet das Model Openness Framework (MOF) der Linux Foundation einen abgestuften Ansatz, um zu entscheiden, wie offen und damit nachvollziehbar ein LLM tatsächlich ist. Aus diesen Frameworks und der Praxis können wir fünf Stufen ableiten – von vollständig geschlossen bis vollständig offen.

Kategorie Weights: Die trainierten Modellparameter – das „Gehirn“ des Modells, das direkt ausgeführt werden kann.

Kategorie Code: Quellcode für Training – ermöglicht Nachvollziehbarkeit und eigene Anpassungen.

Kategorie Trainingsdaten: Die verwendeten Datensätze – entscheidend für Transparenz, Bias-Analyse und rechtliche Nachvollziehbarkeit.

Kategorie Trainings-Methodik: Verfahren, Hyperparameter und Prozesse beim Training – von kurzen Paper-Beschreibungen bis zur vollständigen Reproduzierbarkeit.

Übersicht

StufeBezeichnungWeightsCodeTrainingsdatenTrainings-methodikLizenz
5Closed/ Proprietär❌❌❌❌Nur API-Zugang
4Restricted Weights✅⚠️ teilweise❌⚠️ PaperRestriktiv (Nutzungslimits)
3Open Weights✅⚠️ teilweise❌⚠️ PaperFrei bis restriktiv
2Open Weights + Offene Methodik✅✅⚠️ teilweise✅Frei
1Vollständig Open Source✅✅✅✅Frei (Apache 2.0, MIT)

Stufe 5: Closed / Proprietär ⚫

Kein Zugang zu Weights, Code oder Daten. Nutzung ausschließlich über APIs oder lizenzierte Integrationen.

Diese Modelle stehen unter vollständiger Kontrolle der Entwicklerfirmen. Man kann sie nutzen, aber nicht inspizieren, modifizieren oder selbst hosten. Die interne Architektur, die Trainingsdaten und der Code bleiben Betriebsgeheimnisse.

Relevante Modelle

ModellOrganisationBesonderheiten
GPT-4o / GPT-5OpenAIFlaggschiff-Modelle. Multimodal. Nur per API.
Claude 4 / 4.5AnthropicFokus auf Sicherheit und lange Kontexte. Nur per API.
Gemini 3.1 / 3.1 ProGoogleNativ multimodal. Tief in Google-Produkte integriert.
Grok-3 / 4xAINachfolger von Grok-1 und 2 (die noch offen waren). Closed.

Einordnung: Diese Modelle bieten oft die höchste Leistung „out of the box“, aber keine Kontrolle über Daten, keine Reproduzierbarkeit der Ergebnisse und damit vollständige Abhängigkeit vom Anbieter. Oft ist nicht einmal bekannt, wie groß das Modell ist oder wie viele Trainingsdaten verwendet wurden.

Stufe 4: Restricted Weights (Eingeschränkt offen) 🔴

Weights sind herunterladbar, aber die Lizenz enthält signifikante Einschränkungen, z. B. kommerzielle Nutzungslimits, Nutzungsvorschriften oder Attributionspflichten ab bestimmten Schwellenwerten.

Diese Modelle werden oft als „Open Source“ vermarktet, sind es nach der OSI-Definition aber nicht. Sie bieten Zugang zu den Weights, binden die Nutzung aber an Bedingungen.

Relevante Modelle

ModellOrganisationLizenzEinschränkungen
Llama 4 (Scout/Maverick)MetaLlama LicenseKommerzielle Nutzung bis 700 Mio. monatlich aktive Nutzer (MAU). Darüber: separate Lizenz nötig. Verbot, andere LLMs damit zu trainieren.
Kimi K2.5Moonshot AIModified MITAb 100 Mio. MAU oder $20 Mio. Umsatz: „Kimi K2.5″-Branding Pflicht.
Command R+CohereCC-BYNC-4.0Keine kommerzielle Nutzung ohne separate Lizenzvereinbarung mit Cohere.

Einordnung: Die Llama-Modelle von Meta sind das prominenteste Beispiel für diese Kategorie – sie sind zweifellos nützlich und leistungsstark, aber die Lizenz schließt wichtige Open-Source-Freiheiten aus.

Stufe 3: Open Weights 🟠

Modellgewichte sind frei verfügbar und nutzbar (auch kommerziell), aber Trainingsdaten und oft auch der Trainingscode bleiben geschlossen.

Das ist die häufigste Kategorie unter den „offenen“ Modellen. Man kann sie herunterladen, lokal betreiben und feinabstimmen – aber man kann sie nicht von Grund auf reproduzieren, da die Trainingsdaten fehlen.

Relevante Modelle

ModellOrganisationLizenzBesonderheiten
Gemma 3 / 4GoogleGemma-LizenzMultimodal. Effizient auf Consumer-Hardware. 256K Kontext.
GLM-5Zhipu AIMIT744B MoE (40B aktiv). Stark in Coding und Agentic Tasks. Keine Nutzungseinschränkungen.
gpt-oss 120bOpenAIApache 2.0Erstes offenes OpenAI-Modell seit GPT-2. 117B (MoE, 5,1B aktiv). Stark bei Wissen (MMLU-Pro ca. 80,8 %).

Einordnung: Für die meisten Unternehmen und Entwickler:innen ist diese Kategorie der Sweet Spot – man erhält leistungsstarke Modelle mit weitgehender Nutzungsfreiheit, ohne die Komplexität vollständiger Reproduzierbarkeit.

Stufe 2: Open Weightss + Offene Methodik Gelber Kreis

Weights und Code sind offen und ohne Nutzungseinschränkungen lizenziert, Trainingsdaten sind teilweise dokumentiert oder referenziert, aber nicht vollständig verfügbar.

Diese Modelle gehen weit über „nur Weights“ hinaus: Sie veröffentlichen detaillierte Technical Reports, Trainingsrezepte und oft auch den Trainingscode – aber die exakten Trainingsdaten sind nicht vollständig verfügbar, etwa aus urheberrechtlichen Gründen oder wegen der schieren Datenmenge.

Relevante Modelle

ModellOrganisationParameterLizenzBesonderheiten
DeepSeek V3 / V3.2DeepSeek671B (37B aktiv, MoE)MIT (Code) / DeepSeek Model License (Weights)Vollständiger Trainingscode offen. Detailliertes Paper. Trainingsdaten nicht offen, aber Methodik exzellent dokumentiert. Weights kommerziell nutzbar.
DeepSeek R1DeepSeek671B (37B aktiv, MoE)MIT (Code) / DeepSeek Model License (Weights)Reasoning-Modell mit RL. Destillierte Varianten: Qwenbasierte unter Apache 2.0, Llama-basierte unter LlamaLizenz.
Qwen 3 / 3.5Alibababis 397B (MoE)Apache 2.0Breiteste Modellpalette (0,6B– 235B). 200+ Sprachen. Trainingsmethodik in Papers dokumentiert.
Mixtral 8x22B / Mistral Small 3Mistral AI141B (MoE, 39B aktiv) / 24BApache 2.0Europabasiertes Unternehmen. Frei nutzbar (im Gegensatz zu Mistral Large 2, das unter der Mistral Research License steht und damit in Stufe 4 einzuordnen wäre).

Einordnung: Hier finden sich viele der aktuell leistungsstärksten offenen Modelle. DeepSeek und Qwen setzen mit MIT bzw. Apache 2.0 den Maßstab für industrietaugliche Offenheit – ohne die vollen Trainingsdaten preiszugeben.

Stufe 1: Vollständig Open Source Grüner Kreis

Alles ist offen: Weights, Code, Trainingsdaten, Methodik und Dokumentation. Das Modell kann von Grund auf reproduziert werden.

Dies ist die strengste Kategorie – und die seltenste. Gemäß der OSI-Definition (OSAID 1.0) müssen alle Komponenten ohne Nutzungseinschränkungen verfügbar sein (etwa unter Apache 2.0 oder MIT): Modellgewichte, vollständiger Trainingscode, die Trainingsdaten (oder hinreichend detaillierte Dokumentation) sowie die gesamte Trainingsmethodik.

Warum ist das wichtig?

Nur bei vollständiger Offenheit kann man den Bias in Trainingsdaten auditieren, Ergebnisse nachvollziehen und das Modell tatsächlich von Grund auf reproduzieren. Das ist die Grundlage für echte Nachprüfbarkeit.

Relevante Modelle

ModellOrganisationBesonderheiten
OLMo 3 / 3.1AI2 (Allen Institute)Alle Checkpoints, Dolma-3-Trainingsdaten, Logs, EvalCode offen. Apache 2.0. Inkl. OLMoTrace für Rückverfolgung zu Quelldaten.
Amber-7B / Crystal-7B / K2-65BLLM360Projekt mit radikaler Transparenz („360°“): alle Checkpoints, Trainingsdaten, Metriken und W&B-Logs offen. K2-65B übertrifft Llama 2 70B.
PythiaEleutherAIForschungsmodell-Suite mit 8 Größen (70M–12B), jeweils 154 Checkpoints. Pile-Trainingsdaten offen. Apache 2.0.
BLOOM (176B)BigScience / HuggingFacePionierprojekt (Juli 2022): ROOTS-Corpus (1,6 TB, 46 Sprachen) offen. BigScience BLOOM RAIL License v1.0.
MAP-Neo (7B)M-A-PBilingual (EN/ZH). 4,5T Tokens. Trainingsdaten (MatrixPile), Cleaning-Pipeline und Checkpoints offen.

Einordnung: Diese Modelle sind nicht die leistungsstärksten – aber sie sind für die Wissenschaft und die Open-Source-Gemeinschaft von unschätzbarem Wert. OLMo von AI2 ist hier das aktuelle Flaggschiff.

Die wichtigsten Unterscheidungsmerkmale im Detail

Was genau ist verfügbar?

Stufe 5Stufe 4Stufe 3Stufe 2Stufe 1
Weights❌✅✅✅✅
Architektur-Details❌⚠️✅✅✅
Trainingscode❌❌⚠️✅✅
Trainingsdaten❌❌❌⚠️✅
Trainingsmethodik❌⚠️⚠️✅✅
Freie Lizenz❌❌✅✅✅
Reproduzierbarkeit❌❌❌⚠️✅

Lizenz-Landkarte

LizenzTypKommerzielle NutzungBeispiele
ProprietärGeschlossen❌ Nur per APIGPT-4, Claude, Gemini
CC-BY-NCRestriktiv❌ Nur nichtkommerziellCommand R+
Llama LicenseRestriktiv⚠️ Bis 700M MAULlama 3, Llama 4
RAILRestriktiv⚠️ Mit NutzungsverbotenBLOOM
Gemma LicenseSemi-Offen✅ Mit NutzungsrichtlinienGemma 3, Gemma 4
MITOffen (keine Einschränkung)✅ UneingeschränktDeepSeek (Code), GLM-5, Phi-4
Apache 2.0Offen (keine Einschränkung)✅ UneingeschränktQwen, Mixtral, OLMo, Falcon 7B/40B

Fazit: Was bedeutet das für die Praxis?

  1. „Open Source“ ≠ „Open Source“ – Die Bezeichnung wird inflationär verwendet. Nur Modelle der Stufe 1 erfüllen die OSI-Definition vollständig. Die meisten populären „offenen“ Modelle fallen in Stufe 2–3.
  2. Der Sweet Spot liegt bei Stufe 2–3 – Modelle wie DeepSeek V3.2, Qwen 3.5 oder Gemma 4 bieten eine exzellente Balance aus Leistung, Nutzungsfreiheit und Zugänglichkeit.
  3. Vorsicht bei Stufe 4 – Llama-Modelle sind fantastisch für Prototyping und Forschung, aber die Lizenzbedingungen können bei kommerziellem Einsatz zum Problem werden.
  4. Stufe 1 ist entscheidend für die Wissenschaft – Projekte wie OLMo und Pythia ermöglichen echte Forschung über das Verhalten von LLMs, Bias-Analyse und algorithmische Transparenz.
  5. Die Lücke schließt sich – Offene Modelle (Stufe 1–3) erreichen 2025/2026 auf vielen Benchmarks das Niveau das proprietärer Modelle nur ein paar Monate zuvor hatten. Der Grund, sich vollständig an geschlossene Anbieter zu binden, wird immer schwächer.

Stand: April 2026. Die LLM-Landschaft entwickelt sich rasant – neue Modelle und Lizenzen können die Einordnung schnell verändern.

Quellen & weiterführende Links

Open Source AI Definition (OSAID 1.0) – OSI

Model Openness Framework – Linux Foundation

OLMo – AI2

Open Source LLM Leaderboard – whatllm.org

Eintrag teilen
  • Teilen auf Facebook
  • Teilen auf X
  • Teilen auf WhatsApp
  • Teilen auf Pinterest
  • Teilen auf LinkedIn
  • Teilen auf Tumblr
  • Teilen auf Vk
  • Teilen auf Reddit
  • Per E-Mail teilen
https://spiritinprojects.com/wp-content/uploads/2026/04/18928-1.jpg 450 800 Karl Schott https://spiritinprojects.com/wp-content/uploads/2020/04/sip_web_padding_10px_topbot.jpg Karl Schott2026-04-20 16:03:582026-04-20 16:03:59Open Source bei Large Language Models: Wie offen ist „offen“ wirklich?

Über den Autor:

CEO von Spirit in Projects - Karl Schott
Karl Schott

Karl Schott ist CEO von Spirit in Projects. Er befasst sich intensiv mit Digitalisierung, neuen Technologien und digitaler Transformation.

Kürzlich
  • Titelbild Blogbeitrag Wahrscheinlichkeitsbetrachtung
    Ohne Wirtschaftlichkeitsbetrachtung ist jede IT-Ausschreibung...10. August 2026 - 13:22
  • Mitarbeiter sitzen gemeinsam an einem großen Tisch in einer Meetingsituation. Eine Person steht am Tischende.
    Weniger Projekte? Dann ist jetzt der beste Zeitpunkt für...27. Juli 2026 - 16:20
  • Agilität in Projekten
    Agile Projekte sind nicht schneller – und genau deshalb...23. Juli 2026 - 9:21
  • Geschäftsprozesse neu überdenken
    Warum jetzt der richtige Zeitpunkt ist, Geschäftsprozesse...20. Juli 2026 - 12:55
Schlagworte
Accountability Agile Methoden und Kanban AI Ausschreibungen Beratung Business Analyse Datenschutz Demandmanagement Digitalisierung Dokumentenanalyse Enterprise Architektur Ethik Förderung IIBA Innovation IREB ISTQB KI Organisationsentwicklung Organisationsstrategie PMI Portfoliomanagement Programmmanagement Projektmanagement Qualitätsmanagement Requirements Engineering Softwarearchitektur Softwareentwicklung Stakeholder Management Stakeholdermanagement Success Stories Systemarchitektur Testmanagement Training Trainings Usability Videotraining Webinar WIFI

Kontaktieren Sie uns!

Schicken Sie uns eine Nachricht per Kontaktformular.
  • Mail
  • Xing
  • Linkedin
© Copyright - Spirit in Projects - Enabling digital innovation
  • AGB
  • Impressum
  • Datenschutz
  • Barrierefreiheitserklärung
  • Jobs
  • Kontakt
Nach oben scrollen Nach oben scrollen Nach oben scrollen

Diese Seite verwendet ausschließlich technisch notwendige Cookies. Es werden keine Drittanbieterdienste verwendet.

Schließen

Cookie- und Datenschutzeinstellungen



Wie wir Cookies verwenden

Wir können Cookies anfordern, die auf Ihrem Gerät eingestellt werden. Wir verwenden Cookies, um uns mitzuteilen, wenn Sie unsere Websites besuchen, wie Sie mit uns interagieren, Ihre Nutzererfahrung verbessern und Ihre Beziehung zu unserer Website anpassen.

Klicken Sie auf die verschiedenen Kategorienüberschriften, um mehr zu erfahren. Sie können auch einige Ihrer Einstellungen ändern. Beachten Sie, dass das Blockieren einiger Arten von Cookies Auswirkungen auf Ihre Erfahrung auf unseren Websites und auf die Dienste haben kann, die wir anbieten können.

Notwendige Website Cookies

Diese Cookies sind unbedingt erforderlich, um Ihnen die auf unserer Webseite verfügbaren Dienste und Funktionen zur Verfügung zu stellen.

Da diese Cookies für die auf unserer Webseite verfügbaren Dienste und Funktionen unbedingt erforderlich sind, hat die Ablehnung Auswirkungen auf die Funktionsweise unserer Webseite. Sie können Cookies jederzeit blockieren oder löschen, indem Sie Ihre Browsereinstellungen ändern und das Blockieren aller Cookies auf dieser Webseite erzwingen. Sie werden jedoch immer aufgefordert, Cookies zu akzeptieren / abzulehnen, wenn Sie unsere Website erneut besuchen.

Wir respektieren es voll und ganz, wenn Sie Cookies ablehnen möchten. Um zu vermeiden, dass Sie immer wieder nach Cookies gefragt werden, erlauben Sie uns bitte, einen Cookie für Ihre Einstellungen zu speichern. Sie können sich jederzeit abmelden oder andere Cookies zulassen, um unsere Dienste vollumfänglich nutzen zu können. Wenn Sie Cookies ablehnen, werden alle gesetzten Cookies auf unserer Domain entfernt.

Wir stellen Ihnen eine Liste der von Ihrem Computer auf unserer Domain gespeicherten Cookies zur Verfügung. Aus Sicherheitsgründen können wie Ihnen keine Cookies anzeigen, die von anderen Domains gespeichert werden. Diese können Sie in den Sicherheitseinstellungen Ihres Browsers einsehen.

Andere externe Dienste

Wir nutzen auch verschiedene externe Dienste wie Google Webfonts, Google Maps und externe Videoanbieter. Da diese Anbieter möglicherweise personenbezogene Daten von Ihnen speichern, können Sie diese hier deaktivieren. Bitte beachten Sie, dass eine Deaktivierung dieser Cookies die Funktionalität und das Aussehen unserer Webseite erheblich beeinträchtigen kann. Die Änderungen werden nach einem Neuladen der Seite wirksam.

Google Webfont Einstellungen:

Google Maps Einstellungen:

Google reCaptcha Einstellungen:

Vimeo und YouTube Einstellungen:

Datenschutzrichtlinie

Sie können unsere Cookies und Datenschutzeinstellungen im Detail in unseren Datenschutzrichtlinie nachlesen.

Datenschutz
Schließen