Was ist ein Large Language Model (LLM) und wie funktioniert es?
Large Language Models erzeugen Texte auf Basis von Wahrscheinlichkeiten. Der Artikel erklärt Technik und Geschichte der großen Sprachmodelle.

Ein Large Language Model (LLM) ist ein KI-System, das auf menschlicher Sprache basiert. Es hat aus riesigen Textmengen "gelernt", wie Wörter üblicherweise aufeinander folgen. Auf dieser Basis kann es selbst neue Texte und Programmcode erstellen.
Ein Sprachmodell zerlegt jeden Text in kleine Einheiten. Diese Einheiten heißen "Token". Ein Token kann ein ganzes Wort oder nur ein Bruchstück davon sein.
Das Modell berechnet dann, welcher Token am wahrscheinlichsten folgt. Diesen Schritt wiederholt es immer wieder. Die Antwort entsteht so Stück für Stück. Das Grundprinzip kennt jeder von der Auto-Ergänzung seines Smartphones. Die Tastatur schlägt beim Tippen das nächste Wort vor. Ein Sprachmodell macht im Kern das Gleiche. Es stützt sich dabei aber auf viel mehr Daten und setzt enorme Rechenleistung ein.
Die technische Basis der LLMs ist die Transformer-Architektur. Google-Forscher haben sie 2017 in der Arbeit "Attention Is All You Need" vorgestellt. Ein Mechanismus namens "Attention" gewichtet darin, wie stark sich die Wörter eines Satzes aufeinander beziehen. Das Verfahren lässt sich zudem gut parallelisieren. Erst dadurch ist das Training großer Modelle, wie wir sie heute kennen, umsetzbar geworden.
Die Größe eines Modells bemisst sich an der Zahl der Parameter. Aktuelle Spitzenmodelle haben Hunderte Milliarden davon.
Am Anfang steht das Pre-Training. Das Modell verarbeitet dabei große Teile des frei zugänglichen Internets samt Büchern und Programmcode. In dieser Phase lernt es Grammatik und Faktenwissen.
Danach folgt die Feinabstimmung. Menschen bewerten dafür Antworten des Modells. Aus diesen Bewertungen lernt das System, was eine hilfreiche Antwort ausmacht. Fachleute nennen das Verfahren RLHF. (Reinforcement Learning from Human Feedback, dt. Lernen aus menschlichem Feedback)
Die Kosten für das Training sind hoch. Allein für das Training von GPT-4 hat OpenAI laut Medienberichten rund 100 Millionen US-Dollar ausgegeben.
-
Den Anstoß hat das Transformer-Papier von 2017 gegeben.
-
OpenAI hat 2018 das erste GPT-Modell vorgestellt. Es hatte 117 Millionen Parameter. Der Nachfolger GPT-2 ist ein Jahr später erschienen.
-
Mit GPT-3 ist die Reihe 2020 bei 175 Milliarden Parametern angekommen. Also das rund 1500-Fache des ersten Modells.
-
Den Durchbruch der Technologie beim breiten Publikum hat ChatGPT geschafft. OpenAI hat den Chatbot am 30. November 2022 kostenlos ins Netz gestellt. Rund zwei Monate später zählte der Dienst bereits 100 Millionen Nutzer. Kein anderer Dienst konnte zuvor solch ein Wachstum erzeugen.
-
Im Januar 2025 hat die chinesische Firma DeepSeek ihr Modell R1 unter einer freien Lizenz veröffentlicht. Die Trainingskosten beziffert das Unternehmen auf wenige Millionen US-Dollar. Unabhängig bestätigt ist diese Zahl allerdings nicht. Die Börse hat trotzdem reagiert. Der Kurs des Chipherstellers Nvidia ist nach der Veröffentlichung deutlich gefallen.
Der Markt konzentriert sich auf wenige große Firmen.
- GPT von OpenAI treibt ChatGPT an.
- Gemini stammt von Google.
- Claude vom US-Unternehmen Anthropic gilt als stark bei langen Texten und beim Programmieren.
- Llama von Meta (der Facebook-Mutter) ist frei verfügbar. Entwickler dürfen die Modellgewichte herunterladen und anpassen. Meta hat damit den Trend zu offenen Modellen früh geprägt.
- DeepSeek aus China steht ebenfalls unter einer freien Lizenz. Das Modell hat gezeigt, dass Spitzenleistung auch mit kleinem Budget erreichbar ist.
- Mistral gilt als wichtigster europäischer Anbieter. Die Firma aus Paris ist erst 2023 gegründet worden.
Ein Sprachmodell rechnet mit Wahrscheinlichkeiten und hat kein gesichertes Wissen. Deshalb "erfindet" es manchmal Fakten. Die falsche Antwort klingt dabei aber häufig sehr überzeugend, was die Fehlersuche in der Ausgabe erschwert. Dieses Verhalten wird "Halluzination" genannt.
Der Betrieb der KI-Rechenzentren verbraucht viel Strom, was lokale Netze bereits in ihre Grenzen führt und den Ausbau der Kapazität verlangsamt.
Auch der Datenschutz bleibt ein Streitpunkt. Wer sensible Daten an ein Sprachmodell übermittelt, macht sie auch für den Anbieter des Modells verfügbar.
Die EU reguliert große Sprachmodelle über den AI Act.
Seit dem 2. August 2025 gelten umfangreiche Pflichten für die Anbieter von Basismodellen. Sie müssen bspw. ihre Systeme dokumentieren und Angaben zu den Trainingsdaten offenlegen. (EU-Kommission)