SEO-Wiki

LLM (Large Language Model)

Definition

Ein LLM (Large Language Model, deutsch: großes Sprachmodell) ist ein KI-Modell, das mit sehr großen Textmengen trainiert wurde und Sprache erzeugt, indem es Schritt für Schritt berechnet, welche Textstücke wahrscheinlich als Nächstes folgen, und eines davon auswählt. LLMs wie GPT, Gemini oder Claude formulieren die Antworten von ChatGPT, Google AI Mode und anderen Systemen der KI-Suche.

Was bedeutet LLM?

LLM ist die Abkürzung für Large Language Model, auf Deutsch großes Sprachmodell. Gemeint ist ein KI-Modell, das aus sehr großen Textmengen gelernt hat, wie Sprache aufgebaut ist, und auf dieser Grundlage neuen Text erzeugt. Ein LLM beantwortet Fragen, fasst Dokumente zusammen, übersetzt, schreibt Code oder formuliert E-Mails. Dabei schlägt es nichts in einer Datenbank nach. Es berechnet, welche Textstücke wahrscheinlich als Nächstes folgen, und wählt eines davon aus.

Die drei Teile des Namens beschreiben das Prinzip:

Bekannte LLM-Familien sind GPT von OpenAI, Gemini von Google, Claude von Anthropic, Llama von Meta und die Modelle von Mistral AI. Auf solchen Modellen bauen Anwendungen wie ChatGPT, Microsoft Copilot und Perplexity auf, ebenso Googles AI Overviews und der AI Mode.

LLM oder LL.M.?

Außerhalb der KI ist mit LLM meist etwas anderes gemeint. Der akademische Grad LL.M. steht für Legum Magister oder Master of Laws, einen juristischen Masterabschluss. Bei einer KKP-Abfrage der Google-Suche nach „LLM Bedeutung“ am 1. Oktober 2026 drehten sich sieben von neun organischen Treffern um diesen Titel. Mit dem Sprachmodell hat er nichts zu tun. Die KI-Abkürzung wird ohne Punkte geschrieben.

Unterschied zwischen KI und LLM

Künstliche Intelligenz (KI) ist der Oberbegriff für Systeme, die Aufgaben lösen, für die sonst menschliche Intelligenz nötig ist. Ein LLM ist eine bestimmte Art von KI-Modell, die auf Sprache spezialisiert ist. Es gehört zum maschinellen Lernen, genauer zum Deep Learning mit großen neuronalen Netzen, und dort zur generativen KI, die neue Inhalte erzeugt. Bild- und Videogeneratoren sind ebenfalls generative KI, aber keine Sprachmodelle.

Jedes LLM ist KI, aber nicht jede KI ist ein LLM · vereinfachte Einordnung
Künstliche IntelligenzOberbegriff für Systeme, die Aufgaben mit menschenähnlicher Intelligenz lösen
Maschinelles Lernenlernt Muster aus Daten statt aus festen Regeln
Deep Learninggroße neuronale Netze mit vielen Schichten
Generative KIerzeugt neue Inhalte
LLM
erzeugt Text, etwa GPT, Gemini, Claude
Bild- und Videomodelle
erzeugen Bilder und Videos, keine Sprachmodelle
Eigene Darstellung, vereinfacht. Die Grenzen zwischen den Ebenen sind in der Praxis fließend.

Wie funktioniert ein LLM?

Ein LLM erzeugt Text Stück für Stück. Die Eingabe, der sogenannte Prompt, wird zuerst in Tokens zerlegt. Tokens sind kurze Zeichenfolgen, mal ganze Wörter, mal Wortteile oder Satzzeichen. Für englischen Text nennt OpenAI als Faustregel, dass ein Token etwa vier Zeichen entspricht und 100 Tokens etwa 75 Wörter ergeben. In anderen Sprachen kann das Verhältnis laut OpenAI abweichen.

Anschließend berechnet das Modell für jedes mögliche nächste Token eine Wahrscheinlichkeit, wählt eines aus und hängt es an den Text an. Der verlängerte Text ist die Eingabe für den nächsten Durchgang. Diese Schleife läuft, bis die Antwort vollständig ist. Weil bei der Auswahl ein Zufallsanteil mitspielt, liefert derselbe Prompt nicht immer dieselbe Antwort.

Ein LLM schreibt Token für Token · 4 Schritte, 03 und 04 wiederholen sich je Token, schematisch
  1. 01 · Prompt
    Die Frage geht ein
    „Wofür steht GPT?“
  2. 02 · Tokens
    Text wird in Tokens zerlegt
    WofürstehtGPT?
  3. 03 · Vorhersage
    Wahrscheinliche nächste Tokens
    • Generative
    • GPT
    • Die
  4. 04 · Antwort
    Anhängen und wiederholen
    Generative Pre-trained
    ↻ bis die Antwort fertig ist
Eigene Darstellung, schematisch. Wie ein Text tatsächlich in Tokens zerlegt wird, hängt vom Modell ab.

Ein LLM weiß also nichts im Sinne einer Datenbank. Es hat statistische Zusammenhänge zwischen Wörtern, Begriffen und Fakten gelernt. Darauf beruht seine Stärke beim Formulieren und Zusammenfassen. Dasselbe Prinzip führt dazu, dass ein LLM flüssig klingende, aber falsche Aussagen erzeugen kann. Dieses Verhalten heißt Halluzination.

Transformer, die Architektur hinter LLMs

Die meisten heutigen LLMs beruhen auf der Transformer-Architektur. Ein Forschungsteam von Google stellte sie 2017 im Paper „Attention Is All You Need“ vor. Kern ist der Attention-Mechanismus. Für jedes Token gewichtet das Modell, welche anderen Tokens im Text für seine Bedeutung wichtig sind. So erkennt es etwa, worauf sich ein Pronomen bezieht, auch wenn das Bezugswort weit vorn steht. Wie viele Tokens ein Modell auf einmal berücksichtigen kann, gibt sein Kontextfenster an.

Was bedeutet GPT?

GPT steht für Generative Pre-trained Transformer. Der Name fasst das Prinzip zusammen. Das Modell erzeugt Text (generative), wurde vorab mit großen Textmengen trainiert (pre-trained) und nutzt die Transformer-Architektur. OpenAI hat den Ansatz 2018 vorgestellt und seine Modellreihe danach benannt. ChatGPT ist die Chat-Anwendung, die auf GPT-Modellen aufbaut. Genau genommen ist ChatGPT also kein LLM, sondern ein Produkt, das ein LLM mit Funktionen wie Websuche, Dateiupload und Gedächtnis verbindet.

Training und Inferenz

Ein LLM durchläuft zwei Phasen, Training und Inferenz.

Das Training findet vor der Veröffentlichung statt. Im Pre-Training lernt das Modell an sehr großen Textsammlungen aus dem Web, aus Büchern und aus Code, das jeweils nächste Token vorherzusagen. Danach wird es mit ausgewählten Beispielen und menschlichem Feedback zum hilfreichen Assistenten feinabgestimmt. Am Ende stehen feste Parameter. Was nach dem Ende der Trainingsdaten passiert ist, kennt das Modell nicht. Dieser Zeitpunkt heißt Wissensstichtag oder Knowledge Cutoff.

Die Inferenz ist die Anwendung des fertigen Modells. Jede Anfrage in ChatGPT oder Gemini ist eine Inferenz. Das Modell berechnet die Antwort mit seinen festen Parametern und lernt dabei nichts dauerhaft dazu. Prompt, Chatverlauf und Ergebnisse einer Websuche verändern das Modell nicht. Sie liegen nur für die jeweilige Antwort im Kontextfenster.

Gelernt wird im Training, angewendet bei jeder Anfrage · 2 Phasen eines LLM
Phase 1 · vor der Veröffentlichung
Training
  • Pre-Training mit großen Textsammlungen aus Web, Büchern und Code
  • Feinabstimmung mit Beispielen und menschlichem Feedback
  • Am Ende stehen feste Parameter
Wissens­stichtag
Phase 2 · bei jeder Anfrage
Inferenz
  • Prompt und Kontext gehen ins Modell
  • Parameter bleiben unverändert
  • Die Antwort entsteht Token für Token
Eigene Darstellung

Weil Trainingswissen veraltet, suchen KI-Systeme bei vielen aktuellen Themen im Web. In einem Datensatz von Moz enthielt ein Drittel der 5.333 Suchanfragen, die Gemini über die Programmierschnittstelle (API) selbst absetzte, eine Jahreszahl, fast immer 2026. Moz vermutet, dass Gemini damit Ergebnisse sucht, die neuer sind als seine Trainingsdaten. Die Nachrechnung des Datensatzes steht in der KKP-Auswertung der Grounding Queries von Gemini.

Welche Rolle spielen LLMs in der KI-Suche?

ChatGPT, Gemini, Perplexity, Microsoft Copilot sowie Googles AI Overviews und AI Mode formulieren ihre Antworten mit einem LLM. Für den Inhalt greifen sie auf zwei Wissensquellen zurück. Die erste ist das Trainingswissen in den Parametern. Die zweite sind Seiten, die das System passend zur Frage im Web abruft. Dieser Abrufschritt heißt Retrieval, das gesamte Verfahren Retrieval Augmented Generation, kurz RAG. Wie Suchanfragen, Textabschnitte und Kontextfenster dabei zusammenspielen, erklärt der KKP-Artikel zu Retrieval Augmented Generation.

Ob ChatGPT, Gemini oder Microsoft Copilot im Web suchen, entscheiden die Systeme je Frage. Perplexity, AI Overviews und AI Mode stützen ihre Antworten in der Regel auf Suchergebnisse. In einer KKP-Messung lösten Fragen zu etablierten Konzepten wie „Was ist RAG?“ in ChatGPT und Gemini keine einzige Websuche aus. Gemessen wurden 8 Prompts mit je 5 Läufen pro System, zusammen 80 Läufe. Die Antworten kamen vollständig aus dem Trainingswissen.

Gesucht wird eher bei aktuellen und operativen Fragen. Eine feste Regel ist das nicht. In einer Netzwerk-Analyse von Snippet Digital (06/2026) liefen auch 3 von 10 bewusst aktuell formulierten Fragen an ChatGPT ohne Websuche. Mehr dazu steht im Artikel Wie ChatGPT Quellen auswählt.

Definitionen kommen meist aus dem Training, aktuelle Fakten oft aus der Websuche · 2 Wissensquellen der KI-Suche
MerkmalTrainingswissenWebsuche (RAG)
HerkunftTexte aus dem Training, gespeichert in den ParameternSeiten, die für die Frage live abgerufen werden
AktualitätStand des Wissensstichtagsso aktuell wie der Suchindex
Quellenangabekann formuliert, aber nicht belegt werdenLink auf die abgerufene Seite
Typische FragenDefinitionen, etabliertes WissenPreise, Neuigkeiten, Anbietervergleiche
Einfluss für Brandsnicht gezielt steuerbarüber Inhalte, Struktur und Technik
0 von 80
Läufen mit Websuche bei Fragen zu etablierten Konzepten. KKP-Messung mit 8 Prompts, je 5 Läufe in ChatGPT und Gemini.
Eigene Darstellung · Messung: KKP (2026), Artikel „Retrieval Augmented Generation“

Für Brands gibt es damit einen steuerbaren und einen nicht steuerbaren Teil. Was ein LLM aus dem Training über eine Brand weiß, lässt sich nicht gezielt steuern. Ob ihre Seiten beim Abruf gefunden und als Quelle verlinkt werden, lässt sich dagegen mit Inhalten, Struktur und Technik beeinflussen. Eine Quellenangabe mit Link, die Citation, entsteht nur über den Abruf. Eine Nennung der Brand im Antworttext, die Brand Mention, kann dagegen auch aus dem Trainingswissen stammen. Die Optimierung für diese Systeme heißt Generative Engine Optimization, kurz GEO.

Reasoning-Modelle, Large Action Models und World Models

Reasoning-Modell

Ein Reasoning-Modell ist ein LLM, das vor der eigentlichen Antwort Zwischenschritte erzeugt und eine Aufgabe in Teilschritte zerlegt. Dieses schrittweise Vorgehen heißt auch Chain of Thought. In ChatGPT entspricht das dem Thinking-Modus. Reasoning braucht mehr Rechenzeit und ist vor allem für Vergleiche, Rechenaufgaben und mehrstufige Fragen gedacht.

Für die KI-Suche ist der Modus relevant, weil sich die Quellen mit ihm deutlich unterscheiden können. In einer Semrush-Analyse vom Juni 2026 lief jeder von 100 Prompts je einmal mit minimalem und einmal mit hohem Reasoning durch GPT-5.2. Je Prompt tauchten nur 25,6 % der zitierten Domains in beiden Modi auf. Wie viel davon auf den Modus und wie viel auf normale Streuung zwischen Läufen entfällt, trennt die Analyse nicht, weil es je Modus nur einen Lauf gab. Mit hohem Reasoning setzte das Modell 4,6-mal so viele Teilsuchen ab. Das Aufteilen einer Frage in solche selbst formulierten Teilsuchen heißt Query Fan-Out. Einordnung und Grenzen dieser Analyse stehen im Artikel zum AI-Visibility-Tracking.

Large Action Model

Als Large Action Model (LAM) werden Modelle bezeichnet, die nicht nur Text erzeugen, sondern Aufgaben durch Handlungen erledigen. Sie klicken auf einer Website, füllen ein Formular aus oder schließen eine Buchung ab. In der Praxis steckt dahinter meist ein LLM, das Werkzeuge wie einen Browser oder Programmierschnittstellen bedient. Solche Systeme heißen KI-Agenten. Für Websites bedeutet das, dass neben Menschen und Crawlern auch Agenten Seiten aufrufen und bedienen.

World Model

Ein World Model lernt, wie sich eine Umgebung verhält und verändert, und kann Abläufe darin simulieren. Eingesetzt werden solche Modelle vor allem in Robotik, autonomem Fahren und Simulationen. Anders als ein LLM arbeitet ein World Model nicht in erster Linie mit Text. Für die KI-Suche spielt es derzeit keine direkte Rolle.

Einordnung und Grenzen

Ein LLM lernt im Gespräch nicht dauerhaft dazu. Ob Gespräche später in das Training eines Nachfolgemodells einfließen, regeln die Einstellungen des jeweiligen Anbieters.

Antworten schwanken von Lauf zu Lauf. Das Modell wählt Tokens mit einem Zufallsanteil aus, dazu wirken Modus, Standort und Personalisierung mit. In einem auf Search Engine Land veröffentlichten Test mit ausgeloggtem ChatGPT und 12 Prompts zu B2B-Software (02/2026) tauchten über 100 Läufe desselben Prompts im Schnitt 44 Brands auf, in einer einzelnen Antwort rund 10. Eine Angabe wie „Position 3 in ChatGPT“ beschreibt deshalb eine Momentaufnahme und keinen festen Rang. Belastbar sind nur Raten über viele Läufe, wie die KKP-Analyse zur Streuung zwischen Läufen zeigt.

Eine genannte Quelle ist nicht automatisch belegt. Ohne Abruf kann ein LLM Quellenangaben erzeugen, die plausibel aussehen, aber nicht existieren. Nachprüfbar wird eine Angabe erst, wenn das System die Seite tatsächlich abgerufen hat und auf sie verlinkt.

Häufige Fragen zu LLMs

Was ist der Unterschied zwischen KI und LLM?

KI ist der Oberbegriff für Systeme, die Aufgaben mit menschenähnlicher Intelligenz lösen. Ein LLM ist eine bestimmte Art von KI-Modell, das auf Sprache spezialisiert ist und Text erzeugt, indem es Token für Token berechnet, was wahrscheinlich als Nächstes folgt. Jedes LLM ist also KI, aber nicht jede KI ist ein LLM.

Ist ChatGPT ein LLM?

Genau genommen nein. ChatGPT ist eine Anwendung von OpenAI, die auf Sprachmodellen der GPT-Reihe aufbaut. Das LLM erzeugt die Antworten, die Anwendung ergänzt Funktionen wie Websuche, Dateiupload und Gedächtnis. Umgangssprachlich wird ChatGPT trotzdem oft selbst als LLM bezeichnet.

Ist ein LLM ein akademischer Titel?

In der Schreibweise LL.M. ja. Gemeint ist dann der Legum Magister oder Master of Laws, ein juristischer Masterabschluss. Mit dem Large Language Model aus der KI hat er nur die Buchstaben gemeinsam.

Wofür steht GPT?

GPT steht für Generative Pre-trained Transformer. Ein GPT-Modell erzeugt Text, wurde vorab mit großen Textmengen trainiert und nutzt die 2017 vorgestellte Transformer-Architektur.

Was bedeutet Reasoning bei LLMs?

Reasoning bedeutet, dass ein LLM vor der Antwort Zwischenschritte erzeugt und eine Aufgabe in Teilschritte zerlegt. In ChatGPT entspricht das dem Thinking-Modus. In einer Semrush-Analyse mit GPT-5.2 (06/2026) überschnitten sich die zitierten Domains je Prompt zwischen minimalem und hohem Reasoning nur zu 25,6 %, bei einem Lauf je Modus. Einordnung und Grenzen stehen im Artikel zum AI-Visibility-Tracking.

Woher hat ein LLM sein Wissen?

Ein LLM selbst kennt nur sein Trainingswissen. Es steckt in den Parametern und endet am Wissensstichtag. Systeme wie ChatGPT rufen für viele aktuelle Fragen zusätzlich Seiten aus dem Web ab und können sie als Quelle verlinken. Das Verfahren heißt Retrieval Augmented Generation.

Weiterführende Ressourcen und Quellen

  1. Vaswani et al. (2017): Attention Is All You Need, arXiv
  2. Radford et al. (2018): Improving Language Understanding by Generative Pre-Training, OpenAI
  3. OpenAI Help Center: Understanding and counting tokens
  4. Moz (09/2026): Demystifying Grounding Queries with Real Data
  5. Snippet Digital (06/2026): How ChatGPT Actually Picks Sources (I Read the Network Traffic, Not the Outputs)
  6. Semrush (06/2026): Only 25% of cited sources overlap between ChatGPT's different reasoning modes
  7. Search Engine Land (02/2026): What repeated ChatGPT runs reveal about brand visibility

Einsatz von künstlicher Intelligenz

Dieser Beitrag wurde mithilfe künstlicher Intelligenz erstellt und von unseren Fachexperten sorgfältig überprüft, um sicherzustellen, dass die Informationen korrekt, verständlich und nützlich sind.

KKP AI Search Guide V2.0
Gratis Download

AI Search Guide: Sichtbar in ChatGPT & Co.

Der Praxis-Guide zeigt auf 164 Seiten, wie eine Brand in ChatGPT, Google AI Overviews, Gemini und Perplexity sichtbar wird, von den Grundlagen über Messung und KPIs bis zu konkreten Maßnahmen.

Kostenlos herunterladen →