Tokenization, Word Embeddings — wie Sprachmodelle Text als Tensoren verarbeiten.
👋 Hi! HerrKI hier - heute erkläre ich dir Text & LLMs!
Stell dir vor: Du schreibst "Hallo Welt" in ChatGPT. Aber wie versteht die KI deine Worte?
Computer können doch nur Zahlen! Die Lösung: Tokenization und Word Embeddings!
Heute zeige ich dir, wie Text in Zahlen (Tensoren) umgewandelt wird -
die Grundlage für alle LLMs wie ChatGPT, Claude, GPT-4. Ohne diesen Schritt könnte kein
Chatbot, keine Übersetzung, keine Stimmungs-Analyse funktionieren! Am Ende landet jedes Wort als
Vektor (Rank 1) - du kennst das Muster inzwischen.
🎯 Was du hier lernst:
✅ Was ist Tokenization? (Text → Token-IDs)
✅ Was sind Word Embeddings? (Wörter als Vektoren)
✅ Wie LLMs Text als Zahlen-Sequenzen verarbeiten
✅ Warum "Katze" und "Hund" sich ähnlich sind (im Vektor-Raum)
Das Krasse: Jedes Wort wird zu einem Vektor (z.B. 768 Zahlen).
"König" - "Mann" + "Frau" = "Königin" funktioniert wirklich - mit Mathe! 🤯
Das ist die Magie hinter ChatGPT - aber jetzt verstehst du, wie's funktioniert!
💡 HerrKI-Tipp:Text → Token-IDs → Embeddings → Tensor.
Jedes Wort wird zu einem Vektor mit hunderten Zahlen. So "versteht" die KI Sprache! 💬
🌺 Ein Gedicht über die rote Pflanze
Erinnerst du dich an das Bild der roten Pflanze? Hier ist ein kleines Gedicht darüber:
Die Rote Blume
Im Garten steht sie stolz und rot,
Die Blume leuchtet wie Morgenrot.
Mit zartem Grün umrankt die Pracht,
Ein Kunstwerk, das die Natur vollbracht.
1️⃣ Schritt 1: Tokenization (Text → Tokens)
Der Text wird in kleine Einheiten ("Tokens") zerlegt. Das können Wörter, Wortteile oder Satzzeichen sein.
↓
💡 Anzahl der Tokens:0
2️⃣ Schritt 2: Token-IDs (Tokens → Zahlen)
Jedes Token bekommt eine eindeutige Nummer - wie in einem Wörterbuch oder Telefonbuch!
📖 Analogie: Das Wörterbuch des LLMs
Stell dir vor, das LLM hat ein riesiges Wörterbuch mit 50.000 Einträgen. Jedes Wort/Token hat eine feste Seitenzahl:
"Blume"
→ Seite
1000
"rot"
→ Seite
1001
"Garten"
→ Seite
1002
Warum? Computer können nur mit Zahlen rechnen, nicht mit Text! Die Token-ID ist wie eine Adresse im Speicher.
↓
Dein Gedicht als Token-IDs:
💡 Shape als Tensor:[0]
Das ist ein Rank-1 Tensor (Vektor) mit Token-IDs!
❌ Problem mit Token-IDs alleine:
Die IDs sind willkürlich! Die Zahl 1000 für "Blume" sagt nichts über die Bedeutung aus.
Das LLM wüsste nicht, dass "Blume" (1000) und "Pflanze" (1003) ähnliche Bedeutungen haben.
→ Deshalb brauchen wir Embeddings!
3️⃣ Schritt 3: Word Embeddings (Die Magie der Bedeutung!)
Jetzt kommt der clevere Teil: Jede Token-ID wird zu einem Embedding-Vektor - eine Liste von Zahlen, die die Bedeutung des Wortes kodiert!
🗺️ Analogie: Wörter als Punkte auf einer Landkarte
Stell dir vor, jedes Wort ist ein Punkt auf einer riesigen Landkarte. Die Position sagt etwas über die Bedeutung aus:
(Merk dir dieses Bild gut - diese „Bedeutungs-Landkarte" heißt in der Fachwelt Latent Space
und bekommt später ein eigenes Kapitel zum Herumspielen.)
Vereinfachtes 2D-Beispiel (in Wirklichkeit: 768 Dimensionen!)
💡 Siehst du?
• Grüne Punkte (Blume, Pflanze, Garten) sind nah beieinander → ähnliche Bedeutung!
• Rote Punkte (rot, rosa, leuchtet) sind auch nah beieinander → beide über Farben!
• Abstand = Ähnlichkeit! Je näher zwei Wörter, desto ähnlicher die Bedeutung.
🔢 Was ist ein Embedding konkret?
Ein Embedding ist einfach eine Liste von Koordinaten, die die Position auf der "Bedeutungs-Landkarte" beschreiben:
"Blume"
[0.23, 0.67, -0.12, 0.45, ...]
→ 768 Zahlen!
"Pflanze"
[0.25, 0.64, -0.10, 0.43, ...]
→ Fast gleich! ✓
→ Die Vektoren sind sehr ähnlich, weil "Blume" und "Pflanze" ähnliche Bedeutungen haben!
✅ Warum sind Embeddings besser als nur IDs?
❌ Nur Token-IDs:
"Blume" = 1000
"Pflanze" = 1003
Abstand: 3
→ Willkürlich, keine Bedeutung!
✅ Mit Embeddings:
"Blume" = [0.23, 0.67, ...]
"Pflanze" = [0.25, 0.64, ...]
Abstand: 0.03 (sehr nah!)
→ Bedeutung ist kodiert!
Das LLM kann jetzt rechnen: "Wenn Blume und Pflanze nah sind, und der User fragt nach Pflanzen,
dann sind Antworten über Blumen wahrscheinlich relevant!"
↓
Embedding für das erste Token aus deinem Gedicht: ""
In der Realität hat jedes Wort ein Embedding mit 768 Zahlen (bei BERT/GPT-2) oder sogar
12.288 Zahlen (bei GPT-3). Hier siehst du die ersten 100 Werte:
💡 Shape für EIN Token:[768]
Das ist ein Rank-1 Tensor (Vektor) mit 768 Dimensionen - wie 768 Koordinaten!
💡 Shape für ALLE Tokens:[0, 768]
Das ist ein Rank-2 Tensor (Matrix): [Anzahl_Tokens, Embedding_Dimension]
🎓 Zusammenfassung: Was sind Embeddings?
📍 Position auf einer "Bedeutungs-Landkarte"
🔢 Liste von Zahlen (z.B. 768 Werte)
🤝 Ähnliche Wörter haben ähnliche Vektoren
🧮 LLM kann damit rechnen (Abstand, Ähnlichkeit)
🎯 Bedeutung ist kodiert, nicht nur willkürliche IDs!
🎓 Aber woher kommt die Position auf der Landkarte?
Gute Frage! Die Embeddings werden durch Training gelernt. Das Geheimnis ist:
💡 "Du sollst an der Gesellschaft gemessen werden, die du hältst"
Wörter, die in ähnlichen Kontexten vorkommen, bekommen ähnliche Embeddings!
📚 Beispiel: Wie das LLM lernt
Das LLM liest Millionen von Sätzen:
"Im Garten wächst eine rote Blume."
"Die Pflanze im Garten braucht Wasser."
"Im Garten steht eine schöne Rose."
→ Was lernt das LLM?
"Blume", "Pflanze" und "Rose" erscheinen oft in ähnlichen Kontexten (mit "Garten", "rot", "wächst"). → Also bekommen sie ähnliche Embeddings! Sie landen nah beieinander auf der Landkarte.
🔧 Der Trainings-Prozess (vereinfacht):
Schritt 1: Starte mit zufälligen Embeddings (alle Wörter haben willkürliche Positionen)
Schritt 2: Lies Millionen von Texten aus dem Internet
Schritt 3: Für jeden Satz: Versuche, aus dem Kontext das nächste Wort vorherzusagen
Schritt 4: War die Vorhersage falsch? → Passe die Embeddings an!
Schritt 5: Wiederhole das Milliarden mal → Embeddings werden immer besser!
Konkretes Beispiel:
Satz: "Im Garten wächst eine rote ___" Vorhersage: Das LLM soll das nächste Wort erraten. Wenn es "Blume" vorhergesagt hat → Richtig! ✓
→ Die Embeddings von "Garten", "wächst", "rot" und "Blume" werden etwas näher zusammengeschoben! Wenn es "Auto" vorhergesagt hat → Falsch! ✗
→ Die Embeddings werden angepasst, damit "Blume" beim nächsten Mal wahrscheinlicher ist.
🎯 Das Ergebnis nach dem Training:
Nah beieinander 🤝
König ↔ Königin
Mann ↔ Frau
Paris ↔ Frankreich
läuft ↔ rennt
groß ↔ riesig
Weit auseinander 🚫
Blume ↔ Computer
schnell ↔ Tisch
Paris ↔ glücklich
rot ↔ Mathematik
Garten ↔ Rakete
🎉 Noch cooler: Embeddings können sogar Mathematik!
König - Mann + Frau ≈ Königin
Das funktioniert wirklich! Die Vektoren kodieren Bedeutungs-Beziehungen.
📊 Trainings-Zahlen (GPT-3 Beispiel):
🌐 Training-Daten: 45 TB Text (fast das gesamte Internet!)
📚 Anzahl Tokens: ~500 Milliarden Wörter/Tokens
⏱️ Training-Dauer: Mehrere Wochen auf Tausenden GPUs
💰 Kosten: Mehrere Millionen Dollar
🎯 Ergebnis: Embeddings, die menschliche Sprache "verstehen"!
💭 Fazit: Woher kommt die Position?
Die Position eines Wortes auf der "Bedeutungs-Landkarte" kommt nicht aus einem Wörterbuch,
sondern aus Millionen von Beispielen, wie das Wort in echten Texten verwendet wird!
→ "Zeige mir deine Freunde (Kontext), und ich sage dir, wer du bist (Bedeutung)!"
Du hast jetzt gesehen, wie beide Datentypen in Tensoren umgewandelt werden:
🖼️ Bilder → Tensoren
Pixel → RGB-Werte (0-255)
Shape: [H, W, 3]
Direkt als Zahlen
Feste Größe nötig
💬 Text → Tensoren
Text → Tokens → IDs → Embeddings
Shape: [seq_len, emb_dim]
Bedeutung encodiert
Variable Länge möglich
Jetzt bist du bereit, neuronale Netze zu verstehen! Du weißt, wie Daten (Bilder und Text)
in Tensoren umgewandelt werden - die Sprache der KI. Im nächsten Kapitel lernst du, wie diese Tensoren
durch Neuronen, Layer und Aktivierungsfunktionen verarbeitet werden.
🧠 Kurzer Check — hast du es?
Drei schnelle Fragen, dann bist du durch — klick einfach deine Antwort an:
1. In welcher Reihenfolge wird Text für eine KI verarbeitet?
Genau die Kette aus dem Kapitel: zerlegen (Tokens), nummerieren (IDs), dann jedem Token seinen Bedeutungs-Vektor geben (Embedding). Erst damit kann gerechnet werden.
2. Was ist ein Word Embedding?
Richtig — und diese Landkarte heißt Latent Space. „König“ und „Königin“ wohnen dort Tür an Tür; im Latent-Space-Kapitel darfst du später selbst darauf spazieren.
3. „Liest“ die KI deinen Text so wie du?
Genau: Nach der Umwandlung existiert dein Satz für das Modell nur noch als Tensor. Alles Weitere — Verstehen, Antworten — ist Rechnen mit diesen Vektoren.
🎉 Halte kurz inne - das war ein großer Schritt: Du weißt jetzt, was beim Tippen in ChatGPT
als Allererstes passiert: Text → Tokens → IDs → Bedeutungs-Vektoren. Wenn dir also jemand erzählt, die KI
„liest" deine Nachricht - du weißt es besser: Sie rechnet mit einem Tensor der Shape [Tokens, 768].
Und wie aus diesen Vektoren dann eine ANTWORT entsteht? Genau das nehmen wir uns
jetzt vor: „Wie LLMs Fragen beantworten".