HerrKI mit seinem RoboterHerrKI KI verstehen · nachbauen · anwenden ⭐ 0 XP

Wie LLMs Fragen beantworten

Von der Frage zur Antwort: Transformer, Wahrscheinlichkeiten, Token-Generierung.

👋 Hi! HerrKI hier - heute erkläre ich dir LLMs: Von der Frage zur Antwort!

Stell dir vor: Du fragst ChatGPT "Was ist KI?" und bekommst eine perfekte Antwort. Aber wie generiert das Modell Wort für Wort die Antwort? Das zeige ich dir jetzt!

Im letzten Kapitel hast du gesehen, wie deine Frage zu Tokens, IDs und Bedeutungs-Vektoren wird. Heute geht die Reise weiter: durch die Transformer-Architektur - das Herzstück von ChatGPT, Claude, GPT-4 und allen modernen LLMs. Du verstehst, wie das Modell Token für Token eine Antwort erzeugt - basierend auf Wahrscheinlichkeiten!

🎯 Was du hier lernst:
  • ✅ Wie Transformer funktionieren (Attention-Mechanismus)
  • ✅ Was ist Token-Generierung? (Wort für Wort vorhersagen)
  • ✅ Wie das Modell Wahrscheinlichkeiten für jedes nächste Wort berechnet
  • ✅ Warum LLMs manchmal "halluzinieren" (falsche Fakten erfinden)

Das Wichtigste: LLMs "verstehen" nicht wirklich - sie rechnen Wahrscheinlichkeiten! "Nach 'Der Hund' kommt wahrscheinlich 'bellt' (85%) oder 'läuft' (10%)". So entsteht Text - Wort für Wort, basierend auf Milliarden Trainingsbeispielen! 🤖

💡 HerrKI-Tipp: LLMs = Vorhersage-Maschinen! Sie sagen das nächste Wort vorher - basierend auf allem, was vorher kam. Keine Magie, nur Mathe! 🎲

💬 Stell eine Frage an das LLM!

Lass uns eine einfache Frage stellen:

👤 DEINE FRAGE:
Was ist die Hauptstadt von Frankreich?

Diese Frage wird jetzt durch das gesamte LLM verarbeitet. Lass uns Schritt für Schritt sehen, was passiert!

🔬 Zusätzliches Wissen: Technische Details

⚡ Warum ist das so schnell?

LLMs verarbeiten alle Tokens parallel (gleichzeitig) im Transformer! Nur die Generation ist sequentiell (Token für Token).

  • Input-Verarbeitung: Alle Tokens auf einmal → sehr schnell!
  • Output-Generierung: Ein Token nach dem anderen → langsamer
  • GPUs/TPUs: Spezielle Hardware für parallele Berechnungen

🎲 Temperature & Sampling

Das LLM wählt nicht immer das wahrscheinlichste Token! Es gibt verschiedene Strategien:

  • Greedy Decoding: Wähle immer das wahrscheinlichste Token → langweilig, aber präzise
  • Temperature Sampling: Höhere Temperatur = mehr Kreativität/Zufall
  • Top-k Sampling: Wähle zufällig aus den Top k wahrscheinlichsten Tokens
  • Nucleus (Top-p) Sampling: Wähle aus Tokens, die zusammen p% Wahrscheinlichkeit haben

🔢 Größenordnungen (GPT-3.5 / GPT-4):

  • Parameter: 175 Milliarden (GPT-3) bis über 1 Billion (GPT-4)
  • Layers: 96+ Transformer-Layer
  • Embedding-Dimension: 12.288 (statt 768)
  • Kontext-Länge: 8.000 - 128.000 Tokens
  • Inference-Zeit: ~50-100ms pro Token

🧠 Kurzer Check — hast du es?

Drei schnelle Fragen, dann bist du durch — klick einfach deine Antwort an:

1. Was macht ein LLM im Kern, wenn es dir antwortet?
2. Was passiert im Transformer-Schritt?
3. Warum kann dieselbe Frage zweimal leicht verschiedene Antworten ergeben?
🎉 Jetzt hast du den kompletten Kreis geschlossen: Frage → Tokens → Embeddings → Transformer-Mathe → Wahrscheinlichkeiten → Antwort, Token für Token. Wenn dir ChatGPT das nächste Mal antwortet, siehst du keine Magie mehr, sondern eine Vorhersage-Maschine bei der Arbeit - und du weißt, dass „Paris" nur deshalb kommt, weil es die 92-%-Hand hebt. Von hier aus hast du drei spannende Wege: baue selbst dein erstes Netz, schau der KI beim „Denken" zu (Reasoning) oder erkunde die Bedeutungs-Landkarte (Latent Space), auf der das alles spielt.