HerrKI mit seinem RoboterHerrKI KI verstehen · nachbauen · anwenden ⭐ 0 XP

Worauf schaut die KI gerade? (Attention)

Jedes Wort fragt alle anderen: „Wie wichtig bist du für mich?“ — Erlebe an der doppeldeutigen „Bank“, wie Attention Bedeutung aus dem Kontext baut. Der Kernmechanismus aller modernen KI-Modelle.

👋 HerrKI hier — heute öffnen wir das Herzstück von ChatGPT & Co.

Ein Wort wie „Bank“ hat allein keine feste Bedeutung: Geldinstitut? Sitzgelegenheit? In „Latent Space“ war jedes Wort EIN Punkt — aber welcher Punkt ist richtig, hängt vom Satz drumherum ab. Der Mechanismus, der das löst, heißt Attention — und er ist der Grund, warum moderne Sprachmodelle überhaupt funktionieren.

Die Idee in einem Satz

Jedes Wort fragt alle anderen Wörter: „Wie wichtig bist du für MICH?“ — und mischt sich aus den Antworten eine neue, vom Kontext abhängige Bedeutung zusammen.

Drei Zutaten pro Wort, ganz ohne Formelgewitter — stell dir einen Karteikasten vor:

🔎 Query (Suchanfrage): „Wonach suche ich gerade?“ — Bank fragt z. B.: „Gibt es hier Hinweise, welche Bank ich bin?“

🏷️ Key (Karteireiter): „Was biete ich an?“ — Fluss meldet: „Ich bin Natur/Wasser!“

📄 Value (Karteninhalt): die eigentliche Information, die weitergegeben wird, wenn Suchanfrage und Reiter zusammenpassen.

Passt eine Query gut zu einem Key, gibt es ein hohes Attention-Gewicht — und der zugehörige Value fließt stark in die neue Bedeutung ein.

🔦 Tippe ein Wort an — und sieh, worauf es „schaut“

Die ganze Matrix auf einen Blick

Attention berechnet diese Gewichte für alle Wörter gleichzeitig — eine ganze Tabelle (Zeile = wer schaut, Spalte = worauf; jede Zeile summiert sich zu 100 %):

Warum MEHRERE Köpfe?

Du hast es oben schon umgeschaltet: Ein Kopf achtet auf Bedeutung (Bank↔Fluss bzw. Bank↔Konto), einer auf Grammatik (Artikel↔Substantiv, Hilfsverb↔Partizip), einer schlicht auf Nachbarwörter. Echte Modelle haben Dutzende solcher Köpfe pro Schicht — jeder lernt im Training selbst, worauf er achtet. „Der Transformer schaut auf alles gleichzeitig“ heißt genau das: alle Wörter × alle Wörter × viele Blickwinkel, parallel.

🗺️ Und so wandert die Bedeutung im Latent Space

Derselbe Wortpunkt „Bank“, zwei Sätze: Schalte oben den Satz um und sieh zu, wie der Kontext den Punkt zwischen der Geld-Region und der Natur-Region verschiebt (Karte wie in Kapitel 310):

🔬 Runter zum Tensor

Alles, was du eben angetippt hast, ist Tensor-Rechnung (Kapitel 060). Rechnen wir eine Zeile der Heatmap von Hand nach: Was fragt die „Bank“ im Satz „Die Bank am Fluss war nass.“ — und wer antwortet am lautesten?

// Zum Mitrechnen auf 3 Zahlen verkleinert — echt sind es 64 bis 128 pro Kopf. // V (der weitergegebene Inhalt) sieht hier der Einfachheit halber aus wie K. Natur/Wasser Geld Satzbau Q „Bank“ (sucht) 1.5 1.2 0.4 K „Fluss“ (bietet) 1.8 0.0 0.3 K „nass“ (bietet) 0.9 0.0 0.4 K „Die“ (bietet) 0.0 0.0 0.6
Punkte = Q · K, Achse für Achse: Bank·Fluss = 1.5×1.8 + 1.2×0.0 + 0.4×0.3 = 2.82 Bank·nass = 1.5×0.9 + 1.2×0.0 + 0.4×0.4 = 1.51 Bank·Die = 1.5×0.0 + 1.2×0.0 + 0.4×0.6 = 0.24 Softmax macht daraus Prozente (Summe 100 %): e^2.82 = 16.8 e^1.51 = 4.5 e^0.24 = 1.3 Summe 22.6 Fluss 16.8/22.6 = 74 % nass 20 % Die 6 % Neue Bedeutung = gewichteter Mix der Values: Natur-Achse: 0.74×1.8 + 0.20×0.9 + 0.06×0.0 = 1.51 → „Bank“ wandert Richtung Natur — genau die Karte oben.

Und jetzt der zweite Satz: Statt „Fluss“ steht dort „Konto“ mit K = [0.0, 1.9, 0.2]. Dieselbe Frage, dieselben Gewichte — nur die Nachbarn sind andere: 1.5×0.0 + 1.2×1.9 + 0.4×0.2 = 2.36. Die Geld-Achse gewinnt, und dieselbe „Bank“ bekommt eine andere Bedeutung. So heißt das im Code, für alle sieben Wörter gleichzeitig:

// Q, K, V entstehen aus den Wort-Embeddings (Kapitel 040/310) per Matrix-Multiplikation. punkte = Q.matMul( K.transpose() ) // [7,64]x[64,7] -> [7,7]: unsere 2.82, 1.51, 0.24 ... gewichte = softmax( punkte ) // jede Zeile -> Prozente, Summe 100 % (deine Heatmap!) neu = gewichte.matMul( V ) // [7,7]x[7,64] -> [7,64]: der Mix von oben

Drei Zeilen. Millionenfach parallel. Das ist der komplette Trick.

Zurück zur Anwendung

Wenn ChatGPT in einem langen Gespräch weiß, dass sich „sie“ auf deine Katze aus Absatz 1 bezieht — das ist Attention. Wenn ein Übersetzer „bank“ mal mit Ufer, mal mit Geldhaus übersetzt — Attention. Und in „Erst denken, dann reden“ siehst du als Nächstes, was passiert, wenn ein Modell mit diesem Mechanismus Schritt für Schritt nachdenkt.

🧠 Kurzer Check — hast du es?

1. Was berechnet Attention für ein Wort?
2. Wofür stehen Query, Key und Value?
3. Warum hat ein Transformer VIELE Attention-Köpfe?