Zur Community

Informatik KI – Transformer und Attention

15 KartenInformatikatrio02.10.2026Nur mit Link

Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was berechnet der Scaled Dot-Product Attention? · Warum wird im Attention der Skalar …

Karten

15 Karten
STANDARD

Was berechnet der Scaled Dot-Product Attention?

Rückseite

Attention(Q,K,V) = softmax(Q·K^T/√d_k)·V. Queries werden mit Keys verglichen, gewichtete Values summiert.

STANDARD

Warum wird im Attention der Skalar 1/√d_k verwendet?

Rückseite

Verhindert zu große Skalarprodukte bei hoher Dimensionszahl d_k, die Softmax in Sättigungsbereiche drücken und Gradienten verschwinden lassen.

STANDARD

Was ist der Unterschied zwischen Self-Attention und Cross-Attention?

Rückseite

Self-Attention: Q,K,V stammen aus derselben Sequenz. Cross-Attention: Q aus Decoder, K,V aus Encoder-Ausgabe.

STANDARD

Wie funktioniert Multi-Head-Attention?

Rückseite

Projektion von Q,K,V in h verschiedene Teilräume, parallele Attention-Berechnung, Konkatenation und finale lineare Projektion.

STANDARD

Welche Rolle spielt Positional Encoding im Transformer?

Rückseite

Fügt Positionsinformation hinzu, da Attention selbst permutationseinvariant ist. Meist sinusförmige Funktionen oder lernbare Embeddings.

STANDARD

Was passiert im Feed-Forward-Netzwerk jedes Transformer-Layers?

Rückseite

Zwei lineare Transformationen mit ReLU/GELU-Aktivierung dazwischen. Wird positionsweise unabhängig auf jedes Token angewendet.

STANDARD

Wozu dienen Residual Connections und Layer Normalization?

Rückseite

Residuals ermöglichen Gradientenfluss in tiefen Netzen. LayerNorm stabilisiert Aktivierungen über Feature-Dimension pro Token.

STANDARD

Wie unterscheidet sich BERT-Encoder von GPT-Decoder?

Rückseite

BERT nutzt bidirektionale Self-Attention (voller Kontext). GPT nutzt kausale Masked Self-Attention (nur vergangene Tokens).

STANDARD

Was bewirkt die kausale Maske im Decoder-Self-Attention?

Rückseite

Setzt Attention-Scores zukünftiger Positionen auf -∞ vor Softmax, sodass Tokens nur auf vorherige Positionen attendieren können.

STANDARD

Wie viele Parameter hat ein Transformer-Block ca. bei d_model=512, h=8, d_ff=2048?

Rückseite

Rund 3,1 Mio. Parameter: Q,K,V-Projektionen (3×512²), Output-Projektion (512²), zwei FFN-Layer (2×512×2048 + 2048×512).

STANDARD

Was ist der Zweck von Masked Language Modeling bei BERT?

Rückseite

Zufällige 15% Tokens werden maskiert; Modell muss sie aus bidirektionalem Kontext vorhersagen. Erlernt tiefe bidirektionale Repräsentationen.

STANDARD

Wie generiert GPT Text autoregressiv?

Rückseite

Bei jedem Schritt wird nächster Token aus Distribution über Vokabular gesampelt, an Input angehängt, nächster Forward-Pass ausgeführt.

STANDARD

Was versteht man unter Attention-Heads als 'spezialisierte Rollen'?

Rückseite

Verschiedene Heads lernen unterschiedliche Relationen: syntaktische Abhängigkeiten, Korreferenzauflösung, Positionsmuster etc.

STANDARD

Warum skaliert Attention quadratisch mit Sequenzlänge?

Rückseite

Attention-Matrix ist n×n für n Tokens. Speicher und Rechenaufwand wachsen mit O(n²), was lange Sequenzen limitiert.

STANDARD

Nenne zwei Methoden zur Reduktion der quadratischen Attention-Komplexität.

Rückseite

Sparse Attention (z. B. Longformer), Lineare Attention (Kernel-Trick), Flash Attention (IO-bewusst), oder State-Space-Modelle (Mamba).

Lerne diese Karten mit Spaced Repetition

Kopiere das Deck kostenlos in deine Bibliothek und starte den Lernmodus mit dem FSRS-5 Algorithmus.