Informatik KI – Rekurrente Netze und LSTM
Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Was unterscheidet ein rekurrentes neuronales Netz von einem Feedforward-Netz? · Welch…
Karten
14 KartenWas unterscheidet ein rekurrentes neuronales Netz von einem Feedforward-Netz?
Rückseite
RNNs besitzen rekurrente Verbindungen, sodass der versteckte Zustand h_t Informationen aus vorherigen Zeitschritten t-1, t-2 speichert und für Sequenzen nutzbar macht.
Welche Rolle spielt Weight Sharing in RNNs?
Rückseite
Dasselbe Gewichtsmatrix-Set (W_hh, W_xh, W_hy) wird für alle Zeitschritte wiederverwendet, was Parameterzahl konstant hält und Verallgemeinerung auf variable Sequenzlängen ermöglicht.
Wie wird der versteckte Zustand h_t in einem einfachen RNN berechnet?
Rückseite
h_t = tanh(W_hh * h_{t-1} + W_xh * x_t + b_h), wobei h_{t-1} der vorherige Zustand und x_t der aktuelle Input ist.
Was ist Backpropagation Through Time (BPTT)?
Rückseite
BPTT entfaltet das RNN über die Zeit, behandelt es als tiefes Feedforward-Netz und berechnet Gradienten durch Summation über alle Zeitschritte für gemeinsame Gewichte.
Warum tritt das Vanishing-Gradient-Problem bei langen Sequenzen auf?
Rückseite
Bei wiederholter Multiplikation der Jacobimatrix W_hh^T über viele Zeitschritte gehen Eigenwerte < 1 gegen null, Gradienten verschwinden exponentiell.
Welchen Zweck erfüllt der Zellzustand c_t in einer LSTM-Zelle?
Rückseite
Der Zellzustand wirkt als konstanter Fehlerkarussell (Constant Error Carousel), der Information linear über viele Zeitschritte transportiert, ohne durch nicht-lineare Aktivierungen gedämpft zu werden.
Was steuert der Forget-Gate f_t in einer LSTM?
Rückseite
f_t = sigmoid(W_f * [h_{t-1}, x_t] + b_f) bestimmt elementweise, welcher Anteil des vorherigen Zellzustands c_{t-1} verworfen wird (Werte nahe 0) oder behalten wird (Werte nahe 1).
Wie berechnet der Input-Gate die Kandidatwerte für den Zellzustand?
Rückseite
Input-Gate i_t = sigmoid(...) und Kandidat c̃_t = tanh(W_c * [h_{t-1}, x_t] + b_c); neuer Zustand: c_t = f_t ⊙ c_{t-1} + i_t ⊙ c̃_t.
Welche Funktion hat der Output-Gate o_t?
Rückseite
o_t = sigmoid(W_o * [h_{t-1}, x_t] + b_o) filtert den versteckten Zustand h_t = o_t ⊙ tanh(c_t), sodass nur relevante Zellzustandsanteile nach außen gelangen.
Worin besteht der Hauptunterschied zwischen LSTM und GRU?
Rückseite
GRU vereint Forget- und Input-Gate zu einem Update-Gate z_t, besitzt keinen separaten Zellzustand, hat weniger Parameter und ist recheneffizienter bei vergleichbarer Leistung.
Was bewirkt ein bidirektionales RNN (BiRNN)?
Rückseite
Zwei RNNs verarbeiten die Sequenz vorwärts und rückwärts; ihre versteckten Zustände werden konkateniert, sodass h_t Kontext aus Vergangenheit und Zukunft enthält.
Was ist Teacher Forcing beim Training von RNNs?
Rückseite
Während des Trainings wird der Ground-Truth-Token y_{t-1} als nächster Input x_t eingespeist statt der Modellvorhersage, was Konvergenz beschleunigt, aber Exposure Bias erzeugt.
Wie mildert Gradient Clipping das Exploding-Gradient-Problem?
Rückseite
Wenn die Gradienten-Norm einen Schwellwert (z. B. 1.0 oder 5.0) überschreitet, wird der Gradient proportional herunterskaliert, Richtung bleibt erhalten, Betrag begrenzt.
Nenne eine typische Anwendung für LSTMs im NLP.
Rückseite
Sprachmodellierung: Vorhersage des nächsten Wortes basierend auf Kontext; genutzt für Textgenerierung, Autovervollständigung und als Vorstufe für Transformer-Architekturen.