Informatik KI – Maschinelles Lernen Grundlagen
Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Was unterscheidet überwachtes von unüberwachtem Lernen? · Nenne die drei Hauptkategor…
Karten
14 KartenWas unterscheidet überwachtes von unüberwachtem Lernen?
Rückseite
Überwachtes Lernen nutzt gelabelte Trainingsdaten (Input-Output-Paare), unüberwachtes Lernen findet Strukturen in ungelabelten Daten ohne Zielvariable.
Nenne die drei Hauptkategorien des maschinellen Lernens.
Rückseite
Überwachtes Lernen (Supervised), unüberwachtes Lernen (Unsupervised) und Bestärkendes Lernen (Reinforcement Learning) – letztere lernt durch Belohnungssignale in einer Umgebung.
Was ist Overfitting und wie erkennt man es?
Rückseite
Overfitting liegt vor, wenn das Modell Trainingsdaten auswendig lernt statt zu generalisieren: Trainingsfehler sehr niedrig, Testfehler deutlich höher.
Erkläre den Bias-Variance-Tradeoff in einem Satz.
Rückseite
Einfache Modelle haben hohen Bias (Unteranpassung), komplexe Modelle hohe Varianz (Overfitting) – optimale Modellkomplexität minimiert den Gesamtfehler.
Wie funktioniert Gradient Descent vereinfacht?
Rückseite
Iteratives Optimierungsverfahren: Berechne Gradienten der Verlustfunktion nach Parametern, aktualisiere Parameter entgegen der Gradientenrichtung mit Lernrate als Schrittweite.
Wann nutzt man Precision, Recall und F1-Score statt Accuracy?
Rückseite
Bei unbalancierten Datensätzen: Accuracy täuscht bei Klassenungleichgewicht, Precision misst Trefferquote unter positiven Vorhersagen, Recall Vollständigkeit gefundener Positiver, F1 harmonisches Mittel beider.
Was misst die ROC-AUC-Metrik?
Rückseite
Area Under the Receiver Operating Characteristic Curve: Wahrscheinlichkeit, dass ein zufällig gewähltes positives Sample höher gerankt wird als ein negatives – schwellenunabhängiges Gütekriterium.
Wozu dient Regularisierung (L1/L2) bei linearen Modellen?
Rückseite
Regularisierung fügt Strafterm zur Verlustfunktion hinzu: L1 (Lasso) fördert Sparsität durch Null-Gewichte, L2 (Ridge) schrumpft Gewichte gleichmäßig – beide reduzieren Overfitting.
Was bewirkt Cross-Validation (k-Fold) gegenüber einem einzelnen Train-Test-Split?
Rückseite
Daten werden in k Folds aufgeteilt, je ein Fold dient als Validierung, Rest als Training – ergibt robustere Performanceschätzung mit geringerer Varianz.
Warum ist Feature Scaling bei Gradient Descent wichtig?
Rückseite
Unterschiedliche Skalierungen führen zu elliptischen Fehlerflächen, verlangsamen Konvergenz stark – Standardisierung (z-Score) oder Normalisierung (Min-Max) beschleunigen Training erheblich.
Wie entscheidet ein Decision Tree über Splits?
Rückseite
Rekursiv: Wählt Feature und Threshold, die Informationsgewinn (Entropie-Reduktion) oder Gini-Impurity-Minimierung maximieren – stoppt bei Max-Tiefe, Min-Samples oder reinen Knoten.
Was ist der Hauptunterschied zwischen K-Means und hierarchischem Clustering?
Rückseite
K-Means partitioniert Daten in k feste Cluster (zentroidbasiert), hierarchisches Clustering baut Dendrogramm ohne vorgegebenes k – letztere erlaubt Clusteranzahl nachträglich zu wählen.
Erkläre den Unterschied zwischen Parametern und Hyperparametern.
Rückseite
Parameter (Gewichte, Bias) werden während Trainings aus Daten gelernt, Hyperparameter (Lernrate, Baumtiefe, k bei KNN) werden vor Trainingsbeginn festgelegt und steuern den Lernprozess.
Was versteht man unter Ensemble Learning am Beispiel Random Forest?
Rückseite
Kombination mehrerer schwacher Learner (Decision Trees) durch Bagging: Jeder Baum trainiert auf Bootstrap-Sample mit zufälliger Feature-Auswahl – Durchschnitt/Voting reduziert Varianz ohne Bias-Erhöhung.