Datensatz-Evaluierungsmetriken (Dataset Evaluation Metrics)
Quantitative Maße zur Beurteilung der Qualität, Ausgewogenheit und Eignung eines Datensatzes für das Training von Machine-Learning-Modellen.
Der Data-Centric AI Ansatz betont, dass die Optimierung dieser Metriken oft mehr bringt als das Tuning des Algorithmus. Frameworks wie 'Datasheets for Datasets' fordern die Dokumentation dieser Metriken, um Bias zu verhindern.
graph LR
Center["Datensatz-Evaluierungsmetriken (Dataset Evaluation Metrics)"]:::main
Rel_decentralized_credit_scoring_algorithms["decentralized-credit-scoring-algorithms"]:::related -.-> Center
click Rel_decentralized_credit_scoring_algorithms "/terms/decentralized-credit-scoring-algorithms"
Rel_risk_assessment["risk-assessment"]:::related -.-> Center
click Rel_risk_assessment "/terms/risk-assessment"
Rel_digital_certificate_management["digital-certificate-management"]:::related -.-> Center
click Rel_digital_certificate_management "/terms/digital-certificate-management"
classDef main fill:#7c3aed,stroke:#8b5cf6,stroke-width:2px,color:white,font-weight:bold,rx:5,ry:5;
classDef pre fill:#0f172a,stroke:#3b82f6,color:#94a3b8,rx:5,ry:5;
classDef child fill:#0f172a,stroke:#10b981,color:#94a3b8,rx:5,ry:5;
classDef related fill:#0f172a,stroke:#8b5cf6,stroke-dasharray: 5 5,color:#94a3b8,rx:5,ry:5;
linkStyle default stroke:#4b5563,stroke-width:2px;
🧒 Erkläre es wie einem 5-Jährigen
Stell dir vor, du bringst einem Kind mit Lernkarten Tiere bei. Datensatz-Metriken sind wie das Prüfen der Karten vor dem Unterricht: Hast du genug Karten? Hast du 50 Hunde, aber nur 1 Katze (Klassenungleichgewicht)? Sind einige Karten leer (fehlende Werte)? Wenn die Karten schlecht sind, lernt das Kind falsch, egal wie schlau es ist.
🤓 Expert Deep Dive
Kategorien: 1. Datenqualität: Null-Wert-Quote, Kardinalität. 2. Distribution & Drift: KL-Divergenz und PSI messen, wie stark sich Produktionsdaten von Trainingsdaten wegbewegen. 3. Class Imbalance: Gemessen als Imbalance Ratio; erfordert oft Oversampling (SMOTE). 4. Synthetische Daten: Metriken wie die Fréchet Inception Distance (FID) bewerten, wie nah KI-generierte Daten an der Realität sind.
❓ Häufig gestellte Fragen
What is the difference between dataset metrics and model metrics?
Dataset metrics evaluate the raw data before training (e.g., checking for missing values or class imbalance). Model metrics evaluate the AI's performance after training (e.g., checking its accuracy or error rate).
What is 'data leakage' in machine learning?
Data leakage happens when the dataset accidentally includes clues about the answer that won't be available in the real world. For example, predicting if a patient has cancer, but including their 'chemotherapy' medical code in the training data.
How do you measure if a dataset has changed over time?
Data scientists use metrics like KL Divergence or Population Stability Index (PSI) to compare the original training dataset with new, real-world data to see if the statistical distribution has 'drifted'.