Метрики оценки датасета (Dataset Evaluation Metrics)
Количественные и качественные показатели для оценки качества, сбалансированности, репрезентативности и пригодности набора данных для обучения ИИ.
Подход Data-Centric AI (ИИ, ориентированный на данные) доказывает, что улучшение метрик датасета дает больший прирост производительности модели, чем бесконечная настройка гиперпараметров.
graph LR
Center["Метрики оценки датасета (Dataset Evaluation Metrics)"]:::main
Rel_decentralized_credit_scoring_algorithms["decentralized-credit-scoring-algorithms"]:::related -.-> Center
click Rel_decentralized_credit_scoring_algorithms "/terms/decentralized-credit-scoring-algorithms"
Rel_risk_assessment["risk-assessment"]:::related -.-> Center
click Rel_risk_assessment "/terms/risk-assessment"
Rel_digital_certificate_management["digital-certificate-management"]:::related -.-> Center
click Rel_digital_certificate_management "/terms/digital-certificate-management"
classDef main fill:#7c3aed,stroke:#8b5cf6,stroke-width:2px,color:white,font-weight:bold,rx:5,ry:5;
classDef pre fill:#0f172a,stroke:#3b82f6,color:#94a3b8,rx:5,ry:5;
classDef child fill:#0f172a,stroke:#10b981,color:#94a3b8,rx:5,ry:5;
classDef related fill:#0f172a,stroke:#8b5cf6,stroke-dasharray: 5 5,color:#94a3b8,rx:5,ry:5;
linkStyle default stroke:#4b5563,stroke-width:2px;
🧒 Простыми словами
Представьте, что вы учите ребенка узнавать животных по карточкам. Метрики оценки датасета — это проверка карточек перед уроком. Достаточно ли их? Нет ли такого, что у вас 50 карточек с собаками и только 1 с кошкой (дисбаланс)? Нет ли пустых карточек (пропущенные данные)? Если учебные материалы плохие, ребенок не научится, как бы умен он ни был.
🤓 Expert Deep Dive
Ключевые категории: 1. Качество данных: коэффициент null-значений, кардинальность. 2. Распределение и дрейф (Drift): Дивергенция KL и PSI измеряют разницу между обучающими и реальными данными. Если PSI > 0.2, распределение сильно изменилось. 3. Дисбаланс классов: требует применения алгоритмов оверсэмплинга, таких как SMOTE. 4. Оценка синтетических данных: метрика FID (Fréchet Inception Distance) оценивает, насколько сгенерированные изображения близки к реальному распределению.
❓ Частые вопросы
What is the difference between dataset metrics and model metrics?
Dataset metrics evaluate the raw data before training (e.g., checking for missing values or class imbalance). Model metrics evaluate the AI's performance after training (e.g., checking its accuracy or error rate).
What is 'data leakage' in machine learning?
Data leakage happens when the dataset accidentally includes clues about the answer that won't be available in the real world. For example, predicting if a patient has cancer, but including their 'chemotherapy' medical code in the training data.
How do you measure if a dataset has changed over time?
Data scientists use metrics like KL Divergence or Population Stability Index (PSI) to compare the original training dataset with new, real-world data to see if the statistical distribution has 'drifted'.