Метрики оцінки датасету (Dataset Evaluation Metrics)

Кількісні та якісні показники, що використовуються для оцінки якості, збалансованості, репрезентативності та придатності набору даних для навчання ШІ.

Розвиток Data-Centric AI доводить, що покращення метрик датасету дає кращий приріст продуктивності моделі, ніж нескінченне налаштування гіперпараметрів.

        graph LR
  Center["Метрики оцінки датасету (Dataset Evaluation Metrics)"]:::main
  Rel_decentralized_credit_scoring_algorithms["decentralized-credit-scoring-algorithms"]:::related -.-> Center
  click Rel_decentralized_credit_scoring_algorithms "/terms/decentralized-credit-scoring-algorithms"
  Rel_risk_assessment["risk-assessment"]:::related -.-> Center
  click Rel_risk_assessment "/terms/risk-assessment"
  Rel_digital_certificate_management["digital-certificate-management"]:::related -.-> Center
  click Rel_digital_certificate_management "/terms/digital-certificate-management"
  classDef main fill:#7c3aed,stroke:#8b5cf6,stroke-width:2px,color:white,font-weight:bold,rx:5,ry:5;
  classDef pre fill:#0f172a,stroke:#3b82f6,color:#94a3b8,rx:5,ry:5;
  classDef child fill:#0f172a,stroke:#10b981,color:#94a3b8,rx:5,ry:5;
  classDef related fill:#0f172a,stroke:#8b5cf6,stroke-dasharray: 5 5,color:#94a3b8,rx:5,ry:5;
  linkStyle default stroke:#4b5563,stroke-width:2px;

      

🧒 Простими словами

Уявіть, що ви вчите дитину розпізнавати фрукти за картками. Метрики оцінки датасету — це перевірка карток перед початком уроку. Ви рахуєте їх, щоб впевнитися, що їх достатньо. Ви перевіряєте, чи немає такого, що у вас 50 карток з яблуками і лише 1 з бананом (дисбаланс класів). Ви дивитесь, чи немає порваних або порожніх карток (якість даних). Якщо картки погані, дитина не навчиться, якою б розумною вона не була.

🤓 Expert Deep Dive

Ключові категорії: 1. Якість даних: коефіцієнт null-значень, кардинальність, рівень дублювання. 2. Розподіл та дрейф (Drift): для порівняння тренувальних та реальних даних використовують дивергенцію Кульбака-Лейблера (KL Divergence) та PSI. Якщо PSI > 0.2, розподіл суттєво змінився. 3. Дисбаланс класів: вимірюється через Imbalance Ratio (IR). Сильний дисбаланс вимагає алгоритмів типу SMOTE. 4. Оцінка синтетичних даних: метрика FID (Fréchet Inception Distance) оцінює, наскільки згенеровані зображення відповідають розподілу реальних.

❓ Часті питання

What is the difference between dataset metrics and model metrics?

Dataset metrics evaluate the raw data before training (e.g., checking for missing values or class imbalance). Model metrics evaluate the AI's performance after training (e.g., checking its accuracy or error rate).

What is 'data leakage' in machine learning?

Data leakage happens when the dataset accidentally includes clues about the answer that won't be available in the real world. For example, predicting if a patient has cancer, but including their 'chemotherapy' medical code in the training data.

How do you measure if a dataset has changed over time?

Data scientists use metrics like KL Divergence or Population Stability Index (PSI) to compare the original training dataset with new, real-world data to see if the statistical distribution has 'drifted'.

📚 Джерела