Métricas de Avaliação de Dataset (Dataset Evaluation Metrics)
Medidas usadas para avaliar a qualidade, o equilíbrio e a adequação de um conjunto de dados para treinar modelos de Machine Learning.
O movimento 'Data-Centric AI' defende que melhorar as métricas do dataset traz mais resultados do que ajustar os hiperparâmetros do modelo.
graph LR
Center["Métricas de Avaliação de Dataset (Dataset Evaluation Metrics)"]:::main
Rel_decentralized_credit_scoring_algorithms["decentralized-credit-scoring-algorithms"]:::related -.-> Center
click Rel_decentralized_credit_scoring_algorithms "/terms/decentralized-credit-scoring-algorithms"
Rel_risk_assessment["risk-assessment"]:::related -.-> Center
click Rel_risk_assessment "/terms/risk-assessment"
Rel_digital_certificate_management["digital-certificate-management"]:::related -.-> Center
click Rel_digital_certificate_management "/terms/digital-certificate-management"
classDef main fill:#7c3aed,stroke:#8b5cf6,stroke-width:2px,color:white,font-weight:bold,rx:5,ry:5;
classDef pre fill:#0f172a,stroke:#3b82f6,color:#94a3b8,rx:5,ry:5;
classDef child fill:#0f172a,stroke:#10b981,color:#94a3b8,rx:5,ry:5;
classDef related fill:#0f172a,stroke:#8b5cf6,stroke-dasharray: 5 5,color:#94a3b8,rx:5,ry:5;
linkStyle default stroke:#4b5563,stroke-width:2px;
🧒 Explique como se eu tivesse 5 anos
Imagine ensinar um filho a reconhecer frutas usando cartões. Avaliar o dataset é checar os cartões antes da aula. Há 50 maçãs e só 1 banana (desequilíbrio)? Há cartões em branco (dados ausentes)? Se o material for ruim, ele vai aprender errado.
🤓 Expert Deep Dive
Categorias: 1. Qualidade: Taxa de valores nulos, cardinalidade. 2. Drift: Divergência KL e PSI medem o desvio entre dados de treino e de produção. 3. Desequilíbrio: Medido pelo Imbalance Ratio; exige técnicas como SMOTE. 4. Dados Sintéticos: Métricas como Fréchet Inception Distance (FID) avaliam se dados gerados por IA são realistas.
❓ Perguntas frequentes
What is the difference between dataset metrics and model metrics?
Dataset metrics evaluate the raw data before training (e.g., checking for missing values or class imbalance). Model metrics evaluate the AI's performance after training (e.g., checking its accuracy or error rate).
What is 'data leakage' in machine learning?
Data leakage happens when the dataset accidentally includes clues about the answer that won't be available in the real world. For example, predicting if a patient has cancer, but including their 'chemotherapy' medical code in the training data.
How do you measure if a dataset has changed over time?
Data scientists use metrics like KL Divergence or Population Stability Index (PSI) to compare the original training dataset with new, real-world data to see if the statistical distribution has 'drifted'.