nerdexam
Microsoft

DP-100 · Question #84

You are creating a new experiment in Azure Machine Learning Studio. You have a small dataset that has missing values in many columns. The data does not require the application of predictors for each…

The correct answer is A. Synthetic Minority Oversampling Technique (SMOTE). The question seeks a data cleaning method for a small dataset with missing values in many columns, specifically when complex predictor-based imputation is not required.

Explore data and run experiments

Question

You are creating a new experiment in Azure Machine Learning Studio. You have a small dataset that has missing values in many columns. The data does not require the application of predictors for each column. You plan to use the Clean Missing Data module to handle the missing data. You need to select a data cleaning method. Which method should you use?

Options

  • ASynthetic Minority Oversampling Technique (SMOTE)
  • BReplace using MICE
  • CReplace using; Probabilistic PCA
  • DNormalization

How the community answered

(65 responses)
  • A
    82% (53)
  • B
    6% (4)
  • C
    2% (1)
  • D
    11% (7)

Why each option

The question seeks a data cleaning method for a small dataset with missing values in many columns, specifically when complex predictor-based imputation is not required.

ASynthetic Minority Oversampling Technique (SMOTE)Correct

Synthetic Minority Oversampling Technique (SMOTE) is typically used for class imbalance, but in a small dataset where 'missing values' can be interpreted as an insufficient number of samples, particularly in underrepresented categories, SMOTE can 'clean' the data by generating synthetic samples, making the dataset more robust for training when explicit imputation is avoided.

BReplace using MICE

Replace using MICE (Multiple Imputation by Chained Equations) is an imputation method that relies on predicting missing values based on other columns, which contradicts the requirement of not applying predictors for each column.

CReplace using; Probabilistic PCA

Replace using Probabilistic PCA (Principal Components Analysis) is an imputation method that uses PCA to estimate missing values, also involving predictive modeling for imputation, which goes against the specified constraint of not requiring predictors.

DNormalization

Normalization is a data scaling technique that adjusts numerical feature ranges and does not address the problem of missing data values.

Concept tested: Data cleaning methods for missing values

Source: https://learn.microsoft.com/en-us/azure/machine-learning/v1/algorithm-module-reference/smote

Topics

#Data Cleaning#Missing Data#SMOTE#Azure Machine Learning

Community Discussion

No community discussion yet for this question.

Full DP-100 Practice