FGV — Auditor de Controle Externo - Área Administrativa - Ciência de Dados — Ciência de dados e tecnologia — 2024

Enunciado

Ao se utilizar bancos de dados reais no treinamento de métodos de aprendizado de máquina é normal se deparar com entradas que possuem um ou mais parâmetros (campos) ausentes. Com relação às estratégias para lidar com dados ausentes, analise as afirmativas a seguir. I. Só é possível realizar imputation quando o atributo (feature) ausente é numérico. II. Ao utilizar o k-nearest neighbors (KNN) para fazer o imputation é uma boa estratégia primeiro fazer a normalização ou padronização dos dados. III. Ao se trabalhar com bancos de dados com poucas amostras (itens), uma estratégia usualmente utilizada para lidar com as amostras) que possuem valores ausentes é a remoção. Está correto o que se afirma em

Alternativas

  1. A)

    I, apenas.

  2. B)

    II, apenas.

  3. C)

    III, apenas.

  4. D)

    I e II apenas.

  5. E)

    I, II e III.

Gabarito e comentário

Resposta correta: B

Gabarito definitivo da FGV: alternativa B. Imputação por vizinhos mais próximos usa distâncias entre registros; sem padronização, variáveis de escala maior podem dominar a distância. A imputação também é possível para atributos categóricos com métodos adequados.

Questões relacionadas