Equipe Gabarite
EQUIPE
29/08/2026 • 15:01
Vamos falar sobre uma etapa fundamental dos projetos de ciência de dados e BI, que é o pré-processamento das informações. O enunciado descreve vários desafios típicos: campos sem preenchimento (valores ausentes), registros com valores muito fora do padrão (os chamados outliers) e padrões diferentes para atributos equivalentes (problemas de padronização ou harmonização).
Vamos analisar alternativa por alternativa:
A alternativa A está errada porque valores ausentes não são, automaticamente, outliers. Outlier é um valor extremo, não a ausência de valor. E remover todas as observações extremas sem considerar o contexto pode eliminar dados importantes, pois nem todo valor extremo é erro.
A alternativa B também está incorreta: padronização serve para uniformizar formatos ou escalas dos dados (como transformar tudo para o mesmo formato de data ou unidade), e não elimina outliers. A detecção de outliers não tem relação direta com preencher campos vazios, mas sim em encontrar valores discrepantes.
A alternativa C vai na linha de simplesmente excluir dados ausentes sem analisar o impacto disso. Isso é perigoso, pois perder muitos registros pode comprometer a análise. Nem sempre excluir é a melhor solução; às vezes é melhor preencher os dados vazios com alguma técnica apropriada.
A alternativa D está correta. A detecção de outliers é justamente o processo para identificar valores que fogem do padrão esperado, e padronização serve para dar uniformidade ao formato dos dados semelhantes.
A alternativa E exagera ao afirmar que qualquer valor ausente é erro e deve ser sempre descartado. Nem sempre ausência de dado é erro e, como dito, nem sempre a exclusão é a melhor estratégia.
Com isso, o gabarito certo é: alternativa D.
Vamos analisar alternativa por alternativa:
A alternativa A está errada porque valores ausentes não são, automaticamente, outliers. Outlier é um valor extremo, não a ausência de valor. E remover todas as observações extremas sem considerar o contexto pode eliminar dados importantes, pois nem todo valor extremo é erro.
A alternativa B também está incorreta: padronização serve para uniformizar formatos ou escalas dos dados (como transformar tudo para o mesmo formato de data ou unidade), e não elimina outliers. A detecção de outliers não tem relação direta com preencher campos vazios, mas sim em encontrar valores discrepantes.
A alternativa C vai na linha de simplesmente excluir dados ausentes sem analisar o impacto disso. Isso é perigoso, pois perder muitos registros pode comprometer a análise. Nem sempre excluir é a melhor solução; às vezes é melhor preencher os dados vazios com alguma técnica apropriada.
A alternativa D está correta. A detecção de outliers é justamente o processo para identificar valores que fogem do padrão esperado, e padronização serve para dar uniformidade ao formato dos dados semelhantes.
A alternativa E exagera ao afirmar que qualquer valor ausente é erro e deve ser sempre descartado. Nem sempre ausência de dado é erro e, como dito, nem sempre a exclusão é a melhor estratégia.
Com isso, o gabarito certo é: alternativa D.