Marcos de Castro
EQUIPE
02/09/2026 • 08:02
Vamos falar um pouco sobre a divisão dos dados em aprendizado de máquina, que é um passo fundamental para garantir que os modelos aprendam bem e possam ser avaliados corretamente. Normalmente, temos três conjuntos: treinamento, validação e teste. O conjunto de treinamento é usado para ensinar o modelo, ou seja, ajustar seus parâmetros. O conjunto de validação serve para ajustar hiperparâmetros e escolher o melhor modelo, fazendo uma avaliação intermediária. Por fim, o conjunto de teste é usado para avaliar o modelo final, geralmente só depois do treinamento e validação, para ver como ele se sai em dados nunca vistos.
Analisando as alternativas:
A opção (a) está incorreta porque o conjunto de teste não é uma porção do conjunto de treinamento; eles devem ser conjuntos separados para garantir a avaliação imparcial do modelo.
A opção (b) erra ao dizer que o conjunto de validação substitui o conjunto de treinamento com undersampling, o que não é prática usual. Undersampling é uma técnica para balancear classes, mas não substitui um conjunto todo.
Já a opção (c) está correta ao afirmar que é comum usar 80% dos dados para treinamento e 20% para validação, embora essa proporção possa variar dependendo da quantidade de dados disponível.
A opção (d) está errada sobre cross-validation, que normalmente divide os dados em K partes (folds), não necessariamente três, e a forma de uso dos folds varia, não é fixo que dois sejam para teste e um para treino.
Por fim, a alternativa (e) é falsa, já que métodos como regressão linear e KNN podem sim utilizar essa divisão dos dados para evitar overfitting e garantir uma boa avaliação.
Portanto, a alternativa correta é a (c).
Analisando as alternativas:
A opção (a) está incorreta porque o conjunto de teste não é uma porção do conjunto de treinamento; eles devem ser conjuntos separados para garantir a avaliação imparcial do modelo.
A opção (b) erra ao dizer que o conjunto de validação substitui o conjunto de treinamento com undersampling, o que não é prática usual. Undersampling é uma técnica para balancear classes, mas não substitui um conjunto todo.
Já a opção (c) está correta ao afirmar que é comum usar 80% dos dados para treinamento e 20% para validação, embora essa proporção possa variar dependendo da quantidade de dados disponível.
A opção (d) está errada sobre cross-validation, que normalmente divide os dados em K partes (folds), não necessariamente três, e a forma de uso dos folds varia, não é fixo que dois sejam para teste e um para treino.
Por fim, a alternativa (e) é falsa, já que métodos como regressão linear e KNN podem sim utilizar essa divisão dos dados para evitar overfitting e garantir uma boa avaliação.
Portanto, a alternativa correta é a (c).