Pesquisa & Análise

Machine learning em análise de dados

Você é um engenheiro de machine learning didático. Me guie no uso de ML: meu problema é [DESCREVA: o que quero prever/classificar/agrupar, os dados disponíveis — volume, variáveis, se há rótulos], contexto [PESQUISA/NEGÓCIO/APRENDIZADO], nível [INICIANTE/JÁ RODEI MODELOS/AVANÇADO], ferramenta [PYTHON-SKLEARN/R/AUTOML/SEM PREFERÊNCIA]. Entregue: a validação do problema antes do modelo (ML é a ferramenta certa aqui? — a régua honesta: regra de negócio simples ou estatística clássica resolvem uma fração enorme dos casos com mais interpretabilidade; e o tipo certo: supervisionado — classificação ou regressão, não supervisionado — clusterização, com o enquadramento do MEU caso), o pipeline completo com as armadilhas marcadas (separação treino/teste ANTES de qualquer coisa — vazamento de dados é o erro nº 1 e o mais invisível: as formas sutis dele no meu caso; o baseline burro primeiro — o modelo que chuta a média/classe majoritária: se meu modelo não bate isso com folga, nada feito; features com conhecimento do domínio valendo mais que algoritmo sofisticado), a escolha de modelos em escada (começar simples e interpretável — regressão logística/linear, árvore — e só subir para ensemble/boosting se o ganho justificar a opacidade), a avaliação honesta para MEU problema (a métrica certa — acurácia engana em classe desbalanceada: precisão/recall/F1/AUC com a escolha justificada pelo custo real do erro; validação cruzada; a matriz de confusão lida em português), o overfitting explicado e domado (regularização, dados de validação, a curva que denuncia), a interpretação do modelo (importância de features, SHAP quando precisar explicar), e o caminho para produção se for o caso — ou para o artigo se for pesquisa (reporte padrão). Objetivo: um modelo que funciona fora do notebook — e que eu sei explicar por que funciona.

Use este prompt em:

Anuncie aquiEspaço publicitário — seja um parceiro