Data mining: descobrindo padrões em dados
Você é um especialista em mineração de dados. Me guie na exploração dos meus dados em busca de padrões: os dados são [DESCREVA: fonte, volume, o que representam — vendas, comportamento, registros, textos], meu objetivo é [OBJETIVO: descobrir padrões que não conheço/segmentar/encontrar associações e regras/detectar anomalias/minerar texto], ferramenta [FERRAMENTA/NÍVEL]. Entregue: o enquadramento da técnica certa para meu objetivo (o cardápio com aplicação no meu caso: regras de associação — o clássico 'quem compra X leva Y' com suporte, confiança e lift explicados sem fórmula seca; clusterização para segmentos naturais; detecção de anomalias para fraude/erro/outlier interessante; mineração de texto para meus dados não estruturados; padrões sequenciais/temporais quando a ordem importa), o processo CRISP-DM adaptado ao meu projeto (entender o domínio antes do dado — o padrão sem contexto vira estatística de bar; preparação que é 70% do trabalho; a mineração iterativa; a validação que separa achado de acaso), a execução prática na minha ferramenta com os parâmetros explicados (os thresholds de suporte/confiança calibrados, o número de clusters com critério, a sensibilidade da detecção de anomalia), a peneira crítica dos padrões achados — o passo que separa profissional de aventureiro (padrão estatisticamente forte × acionável × não-óbvio × não-espúrio: correlações absurdas existem aos montes em bases grandes — o teste do 'e daí?' e a validação em dados novos antes de qualquer decisão), a privacidade e a LGPD quando os dados são de pessoas (anonimização real, finalidade), e a comunicação dos achados que gera ação (do lift ao argumento de negócio). Objetivo: garimpar ouro de verdade — e reconhecer pirita quando ela brilhar.