Gere um script Python que utilize o método do Intervalo Interquartil (IQR) para identificar outliers nas seguintes colunas numéricas de um pandas DataFrame `df`: `[[LISTA_DE_COLUNAS_NUMÉRICAS]]`. O script deve: 1. Calcular Q1, Q3 e IQR para cada coluna especificada. 2. Definir os limites superior e inferior (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Criar um novo DataFrame contendo apenas as linhas que possuem valores atípicos em qualquer uma das colunas especificadas. 4. Imprimir o formato do DataFrame original e do DataFrame de outliers.
que recebe uma string e executa as seguintes etapas de limpeza de texto: 1. Converte o texto para minúsculas. 2. Remove toda a pontuação. 3. Remove dígitos numéricos. 4. Remove palavras de parada comuns em inglês. 5. Realiza a lematização (stemming) das palavras restantes usando o Porter Stemmer. A função deve retornar a string limpa. Inclua importações de
Gere código Python para calcular a matriz de correlação de Pearson para as colunas numéricas no meu pandas DataFrame `df`. As colunas são: `[[LISTA_DE_COLUNAS_NUMÉRICAS]]`. Em seguida, faça o seguinte: 1. Crie um mapa de calor da matriz de correlação usando seaborn. Anote os valores no mapa de calor. 2. Identifique e liste todos os pares de variáveis com um coeficiente de correlação maior que 0.7 ou menor que -0.7. 3. Para os 3 pares mais correlacionados, forneça uma hipótese de uma frase sobre por que eles podem estar correlacionados.
. Gere um script Python que crie as seguintes novas features a partir desta coluna: - Ano - Mês - Dia da semana (como número, 0=Segunda-feira) - Dia do ano - Semana do ano - Uma flag binária
Atue como um especialista em AutoML. Tenho um conjunto de dados pré-processado com features `X` e uma variável alvo binária `y`. Gere um script Python completo que treine e avalie três modelos de classificação base diferentes: 1. Regressão Logística 2. Classificador Random Forest 3. Classificador Gradient Boosting (usando LightGBM) Para cada modelo, o script deve: - Usar validação cruzada de 5-folds. - Calcular e imprimir a Média de Acurácia, Precisão, Recall e F1-score. - Armazenar os resultados em um pandas DataFrame para fácil comparação.
para calcular e plotar uma matriz de confusão. O gráfico deve ser claramente rotulado com títulos de eixos ('Rótulo Predito', 'Rótulo Verdadeiro') e os nomes das classes
Usando `y_test` (rótulos verdadeiros) e `y_pred_proba` (probabilidades preditas para a classe positiva do meu classificador), gere um script Python para: 1. Calcular a pontuação AUC (Area Under the Curve). 2. Plotar a curva ROC (Receiver Operating Characteristic). 3. Incluir uma linha diagonal representando um classificador aleatório para comparação. 4. Rotular o gráfico com a pontuação AUC.
Tenho um modelo `RandomForestClassifier` treinado chamado `model`. Minhas features têm os nomes `[[LISTA_DE_NOMES_DE_FEATURES]]`. Gere código Python para extrair as importâncias das features do modelo, combiná-las com seus nomes e criar um gráfico de barras horizontal mostrando as 15 features mais importantes.
Quero verificar se as probabilidades preditas do meu classificador binário estão bem calibradas. Tenho os rótulos verdadeiros `y_test` e as probabilidades preditas `y_pred_proba`. Gere um script Python usando `sklearn.calibration.CalibrationDisplay` para plotar uma curva de calibração para o meu modelo.
Abaixo está um script Python que gera um gráfico. Após o script, descreverei o gráfico. Sua tarefa é escrever uma interpretação concisa, em um parágrafo, deste insight para um público de negócios. Evite jargões técnicos. `[[COLE O SCRIPT PYTHON DO GRÁFICO]]` O gráfico mostra um gráfico de barras onde clientes na categoria de suporte 'Tier 1' têm um gasto médio mensal de $150, enquanto clientes na categoria 'Tier 3' têm um gasto médio de $45. Agora, escreva o resumo de negócios.
34Rascunhar um E-mail Reportando Resultados de Teste A/B
Atue como um analista de dados. Rascunhe um e-mail para a equipe de produto reportando os resultados de um teste A/B para a nova feature "Checkout com Um Clique". Principais descobertas: - Taxa de conversão do grupo de controle: 3.5% - Taxa de conversão do grupo de tratamento (com feature): 4.8% - O resultado é estatisticamente significativo com um valor p de 0.002. - O teste durou 14 dias com 50.000 usuários em cada grupo. Estruture o e-mail com uma linha de assunto clara, um breve resumo do resultado, os números chave e uma recomendação para lançar a feature.
Explique o conceito de "overfitting" em machine learning como você faria para um diretor de vendas. Use uma analogia. Mantenha a explicação abaixo de 150 palavras.
Gere um modelo markdown para um arquivo README de projeto de ciência de dados. O modelo deve incluir as seguintes seções: - Título do Projeto - Problema de Negócio - Fonte de Dados - Metodologia (Limpeza de Dados, EDA, Modelagem) - Resultados - Como Executar o Código (Dependências, Instruções) - Contatos Chave
Gere um trecho de script Python que demonstre como usar MLflow para rastreamento de experimentos. O script deve: 1. Iniciar uma execução do MLflow. 2. Registrar dois parâmetros: `learning_rate` e `n_estimators`. 3. Registrar três métricas: `accuracy`, `precision` e `recall`. 4. Registrar o próprio modelo treinado como um artefato. 5. Finalizar a execução.
43Encadeado: Relatório Completo de EDA a Partir de um CSV
. Primeiro, carregue-o em um pandas DataFrame e execute um perfil completo dos dados. Identifique valores ausentes, tipos de dados e estatísticas básicas para cada coluna. Mostre-me a saída." **Prompt 2 (após a resposta da IA):** "Obrigado. Com base nesse perfil, gere um script Python para lidar com a limpeza dos dados. Impute
. A consulta deve calcular a taxa de retenção de coortes mensais de clientes. A coorte de um cliente é o mês de sua primeira compra. A retenção para um determinado mês é a porcentagem de clientes de uma coorte que fizeram uma compra naquele mês. A saída deve ter três colunas:
Quatro passos, cerca de um minuto. O prompt dá a estrutura; você dá os detalhes.
1
Escolha o prompt
Cada prompt aqui foi escrito para uma tarefa específica — não um modelo genérico do tipo “aja como um especialista”. Passe os olhos pelos títulos e pegue o que corresponde ao seu trabalho.
2
Copie e cole
Clique em Copiar e cole tudo no ChatGPT, Claude, Gemini ou no assistente que você já paga. Nada aqui depende de um único modelo.
3
Preencha os colchetes
Troque cada [Marcador entre colchetes] pelos seus próprios dados antes de enviar. É daí que vem a qualidade: o prompt dá a estrutura, você dá os detalhes.
4
Confira o guia de origem
O link “Origem” sob cada prompt abre o artigo completo: por que o prompt é assim, contra o que foi testado e com quais ferramentas combina.
Perguntas frequentes
As perguntas que aparecem antes de colar um destes prompts em um trabalho de verdade.
Estes prompts de IA são gratuitos?
Sim. Os 50 prompts desta página podem ser copiados e usados com qualquer assistente de IA, incluindo ChatGPT, Claude e Gemini. Basta ter conta em uma dessas ferramentas.
Como uso estes prompts de IA para ciência de dados?
Copie o texto completo com o botão Copiar, cole no seu assistente de IA e troque cada marcador entre colchetes — como [Sua cidade] ou [Nome da empresa] — pelos seus próprios dados antes de enviar.
De onde vêm estes prompts?
Cada prompt vem de um guia testado da Zekai. O link “Origem” sob cada prompt leva ao artigo completo, que explica o raciocínio e como ele foi testado.
Posso editar estes prompts?
Pode e deve. Trate cada um como estrutura de partida: aperte as instruções, acrescente suas restrições e fique com a versão que dá o melhor resultado. Os colchetes marcam o que sempre precisa mudar.
Bibliotecas de prompts para outras profissões
Mesmo formato, outra profissão — começando pelas mais próximas de ciência de dados.