👋 Olá, seja Bem-vindo(a) ao meu portifólio!

Esse é o meu portfólio de projetos de dados, onde reúno os trabalhos que fiz em Análise e Ciência de Dados. Aqui você encontra desde a extração de dados até a criação de modelos preditivos e dashboards, sempre partindo de um problema de negócio real.

Foto de perfil de Guilherme Grandim

Sobre Mim (About Me)

Sou Guilherme Grandim, Data Analyst e Data Scientist, com Mestrado pela UNICAMP e MBA em Data Science pela USP. Ao longo da carreira, o método científico moldou a forma como eu olho para um número: sempre levantando hipóteses antes de tirar qualquer conclusão.

Trabalho com Python, SQL e Scikit-Learn, da limpeza dos dados até os modelos preditivos. Os resultados viram dashboards em Power BI, Looker Studio ou Streamlit, mas o ponto de partida é sempre a pergunta de negócio.

Também tenho experiência em projetos ponta a ponta usando Claude Code e agentes de IA no dia a dia da análise.

Ilustração de experiências profissionais

Experiências

Trabalhei por anos com dados no esporte de alto rendimento, em clubes como Corinthians, Cruzeiro e Vasco. Aprendi a lidar com dado incompleto, prazo curto e stakeholders que precisam de resposta rápida e assertiva.

Hoje trabalho em projetos de portfólio com dados reais, construindo soluções de Business Intelligence. O foco é sempre entregar uma análise que realmente oriente uma decisão, traduzindo dado técnico em linguagem acessível e KPIs.

Habilidades (Skills)

Linguagens de Programação

  • Python com foco em análise de dados
  • SQL Language
  • Banco de Dados SQLite
  • R para modelagem estatística
  • Conceitos de ETL

Estatística e Machine Learning

  • Estatística descritiva (localização, dispersão, assimetria, kurtosis, densidade)
  • Algoritmos de Regressão, Classificação, Clusterização
  • Métricas de performance dos algoritmos (RMSE, MAE, MAPE, Confusion Matrix, Precision, Recall, ROC Curve, Lift Curve, Silhouette Score, R2 Score)
  • Scikit-Learn: Pipelines, ColumnTransformer, Preprocessing (StandardScaler, OneHotEncoder), Feature Selection (RFE, SelectFromModel), Model Selection (GridSearchCV, StratifiedKFold, Cross Validation)

Visualização de Dados

  • Matplotlib, Seaborn, Plotly
  • Streamlit
  • Power BI e Looker Studio

Engenharia de Software

  • Git e Github
  • Streamlit Cloud
  • Sqlite3 Database
  • Render (deploy de aplicações Flask/APIs)
  • Flask (API REST para modelos de ML)
  • Docker e Amazon ECR (containerização de modelos)
  • AWS: Lambda, ECS Fargate, Athena e EventBridge

Inteligência Artificial Generativa (GenAI)

  • Claude Code como co-analista e agente autônomo de análise de dados
  • Integração com MCPs (Model Context Protocol) para automação de workflows
  • Prompt Engineering aplicado a pipelines de dados e geração de código
  • Workflows agênticos com Hooks e Subagentes
  • Uso de LLMs para apoio à tomada de decisão analítica e documentação técnica
Previsão de vendas Rossmann Store Sales

Previsão de Vendas para Rede de Farmácias com XGBoost e Bot no Telegram

Neste projeto, desenvolvi um modelo de machine learning para prever o faturamento das próximas 6 semanas de cada uma das 1.115 lojas da rede Rossmann. O problema foi trazido pelo CFO da empresa, que precisava substituir estimativas manuais e inconsistentes dos gerentes por uma base estatística confiável para planejar um orçamento centralizado de reformas. Seguindo a metodologia CRISP-DS em 10 ciclos, o pipeline contemplou feature engineering com derivação de variáveis temporais e de competição, EDA com validação de 12 hipóteses de negócio, preparação com encoding cíclico (sin/cos), RobustScaler e Boruta para seleção de features. O XGBoost foi escolhido sobre o Random Forest por apresentar menor variância no cross-validation temporal e modelo serializado ~10x menor, crítico para a API com timeout restrito. O modelo final atingiu MAPE de ~13% e a previsão consolidada da rede ficou entre R$ 283,5 MM e R$ 285,2 MM para as 6 semanas. A solução foi colocada em produção com uma API Flask no Heroku e um bot no Telegram que permite ao CFO consultar a previsão de qualquer loja em segundos, digitando apenas o número da unidade.

As Ferramentas utilizadas no Projeto foram:

  • Python (pandas, numpy, scikit-learn, XGBoost, Flask)
  • Boruta (seleção de features)
  • Jupyter Lab
  • Heroku (deploy da API e do bot)
  • Telegram Bot API
  • Git e Github
Classificador de Síndrome Respiratória Aguda Grave (SRAG/COVID-19)

Classificador de SRAG/COVID-19 com XGBoost e Deploy Serverless na AWS

Neste projeto, desenvolvi um classificador multiclasse para Síndrome Respiratória Aguda Grave a partir dos dados epidemiológicos do SIVEP-Gripe (DATASUS), com engenharia de features de faixa etária, score de comorbidades, macrorregião, sazonalidade via seno/cosseno da semana epidemiológica e score vacinal. O modelo XGBoost, treinado com early stopping e pesos balanceados por classe, atingiu 68% de acurácia e F1-score ponderado de 0,67 no conjunto de teste. Diante da indisponibilidade de cota para endpoints do SageMaker, containerizei o modelo serializado em uma imagem Docker publicada no ECR e servida via AWS Lambda, consumida por um frontend em Streamlit publicado no ECS Fargate. Para manter o custo de infraestrutura próximo de zero, a arquitetura opera em modo scale-to-zero: o serviço ECS permanece com desiredCount=0 por padrão e é desligado automaticamente após 2 horas de uso via EventBridge. Também documentei uma limitação crítica do modelo: a feature mais preditiva, delta_uti, não possui documentação oficial no DATASUS, recomendando validação com os criadores do pipeline original antes de qualquer uso clínico.

As Ferramentas utilizadas no Projeto foram:

  • Python 3.11 (pandas, scikit-learn, XGBoost)
  • Streamlit
  • AWS Lambda (Docker e Amazon ECR)
  • Amazon ECS Fargate
  • Amazon Athena
  • AWS EventBridge
  • Git e Github
Dashboard de vendas para empresa de videogame

Painel Estratégico de Negócios para Companhia de Videogame utilizando Streamlit

Neste projeto, usei Python e Streamlit para construir um dashboard de inteligência de mercado para a BrasCo Gaming Ltd., focado em KPIs de eficiência de capital no setor de games. A análise mostrou que 37% do market share está concentrado na América do Norte e que parcerias com a Microsoft têm o melhor retorno sobre investimento ($0.32M por ponto). Também identifiquei uma janela de oportunidade no 3º ano de vida dos consoles, útil para orientar o lançamento de novos títulos com menos risco.

As Ferramentas utilizadas no Projeto foram:

  • Python
  • Jupyter Lab
  • Terminal
  • Streamlit e Streamlit Cloud
  • Git e Github
Análise de compras públicas de componentes elétricos

Previsão de Gastos em Compras Públicas de Componentes Elétricos com XGBoost e Naive Bayes

Neste projeto, construí um pipeline via API do ComprasNet para consolidar 164.680 registros de contratações públicas de componentes e condutores elétricos (CATMAT 59 e 61, entre 2021 e 2026) em um schema estrela no SQLite, atendendo a uma demanda da área de Suprimentos de uma distribuidora de energia que precisava negociar melhor com fornecedores e projetar o gasto do próximo exercício fiscal. A EDA testou 4 hipóteses estatísticas sobre elasticidade de preço, sazonalidade e concentração de fornecedores, e para a projeção trimestral do gasto comparei três modelos: naive sazonal, XGBoost e Naive Bayes. A segmentação de itens por elasticidade apontou uma economia potencial de R$492 milhões (≈31% do gasto total); a sazonalidade de janeiro e fevereiro se mostrou orçamentária, não de mercado; e as compras irregulares apresentaram maior dependência de fornecedor único (ρ=-0,458). Para 2027, a projeção de gasto ficou em ≈R$368,4 milhões, com o modelo naive sazonal superando o XGBoost (MAPE de 17,6% contra 20,0%).

As Ferramentas utilizadas no Projeto foram:

  • Python (pandas, XGBoost, scikit-learn)
  • API do ComprasNet
  • SQLite (schema estrela)
  • Streamlit
  • Git e Github
Dashboard analítico para rede de cafeterias

Análise de Vendas e Alavancas Utilizando Claude Code

Neste projeto, desenvolvi um dashboard analítico para uma rede de cafeterias com 3 unidades, utilizando Python (pandas), HTML estático com TailwindCSS e Claude Code como co-analista em modo exploratório e agente. Estruturei 10 hipóteses de negócio priorizadas por alavanca de impacto financeiro. A principal descoberta foi que o crescimento de +103,8% de receita no semestre (R$81k → R$166k/mês) foi inteiramente volumétrico com o ticket médio em R$4,69 por 6 meses consecutivos, indicando que a rede dobrou sem explorar nenhuma ação de precificação. As três alavancas de receita imediata identificadas foram: Coffee Beans com ticket 5 vezes maior que o café convencional e penetração irrisória no mix, correlação de r=0,74 entre personalização de sabores e ticket mais alto e concentração de 36,7% da receita diária na janela das 8h-10h, onde cada hora de gargalo operacional representa aproximadamente 12% da receita do dia.

As Ferramentas utilizadas no Projeto foram:

  • Python
  • Claude Code Terminal
  • HTML e TailwindCSS
  • Git e Github
Dashboard estratégico de entregas para a Curry Company

Dashboard de Visão Estratégica de Entregas com Random Forest

Neste projeto, desenvolvi um dashboard estratégico para a Curry Company, dando à diretoria uma visão em tempo real das três frentes da operação: empresa, entregadores e restaurantes. O pipeline envolveu limpeza e transformação dos dados brutos com Pandas, incluindo análises de geolocalização e eficiência das entregas, consolidadas em um painel interativo no Streamlit com visões segmentadas por pilar do negócio. Para entender o que mais impacta o tempo de entrega, comparei um Random Forest com uma regressão linear, e o modelo de árvores teve desempenho bem superior (R²=0,652 contra 0,428). O SLA de entrega ficou em 69,4% sobre 41.419 pedidos, com meta de até 30 minutos, e o Random Forest apontou as entregas simultâneas como o principal driver do atraso, respondendo por 20,5% da importância entre as variáveis analisadas.

As Ferramentas utilizadas no Projeto foram:

  • Python (pandas, scikit-learn)
  • Streamlit
  • Git e Github
Painel de ensaio de algoritmos de Machine Learning

Ensaio de Machine Learning

Nesse projeto, foram explorados os principais conceitos do treinamento, ajuste de parâmetros e limiares entre underfitting e overfitting de vários algoritmos de Machine Learning dentro das tarefas de classificação, regressão e agrupamento através de um ensaio de Machine Learning. O resultado final desse projeto foi um painel mostrando a performance desses algoritmos de Machine Learning, a partir das variações dos valores dos principais parâmetros de cada algoritmo, que controlam o estado de overfitting e underfitting.

As Ferramentas utilizadas no Projeto foram:

  • Python e Scikit-learn
  • Algoritmos de Classificação: KNN, Decision Tree, Random Forest e Logistic Regression
  • Algoritmos de Regressão: Linear Regression (Lasso, Ridge, ElasticNet), Polynomial (Lasso, Ridge, ElasticNet), Decision Tree, Random Forest, XGBoost, LightGBM
  • Algoritmos de Agrupamento: K-Means e Affinity Propagation
  • Métricas de Performance: Accuracy, Precision, Recall e F1-Score, R², MSE, RMSE, MAE, MAPE e Silhouette Score

Contato

Sinta-se à vontade para entrar em contato e muito obrigado pela visita. Fico a disposição para qualquer dúvida ou sugestão