Cursos e QualificaçõesCursos Livres

10 projetos de Ciência de Dados para iniciantes colocarem no portfólio

Saiba como chamar a atenção dos recrutadores de tecnologia com 10 projetos de Ciência de Dados para iniciantes e turbine seu portfólio



Em resumo:

  • Os principais projetos de Ciência de Dados para iniciantes envolvem clássicos como a análise do Titanic e a precificação de imóveis.
  • Focar em problemas reais de negócios, como previsão de churn (evasão), segmentação de clientes e detecção de fraudes, também atrai a atenção de recrutadores.

Montar um portfólio com projetos práticos de Ciência de Dados deixou de ser apenas uma mera formalidade para se tornar uma exigência entre aqueles que buscam a primeira vaga no mercado de tecnologia.

Ao entrevistar candidatos, os recrutadores e gestores de TI não focam apenas no seu currículo teórico; eles querem ver a sua capacidade real de limpar dados, construir algoritmos e resolver problemas práticos.

Se você já entende a teoria de Python e SQL, o passo definitivo para se destacar nos processos seletivos é colocar a mão na massa. Veja como estruturar um GitHub de peso com 10 projetos.

1. Sobrevivência no Titanic

Este é o rito de passagem de todo cientista de dados e o ponto de partida para o seu portfólio.

O dataset do Titanic, disponível na plataforma Kaggle, traz informações detalhadas sobre os passageiros, como idade, gênero, classe do bilhete e cabine.

Teste vocacional

Qual carreira combina com o seu perfil?

Responda as perguntas e descubra o curso certo e as bolsas ideais para você!

A sua missão é criar, com base nesses dados, um modelo de Classificação binária capaz de prever quem sobreviveria e quem não sobreviveria ao naufrágio.

Você pode realizar essa limpeza básica utilizando a biblioteca Pandas, como no código abaixo:

import pandas as pd

# Criando uma base de dados simulada baseada no Titanic
dados = {'Passageiro': [1, 2, 3], 'Sexo': ['male', 'female', 'female'], 'Idade': [22, None, 38]}
df_titanic = pd.DataFrame(dados)

# Preenchendo as idades vazias com a média e convertendo a coluna de texto para números
df_titanic['Idade'] = df_titanic['Idade'].fillna(df_titanic['Idade'].mean())
df_titanic['Sexo'] = df_titanic['Sexo'].map({'male': 0, 'female': 1})

print(df_titanic)

2. Previsão de churn de clientes (Evasão)

O churn (taxa de cancelamento) é o pesadelo de qualquer empresa que trabalha com modelos de assinatura, como empresas de telecomunicações, academias ou plataformas de streaming.

Mostrar que você sabe prever a evasão de clientes tem um apelo comercial e prova que você entende como os dados impactam o faturamento da empresa.

Neste projeto, você deve utilizar um dataset focado em Customer Churn para treinar um modelo preditivo que identifique qual cliente está propenso a cancelar o serviço no próximo mês.

3. Previsão de preços de imóveis

A Regressão Linear é a base da modelagem preditiva no mercado corporativo, e o projeto “House Prices” desafia o desenvolvedor a estimar o preço de venda de uma casa com base em dezenas de características diferentes.

Recrutadores adoram esse tipo de projeto porque ele simula perfeitamente o motor de precificação usado por gigantes do mercado imobiliário, como o QuintoAndar e o Airbnb.

Para se destacar na execução, o diferencial não é apenas rodar o modelo, mas sim aplicar a Feature Engineering (Engenharia de Recursos). Isso significa que você deverá criar novas variáveis úteis a partir das informações brutas existentes.

4. Segmentação de clientes para marketing

Projetos de segmentação demonstram que você domina o conceito de Machine Learning Não Supervisionado.

Esse tipo de aprendizado ocorre quando não há uma resposta correta pré-definida na base de dados, exigindo que o algoritmo encontre padrões ocultos e similaridades de comportamento por conta própria.

Para executar esse projeto, você deve utilizar um dataset de transações de e-commerce e aplicar o algoritmo K-Means. Você pode utilizar o Scikit-Learn, como no código abaixo:

import pandas as pd
from sklearn.cluster import KMeans

# Criando dados fictícios de 4 clientes (Frequência de compras vs Valor Gasto)
dados_clientes = {'Frequencia': [1, 2, 10, 12], 'Valor_Gasto': [50, 60, 500, 550]}
df_clientes = pd.DataFrame(dados_clientes)

# Treinando o modelo para separar os clientes em 2 grupos distintos (Compram Pouco vs Muito)
modelo = KMeans(n_clusters=2, random_state=42, n_init=10)
df_clientes['Perfil_Identificado'] = modelo.fit_predict(df_clientes[['Frequencia', 'Valor_Gasto']])

print(df_clientes)

5. Detecção de fraude em cartões de crédito

Bancos e fintechs contratam milhares de cientistas de dados anualmente com um único objetivo: mitigar perdas financeiras.

O grande desafio técnico da detecção de fraudes é lidar com dados que são desbalanceados, afinal, em um cenário real, existem milhões de transações legítimas para cada transação fraudulenta registrada no sistema.

Ao executar este projeto utilizando um dataset de fraudes financeiras, você precisará aplicar técnicas de balanceamento de dados na sua base, como o método SMOTE ou o Undersampling.

6. Dashboard Interativo de Análise Exploratória (EDA)

Um cientista de dados não se limita a criar modelos complexos de inteligência artificial; ele também sabe como traduzir e apresentar esses relatórios de forma visual para os diretores da empresa.

Para este projeto, escolha uma base de dados rica e focada em negócios e faça uma Análise Exploratória profunda. O verdadeiro destaque da execução é não deixar o resultado estático no Jupyter Notebook.

Utilize bibliotecas como o Streamlit (direto no Python) ou integre os seus dados limpos no Power BI para construir um painel interativo.

7. Análise de sentimentos em avaliações de produtos

Criar um projeto de análise de sentimentos demonstra que você consegue extrair dados qualitativos (textos) e transformá-los em métricas quantitativas.

A execução envolve extrair milhares de comentários de clientes sobre produtos em grandes e-commerces e, utilizando bibliotecas especializadas, treinar um algoritmo para classificar matematicamente se aquele feedback geral é positivo, negativo ou neutro.

8. Sistema de recomendação de produtos

Seja na Netflix indicando o próximo filme da sua maratona ou na Amazon mostrando a famosa seção “clientes que compraram isso também compraram”, os Sistemas de Recomendação são o verdadeiro motor responsável pelo aumento de receita.

Para replicar essa tecnologia no seu portfólio, você deve utilizar bases de dados abertas focadas em avaliações, como o popular MovieLens.

O seu código deverá ser capaz de criar uma matriz de preferências, calculando a similaridade matemática entre milhares de usuários.

A partir daí, o sistema recomendará um item para um cliente específico baseando-se exclusivamente no padrão de consumo de outras pessoas que demonstraram ter gostos idênticos no passado.

9. Previsão de demanda e séries temporais

Dados baseados em uma linha do tempo contínua possuem um comportamento muito particular, exigindo uma abordagem técnica que vai além da regressão linear.

Neste projeto de Time Series (Séries Temporais), você utilizará bibliotecas específicas para previsões cronológicas, como o Prophet (desenvolvido pela equipe do Facebook) ou modelos estatísticos clássicos como o ARIMA.

A execução envolve carregar o histórico de vendas diárias de uma loja de varejo referente aos últimos dois ou três anos e construir um código capaz de mapear os padrões passados para prever qual será a demanda e o faturamento esperado para os próximos 30 dias.

10. Automação de coleta de dados (Web Scraping)

Muitas vezes, a sua diretoria pedirá análises comparativas sobre os concorrentes, e esses dados estarão espalhados e “presos” na tela de um site de terceiros.

Para coletá-los, precisa criar um script de Web Scraping. Escolha um site real e utilize bibliotecas de raspagem, como BeautifulSoup ou Selenium.

Para fazer isso sem correr riscos, você pode treinar os seus robôs em ambientes criados exclusivamente para testes de desenvolvedores, conhecidos como sandboxes.

Veja como extrair informações com 100% de sucesso utilizando a biblioteca BeautifulSoup em um ambiente seguro, como no código funcional abaixo:

import requests
from bs4 import BeautifulSoup

# Acessando o "toscrape.com", um site real criado apenas para testes de Web Scraping
url = 'http://quotes.toscrape.com/'
resposta = requests.get(url)
sopa = BeautifulSoup(resposta.text, 'html.parser')

# Varrendo o HTML e extraindo as três primeiras citações literárias da página
citacoes = sopa.find_all('span', class_='text')
for citacao in citacoes[:3]:
    print(citacao.text)

Construa sua carreira em tecnologia com formações alinhadas ao mercado

Se você quer ingressar ou crescer no mercado de tecnologia, a Allevo Tech oferece formações práticas em áreas de alta demanda, como Engenharia de Software, Ciência de Dados e Inteligência Artificial.

As trilhas são estruturadas para desenvolver competências técnicas e preparar você para os desafios do mercado de trabalho.

Clique no botão abaixo e conheça as formações da Allevo Tech que podem impulsionar a sua trajetória profissional.

Logo do Querobolsa

Gostando da matéria?

Inscreva-se e receba nossos principais posts no seu e-mail

Banner FOQA Últimas Notícias

Revista Vídeos

As profissões mais bem pagas em 2026

Postado em 31/03/2026

Como estudar pro ENEM 2026 do ZERO

Postado em 23/04/2026


Pronto para estudar pagando menos?

Bolsas de até 80% de desconto em milhares de faculdades por todo o Brasil.
Encontrar minha bolsa