Repositório de exemplos e exercícios da disciplina de Ciência de Dados do curso de Bacharelado em Sistemas de Informação do Instituto Federal de Educação, Ciência e Tecnologia de São Paulo (IFSP) — Campus Votuporanga.

Todos os exercícios foram desenvolvidos utilizando a linguagem Python na plataforma Google Colab. As bases de dados utilizadas em cada exemplo estão disponíveis no Google Drive.

Referências

  • AMARAL, F. Introdução a ciência de dados: mineração de dados e Big Data. Rio de Janeiro: Alta Books, 2016.
  • GRUS, J. Data Science do Zero: primeiras Regras com o Python. Rio de Janeiro: Alta Books, 2019.
  • WICKHAM, H. R Para Data Science. Rio de Janeiro: Alta Books, 2019.
  • MCKINNEY, W. Python Para Análise de Dados: tratamento de dados com Pandas, NumPy e Python. São Paulo: Novatec, 2018.

Inteligência Artificial

A Inteligência Artificial (IA), com início formal em 1956, é o estudo de faculdades mentais através de modelos computacionais ou a automação de atividades associadas ao pensamento humano. Suas principais áreas incluem:

  • Aprendizado de Máquina (Machine Learning)
  • Mineração de Dados (Data Mining)
  • Processamento de Linguagem Natural (PLN)
  • Robótica, Visão Computacional e Redes Neurais

Conceitos essenciais: Dado, Informação e Conhecimento

  • Dado: fatos brutos coletados e armazenados (ex.: Bom Clima).
  • Informação: dado analisado com significado (ex.: nome dos moradores do bairro Bom Clima).
  • Conhecimento: informação interpretada e utilizada para um fim (ex.: o dia da semana em que os moradores do bairro mais compram).

A Ciência de Dados é multidisciplinar (Estatística, Matemática, Computação) e estuda o ciclo de vida do dado: produção, armazenamento, transformação, análise e descarte.

Talk is cheap, show me the code: Base utilizada nesta aula (disponível no Google Drive): credit_data.csv

# Minha primeira manipulação de dados
#é necessário importar as bibliotecas TODA vez que for rodar os comandos novamente após a desconexão com o notebook
#pandas é uma biblioteca que trabalha com a importação de arquivos .csv
import pandas as pd
#numpy é uma biblioteca para a realização de operações em arrays
import numpy as np
#seaborn é uma biblioteca para vizualização de gráficos
import seaborn as sb
#biblioteca para gerar gráficos dinâmicos
!pip install plotly --upgrade
#matplotlib é também uma biblioteca para a geração de gráficos
import matplotlib.pyplot as plt
import plotly.express as px

#colocar o arquivo (credit_data.csv) dentro da pasta colab notebooks no DRIVE.
#copiar o caminho do arquivo
#importar um arquivo .csv
base_credito = pd.read_csv("/content/drive/MyDrive/Colab Notebooks/credit_data.csv") #carrega os dados e os colocas na variável base_credito

#base_credito.shape # mostra a quantidade de linhas e colunas
#base_credito.head() #mostra as primeiras linhas da base
base_credito.describe() #mostra a estrutura dos dados de cada coluna
#base_credito.info() #mostra a característica de cada coluna