domingo, 19 de setembro de 2021

PL/SQL Resumo

 O PL/SQL é uma extensão da linguagem padrão SQL para o SGBD da Oracle. É uma linguagem procedural da Oracle que estende a linguagem SQL. Permite que a manipulação de dados seja incluída em unidades de programas.

Todo programa possui variáveis, estruturas de condição, estruturas de repetição, unidades de programas reutilizáveis(funções e procedimentos) comandos para receber e exibir valores. 

Além disso, o PL/SQL possibilita a integração com ferramentas Oracle, portabilidade e o tratamento de exceções.

Assuntos a serem tratados:



Nesse primeiro post vamos falar sobre as estruturas presentes em um programa e variáveis

(bloco anônimo)

DECLARE --(opcional)

–-Variáveis, cursores e exceções definidas pelo usuário

BEGIN --(obrigatório)

–-Instruções SQL

–-Instruções PL/SQL

EXCEPTION --(opcional)

–- Ações a serem executadas quando ocorrerem exceções

END; --(obrigatório)

Blocos nomeados

-- Procedures(Não retornam valor)

PROCEDURE name
IS
BEGIN
 --statements
[EXCEPTION]
END;

--Funções (retornam valor)

FUNCTION name
RETURN datatype
IS
BEGIN
 --statements
 RETURN value;
[EXCEPTION]
END;

Variáveis (PL/SQL, de substituição e de ligação)

/*
Para habilitar a saída no SQL Developer, execute o 
seguinte comando antes de executar o bloco PL/SQL:
SET SERVEROUTPUT ON
2. Utilize um pacote Oracle predefinido e seu procedure no 
bloco anônimo:
– DBMS_OUTPUT.PUT_LINE
*/

set SERVEROUTPUT ON;
--variáveis plsql
DECLARE 
V_NOME VARCHAR2(50):= 'Habbema';
BEGIN 
DBMS_OUTPUT.PUT_LINE(V_NOME); -- pacote e procedure que permite exibir o valor de variáveis
END;

--Variáveis de substituição

DECLARE 
V_NOME VARCHAR2(50):= '&nome';
BEGIN 
DBMS_OUTPUT.PUT_LINE(V_NOME); -- pacote e procedure que permite exibir o valor de variáveis
END;

--variáveis de ligação (BIND)

VARIABLE b_nome VARCHAR(20)
EXEC :b_nome :='TESTE';
BEGIN
  DBMS_OUTPUT.PUT_LINE(:b_nome);
END;

--Declarando  e inicializando variáveis

DECLARE
 v_myName VARCHAR2(20);
BEGIN
 DBMS_OUTPUT.PUT_LINE('My name is: '|| v_myName);
 v_myName := 'John';
 DBMS_OUTPUT.PUT_LINE('My name is: '|| v_myName);
END;

-- referenciando uma variável do tipo bind

VARIABLE b_emp_salary NUMBER
BEGIN
 SELECT salary INTO :b_emp_salary 
 FROM employees WHERE employee_id = 178; 
END;
/
PRINT b_emp_salary
SELECT first_name, last_name
FROM employees
WHERE salary=:b_emp_salary;

-- variáveis compostas
--registro
DECLARE
 TYPE t_rec IS RECORD
 (v_sal number(8),
 v_minsal number(8) default 1000,
 v_hire_date employees.hire_date%type,
 v_rec1 employees%rowtype);
 v_myrec t_rec;
BEGIN
 v_myrec.v_sal := v_myrec.v_minsal + 500;
 v_myrec.v_hire_date := sysdate;
 SELECT * INTO v_myrec.v_rec1
 FROM employees WHERE employee_id = 100; 
 DBMS_OUTPUT.PUT_LINE(v_myrec.v_rec1.last_name ||' '||
 to_char(v_myrec.v_hire_date) ||' '|| to_char(v_myrec.v_sal));
END;


quinta-feira, 19 de agosto de 2021

O Básico de Python

Python é uma linguagem Open-Source de propósito geral usado bastante em data science, machine learning, desenvolvimento de web, desenvolvimento de aplicativos, automação de scripts, fintechs e mais.

A ideia deste post é fazer um resumo, descrevendo a sintaxe da linguagem e suas estruturas (condição, repetição, e dados).


#criação e exibição de conteúdo de variáveis
nome = "Hugo" #tipo string

#printando uma variável
print(nome)
idade = 47 #tipo inteiro
print(idade)

#estrutura de condição
if idade == 48:
  print(idade)
else:
  print("Esse é o texto que vai aparecer")

#elif
media = 6
if media <5:
  print('reprovado')
elif media > 5 and media < 7:
  print('recuperacao')
else:
  print('aprovado')

#Estruturas de repetição
#while
gastos = 0
valor_gasto = 0
while gastos < 10:
  #input serve para capturar valores fornecidos pelo usuário
  #O int é para converter explicitamente o valor da variável.
  valor_gasto = int(input("Digite o valor do novo gasto"))
  gastos = gastos + valor_gasto
print(gastos)

#for
for i in range(110):
    print(i)


#Criação de uma função
def mais_um_ano(idade):
  return idade + 1

#chamando a função
mais_um_ano(idade)

#Estrutura de dados
#listas
lista = ["item1""item2""item3"]
print(lista)

#Como pegar um item de uma lista
print(lista[0]) #primeiro elemento da lista

#pegar o último elemento da lista
print(lista[-1])

#Como iterar sobre a lista
for i in lista:
  print(i)

#dicionários
dados = {"nome":"Hugo","idade":47}

#printando itens do dicionário]
print(dados)

#printando um item do dicionário
print(dados["idade"])

#Iterando na lista

for i in dados:
  print(dados[i])

#tuplas são imutáveis
nome_da_tupla = (123#tupla de inteiros

nome_da_tupla = (1"olá"1.5#tupla heterogênea

print(nome_da_tupla)

Veja que o Python é uma linguagem simples. O que dá poder a ela é são os pacotes/bibliotecas desenvolvidas por terceiros. Vamos falar sobre alguns pacotes em outros Posts.

Inté.

Análise de dados na prática com o Pandas

 Lembra daquele trabalho que a gente fazia para promover a transformação e a higienização de dados no Excel?  Não tínhamos problema em trabalhar dessa forma enquanto o volume de dados era pequeno. Porém na era do Big Data planilhar e analisar os dados no excel virou um problema. O pacote Pandas surgiu para resolver esse problema. 

A biblioteca Pandas nos permite fazer análises exploratórias em conjunto de dados. Ela dá ao Python, a capacidade de trabalhar com dados tipo planilha, permitindo carregar, manipular e combinar dados.

A ideia aqui é apresentar um trabalho prático, de modo a assimilar conhecimento sobre o Pandas, sendo necessário apenas conhecimento básico das estruturas de dados do Python.

1 - Vamos criar um arquivo pandas.csv

2- importar o pacote pandas

#importando a biblioteca pandas
import pandas as pd

3- Carregar o Dataset sob o qual faremos a análise exploratória. No pandas, um dataset é conhecido como Dataframe.

#Carregando o dataset retirando linhas com problema e 
#utilizando como separador ponto e vírgula
df = pd.read_csv("Gapminder.csv",error_bad_lines=False, sep=';')

3- Visualizando os dados
#visualizando as 5 primeiras linhas
df.head(10) # ao passar um valor inteiro, você determina a quantidade
de linhas retornadas


















5- Renomeando colunas

#Renomeando colunas
df.rename(columns=
{"country":"País","continent":"Continente","year":"Ano",
"lifeExp":"Expectativa de vida","pop":"População","gdpPercap":"PIB"})

6- Retornando o número de linhas e colunas
#retornando o número de linhas e colunas
df.shape
(3312, 6)

7- Retornando o nome das colunas

#Retornando o nome das colunas 
df.columns
Index(['country', 'continent', 'year', 'lifeExp', 'pop', 'gdpPercap'], dtype='object')

8- Retornando o nome das colunas
#retornando os tipos de dados das colunas
df.dtypes

country object continent object year int64 lifeExp float64 pop int64 gdpPercap float64 dtype: object

9- Retornando as últimas linhas
#retornando as últimas linhas
df.tail()












10- Retornando dados estatísticos

#Retornando dados estatísticos
df.describe()

















11 - Pegando valores únicos na Coluna (Distinct)
# pegando valores únicos na coluna Continent
df['continent'].unique()

array(['Asia', 'Europe', 'Africa', 'Americas', nan, 'FSU', 'Oceania'], dtype=object)

12 - Filtrando dados (where)
#filtrando dados
Oceania = df.loc[df["continent"] == "Oceania"]
Oceania.head()












13 - Pegando a média de um campo
#média da expectativa de vida
df.groupby("year")["lifeExp"].mean()

14 - Agrupando dados (paises por continente count())
#agrupando dados por continente
df.groupby("continent")["country"].nunique()

15 - Soma e Média dos valores de um campo.

#Soma dos valores de um campo
df["gdpPercap"].sum()

#Média de valores de um campo
df["gdpPercap"].mean()

Neste exemplo, trabalhamos com arquivos .csv, mas é possível também trabalhar com planilhas Excel, dados provenientes de bancos de dados, entre outros.

Até a próxima!

sábado, 7 de agosto de 2021

O que é Engenharia de Dados

         Até pouco tempo atrás, nos deparávamos com um cenário onde os sistemas eram monolíticos, persistindo e consultando informações em bancos de dados relacionais. 

        Os mais avançadinhos criavam bancos de dados dimensionais visando performance e facilidade na busca das informações.

        Com o tempo, esse cenário foi mudando. Com o advento da Internet e Internet das coisas, hoje praticamente tudo gera informação, nem sempre de forma estruturada. O formato varia de acordo com o dispositivo que gera a informação. Exemplo: Câmeras que geram fotos, roteadores que geram logs em formato txt, uma peça de um automóvel que indica ao fabricante a necessidade de reparo, entre outros.

        Daí surge algumas questões: Como e onde guardar esses dados? Como produzir informação com os dados gerados se estes, nem sempre são estruturados e possui diversos formatos. Seria o DBA o responsável por resolver essas questões? É nesse cenário que surge a Engenharia de Dados, visando promover a governança das estruturas que irão receber dados desta natureza.

     Em um outro post falamos de ETL, aonde extraímos dados de bancos relacionais, realizamos transformações e geramos informações de acordo com a necessidade do negócio envolvido, com a finalidade de alimentar um banco de dados dimensional(Um DW estruturado). Mas, quando estamos lidando com dados semiestruturados ou ainda dados não estruturados, a ordem dos fatores se altera. Ocorre outro tipo de processo que é conhecido como ELT. É feita a carga desses dados não estruturados para o que chamamos de Datalake, onde é feita a transformação dos dados.

    Resumindo, um Engenheiro de Dados é o profissional que desenvolve, opera e mantem estruturas de dados complexas e heterogêneas, sendo responsável pela segurança, integridade, disponibilidade e confiabilidade desses dados.


sexta-feira, 4 de junho de 2021

O cinto de utilidades ETL

 Na postagem anterior, ficaram algumas questões a serem respondidas. Para responder a estas questões, vamos criar um cenário hipotético.

A empresa na qual você trabalha demandou a criação de uma base de dados OLAP para subsidiar um Data Warehouse. Essa empresa possui dois Sistemas OLTP para apoiar o trabalho desempenhada por ela: Um sistema de gestão administrativo no qual são mantidos o cadastro dos funcionários entre outros e outro sistema de gestão para gerir vendas efetuadas pela Empresa. Ao demandar a criação da base OLAP, o solicitante indicou aonde obter aos dados que irão compor a base em questão, com a finalidade de analisar as vendas efetuadas pelos funcionários da Empresa. Parte dessas informações encontram-se na base de dados que subsidia o sistema administrativo. Outra parte, pode ser obtida na base de dados do sistema que subsidia o sistema de vendas e ainda há informações constantes em planilhas preenchidas pelos vendedores e por seus gerentes.

Daí você pensa: Vou fazer um select desses dados nas bases de dados indicadas e fazer um insert no banco de dados OLAP. Simples assim! Simples? Como fica a questão das planilhas? E ainda como vincular as informações extraídas desses sistemas e das planilhas mencionadas? Além disso, verificou-se que os dados contidos nessas bases de origem possui formatos distintos, ou seja, não seguem um padrão único. 

Chega a fazer a gente pensar que com a solução do Select/Insert é impossível resolver essa questão. Impossível não é, mas daria um "trabalhão" danado. Ainda mais, se levássemos em consideração a atualização periódica dessa base OLAP.

Complicou, né? E para descomplicar, surgiram no mercado ferramentas que fazem esse trabalho de Extração, Tranformação e carga dos dados.

ETL, vem do inglês Extract Transform Load, ou seja, Extração Transformação Carga. O ETL visa trabalhar com toda a parte de extração de dados de fontes externas, transformação para atender às necessidades de negócios e carga dos dados dentro do Data Warehouse. 

Abaixo, uma ilustração do processo


Vamos descrever as atividades envolvidas nesse processo:

Na extração, é feita a coleta de dados dos sistemas de origem , extraindo-os e transferindo-os para o ambiente de DW, permitindo ao sistema de ETL operar sobre os dados de forma independente.

 Na etapa de transformação, é feita a limpeza, os ajustes e a consolidação dos dados ingeridos. É nesta etapa que realizamos os devidos ajustes, podendo assim melhorar a qualidade dos dados e consolidar dados de duas ou mais fontes. O estágio de transformação aplica uma série de regras ou funções aos dados extraídos para ajustar os dados a serem carregados. Algumas fontes de dados necessitarão de muito pouca manipulação de dados. Em outros casos, pode ser necessários trabalhar algumas transformações, como por exemplo, junção de dados provenientes de diversas fontes, seleção de apenas determinadas colunas e tradução de valores codificados. Por exemplo, se o sistema de origem armazena 1 para sexo masculino e 2 para feminino, mas o data warehouse armazena M para masculino e F para feminino.

A entrega ou Carga dos dados, consiste em fisicamente estruturar e carregar os dados para dentro da camada de apresentação seguindo o modelo dimensional. Dependendo das necessidades da organização, este processo varia amplamente. Alguns data warehouses podem substituir as informações existentes semanalmente, com dados cumulativos e atualizados, ao passo que outro DW (ou até mesmo outras partes do mesmo DW) podem adicionar dados a cada hora. A latência e o alcance de reposição ou acréscimo constituem opções de projeto estratégicas que dependem do tempo disponível e das necessidades de negócios. 

Há ainda a parte de Gerenciamento que é composta por serviços para auxiliar no gerenciamento do DataWarehouse. Aqui existem tasks específicas para gerenciamento de jobs, planos de backup, verificação de itens de segurança e compliance.

A intenção aqui, era fazer um overview sobre o assunto. Existem diversas ferramentas deste tipo no mercado. Cabe a vocês pesquisarem sobre elas:

  • Data Stage da IBM 
  • PowerCenter da Informatica
  • Data Integrator da Oracle
  • SSIS – Sql Server Integration Services da Microsoft

Hoje com o crescimento dos projetos de Big Data aumenta-se mais ainda a necessidade de fazer ETL entre plataformas heterogêneas, para isso, projetos como o Hadoop, possuem ferramentas próprias para carga de dados, como :

SQOOP – Ferramenta para movimentar dados dentre bancos de dados relacionais e o ambiente Hadoop.

HIVE – Ambiente de SQL sobre um cluster Hadoop.

PIG – Ferramenta de Script para transformação e processamento de dados.

SPARK – Framework de processamento em memoria.

É isso!

Modelagem dimensional na prática

 Em outro post, tentei desmistificar o conceito de Data warehouse. Voltando a ler o Post, senti falta de um exemplo prático que mostrasse as vantagens e desvantagens de modelar de forma dimensional uma base de dados para atender a um DW.  A ideia deste post é tentar apresentar uma resposta a estas questões.

Conforme mencionado no outro post, o DW visa resolver questões de performance na execução das consultas.  E como se resolve isso? A forma encontrada foi modelar a base de um jeitão meio diferente, o que ficou conhecido como Modelagem dimensional.

A Modelagem dimensional é uma técnica de design de banco de dados projetada para suportar consultas de usuários finais em um Data Warehouse.  

A ideia é que os usuários consigam fazer consultas sem necessitar da ajuda de profissionais especializados em SQL. 

Em modelos relacionais, é prezada a questão da normalização. Na modelagem dimensional, para melhorar o desempenho das consultas, há redundância planejada dos dados, compensando os gastos com armazenamento e atualização das informações, fazendo com o que a base de dados fique de certo modo desnormalizada.

O modelo dimensional é composto por tabelas fato e por tabelas conhecida como dimensões.

Na prática, a tabela fato armazena as chaves das dimensões e armazena também as métricas a serem analisadas por quem vier a consultar o DW.

Já as tabelas de dimensão são compostas basicamente de atributos que descrevem as entidades envolvidas no modelo. 

Modelando desta forma, o modelo fica parecido com uma "estrela"


Nesse modelo os dados são desnormalisados para evitar joins entre tabelas, diminuindo o tempo de consultas, no entanto devido a repetição de dados, utiliza mais espaço em disco. A vantagem desse modelo é a eficiência na extração de dados, o que é um grande diferencial em se tratando de um datawarehouse.

A chave da tabela fato é uma chave composta, uma vez que trata-se da junção das chaves das tabelas de dimensão.

Importante também é não misturar os fatos. Exemplo: A finalidade é analisar o volume de vendas? Devemos criar uma tabela fato específica para isso. Ao analisar o volume de compras, deve-se criar outra tabela fato com essa finalidade.

Quando a quantidade de atributos das dimensões é muito grande,  costuma-se normalizar as tabelas de dimensão. Neste caso, o modelo fica parecendo um floco de neve (Snow Flake ). Isto porque cada tabela de dimensão seria normalizada, "quebrando-se" a tabela original ao longo de hierarquias existentes em seus atributos. 



A adoção de um modelo ou de outro de implementação trás vantagens e desvantagens em relação a performance das consultas e volume de armazenamento dos dados. Cabe aos analistas decidirem qual será a melhor abordagem.

Cheguei a conclusão de que a melhor maneira de entender a modelagem dimensão é através de exemplos. Abaixo coloquei alguns exemplos de modo a clarear o entendimento deste tipo de modelagem.

Exemplo de um modelo conceitual



Exemplo de modelo para análise de despesas



Exemplo de modelo para análise de produção


A dica aqui é procurar nos pais dos burros (Google) mais modelos de modo a fixar a ideia desse tipo de modelagem.

Como entrevistar os usuários de um DW? Segue um texto legal do Piton nesse link https://rafaelpiton.com.br/blog/data-warehouse-como-modelar/

E aí? O post deu uma clareada? Em caso afirmativo, fico satisfeito. Tem outras questões a serem respondidas. Como importar os dados da origem de dados que comporão as tabelas do DW? Como atualizar esses dados ao longo do tempo? Se os dados que vierem compor o DW provierem de fontes de dados distintos, com formatos diferentes, como unificar o padrão desses dados? A resposta a essas perguntas estará em outro post sobre ETL.


Valeu!!!


domingo, 16 de maio de 2021

Desde os primórdios até os Containers.

 Quando comecei a trabalhar na área de informática(1999/2000) , haviam servidores dedicados para cada serviço disponibilizado (e-mail, ftp, arquivos, aplicações, banco de dados, servidores web entre outros). Há pouco atrás, soube que esses servidores eram conhecidos como BARE METAL. 

Com o aumento da quantidade de servidores, havia-se a necessidade de reduzir a quantidade destes por conta de espaço. Optou-se então pela construção de servidores maiores. Por conta disso, surgiu uma tecnologia capaz de dividir uma máquina grande em diversos servidores. A virtualização é a tecnologia que permite transformar um servidor físico em diversos servidores virtuais. 

Os virtualizadores possibilitam o fatiamento dessas máquinas em diversas máquinas virtuais, isoladas cada uma com seu sistema operacional, disco entre outras coisas. Essa solução é muita usada ainda hoje. Contudo, existem serviços que consomem poucos recursos computacionais, o que leva a um desperdício desses recursos. Exemplo: Vamos imaginar um servidor para rodar um microserviço. Queimaríamos uma licença de sistema operacional, dedicaríamos memória e disco para este serviço. E quem nunca desenvolveu uma aplicação que rodava perfeitamente na sua máquina e ao migrar a aplicação para outro servidor, a aplicação parava de funcionar? Para resolver este problema, eis que surgem os containers.

Um Container nada mais é do que um ambiente isolado contido em um servidor que, diferentemente das máquinas virtuais, divide um único host de controle. Os containers compartilham o mesmo kernel do sistema operacional e isolam os processos da aplicação do restante do sistema.

Na prática, o sistema operacional  e o hypervisor são eliminados e o host entra em contato direto com as bibliotecas. Com essa ligação, os itens ficam portáveis para qualquer outro host que também possua o sistema de virtualização instalado. 

Quem saiu na frente no utilização desse tipo de tecnologia foi uma empresa sediada nos Estados Unidos (São Francisco) chamada Docker.

A Docker criou uma plataforma open source que facilita a criação e administração de ambientes isolados. Ele possibilita o empacotamento de uma aplicação ou ambiente dentro de um container, se tornando portátil para qualquer outro host que contenha o Docker instalado. Então, você consegue criar, implantar, copiar e migrar de um ambiente para outro com maior flexibilidade.

E como é que funciona essa plataforma?  Através de um arquivo conhecido como Dockerfile é descrita uma imagem com todas as dependências necessárias para criação do container. Após bildar esse arquivo é gerada uma imagem que pode ser enviada para um repositório, estilo github, chamado pelo nome de DockerHub. Daí ao executar o container, caso o mesmo já não esteja na máquina de trabalho, o DockerEngine baixa a imagem para essa máquina.

Comandos do Docker

Usar o docker (via CLI) consiste em passar a ele uma opção, comando e argumentos.

docker [option] [comando] [argumento]

Como eu sei quais as imagens disponíveis no meu repositório local?

docker images

Como adicionar imagens locais?

docker search imagem

docker pull imagem

Como remover imagens locais?

docker rmi imagem

Criar um container

docker run imagem

Criar um container e entrar no Terminal

docker run -it imagem

Criar um container com um apelido

docker run --name ubuntinho ubuntu

Verificar o estado ou encontrar o ID de um container

docker ps

Remover um container

docker rm nomecontainer

Criando imagens com o dockerfile

O Dockerfile é um arquivo de texto que contém as instruções necessárias para criar uma nova imagem de contêiner. Essas instruções incluem a identificação de uma imagem existente a ser usada como uma base, comandos a serem executados durante o processo de criação da imagem e um comando que será executado quando novas instâncias da imagem de contêiner forem implantadas.

Para criar um Dockerfile é simples, basta criar um arquivo com o nome Dockerfile.

Para gerar a imagem a partir do Dockerfile, executamos o comando abaixo no mesmo local que o arquivo se encontra:

docker build -t nome_da_imagem .

Para criar o container a partir dessa imagem construída, podemos executar o comando:

docker run nome_da_imagem

Até aqui a gente viu como criar um container, agora vamos imaginar que queremos criar um container com mysql, outro com PHP e ainda um que contenha um serviço de mensageria do tipo RabbitMQ. Fácil né? É só subir container por container. Mas isso prático? Não né! É aí que entra um cara chamado Docker-composer.

O docker-compose é uma ferramenta do Docker que, a partir de diversas especificações, permite subir diversos containeres e relacioná-los através de redes internas.

Exemplo de um arquivo docker-compose(subindo php, mysql e phpmyadmin). Executar: docker-compose up -d


Obviamente, essa é uma introdução ao assunto. Vamos que vamos!