Entrar ou criar conta

ULC Lab · implementação reproduzível

Laboratório: Data Lake Hadoop com ingestão, consulta e governança básica

Você terá um mini Data Lake Hadoop funcional, com ingestão de dados, consulta SQL via Hive e controle de acesso básico via Apache Ranger, em até 3 horas. O laboratório utiliza máquinas virtuais ou equipamentos comuns, simulando um ambiente de produção enxuto.

Data Lakes Open Source do zero à governança
Ligado ao treinamento Data Lakes Open Source do zero à governança
ULC-LAB-DADO-0003 · Status de validaçãoNão validado pela Upnetix: roteiro derivado da documentação oficial, para você executar e validar
Duração estimada
90 min
Passos
12
Validações
4
Versões da documentação consultada
Apache Hadoop 3.3.6 · Apache Hive 3.1.3 · Apache Ranger 2.4.0
Objetivo

Este laboratório ensina a montar um Data Lake open source do zero, usando Apache Hadoop, Hive e Ranger. Você vai entender como os componentes se integram, como proteger dados e como consultar informações de forma estruturada. O foco é mostrar, na prática, os fundamentos de ingestão, processamento, consulta e governança de dados em um ambiente controlado.

Topologia

Três máquinas: uma para o Hadoop NameNode e HiveServer2, outra para DataNode, e uma terceira para Apache Ranger. Todas na mesma rede privada, por exemplo 192.168.56.0/24. O HiveServer2 conecta-se ao Hadoop e expõe consultas SQL. O Ranger gerencia permissões de acesso ao Hive. Usuários simulados acessam o Hive via beeline.

  [Usuário]
      |
  [HiveServer2]---[NameNode]
      |
  [DataNode]
      |
  [Ranger Admin]

192.168.56.10: Hive/NameNode
192.168.56.11: DataNode
192.168.56.12: Ranger

Equipamentos e software

ItemRequisito, licença ou versão
VM Hadoop/Hive2 vCPU, 4GB RAM, 30GB disco, Ubuntu 20.04+
VM DataNode2 vCPU, 2GB RAM, 20GB disco, Ubuntu 20.04+
VM Ranger2 vCPU, 2GB RAM, 20GB disco, Ubuntu 20.04+
Apache HadoopApache 2.0 · 3.3.6
Apache HiveApache 2.0 · 3.1.3
Apache RangerApache 2.0 · 2.4.0

Roteiro

  1. Preparar as VMs e rede

    Crie três VMs Ubuntu 20.04+ na mesma rede privada. Defina IPs fixos: 192.168.56.10 (Hadoop/Hive), 192.168.56.11 (DataNode), 192.168.56.12 (Ranger).

    O que você deve ver: VMs acessíveis via SSH entre si.

  2. Instalar Java JDK

    Instale o OpenJDK 8 em todas as VMs. Hadoop, Hive e Ranger dependem do Java.

    sudo apt update && sudo apt install openjdk-8-jdk -y

    O que você deve ver: java -version retorna OpenJDK 8.

  3. Instalar e configurar Hadoop (NameNode e DataNode)

    Baixe e extraia o Hadoop em ambas as VMs. Configure o NameNode em 192.168.56.10 e o DataNode em 192.168.56.11. Edite core-site.xml, hdfs-site.xml e workers.

    wget https://downloads.apache.org/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
     tar -xzvf hadoop-3.3.6.tar.gz
     # Edite arquivos em hadoop-3.3.6/etc/hadoop/
     # Consulte a documentação para parâmetros mínimos.

    O que você deve ver: hdfs namenode -format executa sem erro. start-dfs.sh sobe NameNode e DataNode.

  4. Validar HDFS

    Verifique se o HDFS está operacional e os nós se comunicam.

    hdfs dfsadmin -report

    O que você deve ver: Relatório mostra 1 NameNode e 1 DataNode ativos.

  5. Instalar Apache Hive

    No NameNode (192.168.56.10), baixe e extraia o Hive. Configure hive-site.xml para apontar para o HDFS. Use Derby como metastore para simplificar.

    wget https://downloads.apache.org/hive/hive-3.1.3/apache-hive-3.1.3-bin.tar.gz
     tar -xzvf apache-hive-3.1.3-bin.tar.gz
     # Edite hive-site.xml conforme documentação.

    O que você deve ver: hive --version retorna versão instalada.

  6. Inicializar o metastore do Hive

    Execute o comando de inicialização do metastore Derby do Hive.

    schematool -dbType derby -initSchema

    O que você deve ver: Mensagem de sucesso da criação do schema.

  7. Subir HiveServer2

    Inicie o HiveServer2 para aceitar conexões SQL.

    hive --service hiveserver2 &

    O que você deve ver: Porta 10000 aberta e processo rodando.

  8. Instalar Apache Ranger

    No Ranger (192.168.56.12), baixe e extraia o Ranger Admin. Configure para usar banco embutido (Derby) e porta padrão 6080.

    wget https://downloads.apache.org/ranger/2.4.0/ranger-2.4.0-admin.tar.gz
     tar -xzvf ranger-2.4.0-admin.tar.gz
     # Edite install.properties conforme documentação.

    O que você deve ver: Acesso à interface web em http://192.168.56.12:6080.

  9. Integrar Hive ao Ranger

    Configure o plugin do Ranger no Hive para controle de acesso. Edite ranger-hive-security.xml e reinicie o HiveServer2.

    # Consulte a documentação para copiar e configurar o plugin.
    # Reinicie HiveServer2.

    O que você deve ver: Políticas criadas no Ranger refletem no acesso ao Hive.

  10. Criar e popular tabela Hive

    Conecte ao Hive via beeline e crie uma tabela simples. Importe um CSV local para o HDFS e carregue na tabela.

    beeline -u jdbc:hive2://localhost:10000
    CREATE TABLE pessoas (id INT, nome STRING);
    LOAD DATA LOCAL INPATH '/tmp/pessoas.csv' INTO TABLE pessoas;

    O que você deve ver: Tabela criada e linhas carregadas.

  11. Consultar dados via Hive

    Execute uma consulta SQL simples na tabela criada.

    SELECT * FROM pessoas;

    O que você deve ver: Linhas do CSV exibidas.

  12. Configurar política de acesso no Ranger

    No Ranger, crie uma política para permitir acesso apenas ao usuário 'analista' na tabela 'pessoas'. Teste acesso com usuário diferente.

    # Use interface web do Ranger para criar política.

    O que você deve ver: Usuário autorizado acessa, não autorizado recebe erro de permissão.

Como saber que funcionou

TesteComandoCritério
Verificar status do HDFShdfs dfsadmin -reportNameNode e DataNode ativos.
Testar conexão Hive via beelinebeeline -u jdbc:hive2://localhost:10000Prompt do beeline aberto.
Consultar dados na tabela HiveSELECT * FROM pessoas;Linhas do CSV exibidas.
Testar política Rangerbeeline -u jdbc:hive2://localhost:10000 -n usuario_nao_autorizadoErro de permissão ao acessar tabela 'pessoas'.

Troubleshooting

SintomaCausa provávelCorreção
HDFS não iniciaPermissões ou configuração incorreta em core-site.xml/hdfs-site.xmlRevise permissões dos diretórios e parâmetros de configuração.
HiveServer2 não conecta ao HDFShive-site.xml aponta para endereço errado do NameNodeCorrija fs.defaultFS para o IP correto.
Ranger não aplica políticasPlugin do Ranger não instalado ou configurado no HiveSiga o guia de instalação do plugin Ranger para Hive.
Usuário não consegue acessar tabela HivePolítica Ranger restritiva ou usuário não listadoAjuste a política no Ranger para incluir o usuário.

Segurança e hardening

  • Altere as senhas padrão do Ranger antes de expor a interface.
  • Restrinja o acesso SSH às VMs apenas a IPs autorizados.
  • Utilize firewall para limitar acesso às portas 8020 (HDFS), 10000 (HiveServer2) e 6080 (Ranger).
  • Evite rodar serviços como root; crie usuários dedicados para Hadoop, Hive e Ranger.

Checklist final

Referências

  1. Documentação oficial do Apache Hadoop · Apache Software Foundation (Hadoop) (hadoop.apache.org)
Verificação editorial
Publicado
09/09/2026
Última revisão
09/09/2026
Versão do conteúdo
1.0
Referências
1 oficiais
Revisão técnica
redação e revisão por IA, URLs conferidas na publicação
Status
Atual
Encontrou um erro? Escreva para comercial@upnetix.com.br com o endereço da página. A revisão semestral por IA nunca altera comandos ou configurações sem passar pela fila de revisão.