Logo Passei Direto
Buscar
Material

Prévia do material em texto

E-Book - Printed Handout Fundamentos e Arquitetura de Engenharia de Dados E-Book - Printed Handout This file is a static version. For a better experience, access this content through interactive media.E-Book Printed Handout Introdução Seja bem-vindo à sua primeira unidade! Nesta etapa inicial, vamos começar a construir os alicerces que sustentam todo o universo dos dados. Antes de mergulhar em ferramentas e tecnologias avançadas, é fundamental compreender o papel estratégico que a engenharia de dados exerce dentro das organizações modernas e por que ela se tornou uma das áreas mais promissoras e indispensáveis do cenário tecnológico atual. Vivemos em uma era em que o volume de informações cresce de forma exponencial e transformar essa imensidão de dados em conhecimento útil depende da atuação de profissionais capazes de projetar, manter e otimizar as estruturas que sustentam esse fluxo. engenheiro de dados é exatamente esse profissional: o responsável por criar os sistemas que permitem que os dados circulem com segurança, qualidade e eficiência, servindo de base para análises, decisões estratégicas e inovações. Ao longo desta unidade, você compreenderá como a Engenharia de Dados se posiciona dentro do ecossistema de dados, quais são suas principais funções, os diferentes perfis existentes na área e de que forma essa disciplina se conecta com a ciência e a análise de dados. Este é o ponto de partida para entender como dado, tratado com técnica e propósito, se transforma em um dos ativos mais valiosos da era digital. Papel do Engenheiro de Dados no Ecossistema de Dados Moderno No cenário tecnológico contemporâneo, impulsionado por um volume de dados sem precedentes e pela crescente complexidade das operações digitais, a engenharia de dados consolidou-se como uma disciplina fundamental e estratégica. Se em décadas passadas o foco principal estava na simples coleta, armazenamento e recuperação básica de informações, hoje a demanda se sofisticou, exigindo a construção de sistemas robustos, escaláveis, eficientes e intrinsecamente seguros para processar, transformar e disponibilizar informações de maneira confiável e em tempo hábil. Nesse contexto dinâmico e exigente, o Engenheiro de Dados emerge não apenas como um técnico, mas como uma "peça-chave para sucesso das organizações" (Lucchesi, 2024), desempenhando um "papel vital no mundo moderno", atuando como o elo essencial entre as fontes brutas de dados e a geração de insights estratégicos para a tomada de decisões. A rápida e exponencial expansão da área na última década (Serra, 2024) reflete diretamente a crescente e inadiável demanda por profissionais altamente qualificados e versáteis, capazes de lidar com os desafios multifacetados impostos pelo big data, pela análise avançada de dados (analytics) e pela inteligência artificial.E-Book Printed Handout engenheiro de dados, portanto, transcende a função de um mero construtor de infraestrutura; ele é o arquiteto visionário e o diligente mantenedor das fundações de dados sobre as quais todas as outras iniciativas e inovações baseadas em dados são edificadas. Isso inclui desde a análise de negócios, que subsidia a estratégia empresarial, até o desenvolvimento e a implementação de sofisticados modelos de inteligência artificial e aprendizado de máquina, que impulsionam a inovação e a competitividade. Eles são responsáveis por projetar, construir e otimizar os pipelines de dados, garantir a qualidade e a integridade das informações, e assegurar que os dados estejam acessíveis e prontos para serem consumidos por cientistas de dados, analistas e sistemas automatizados, permitindo que as empresas extraiam valor máximo de seus ativos informacionais. Atribuições Centrais no Ciclo de Vida dos Dados A principal responsabilidade do engenheiro de dados é "criar e manter infraestruturas que permitem o armazenamento, processamento e análise de grandes volumes de dados" (Lucchesi, 2025). Essa atuação abrange múltiplas fases do ciclo de vida dos dados, garantindo que a informação flua de sua origem até seu destino de forma íntegra, segura e otimizada. As atividades desse profissional podem ser segmentadas de acordo com as etapas do fluxo de dados, conforme ilustrado no quadro abaixo, que se baseia nas funções essenciais da engenharia de dados. Quadro 1 Fases de Atuação do Engenheiro de Dados no Ciclo de Vida dos DadosE-Book Printed Handout Atividades Principais do Fase do Ciclo Objetivo Estratégico Engenheiro de Dados Desenvolver e gerenciar conectores para fontes de dados diversas (bancos de Garantir a captura de dados brutos Coleta dados, APIs, logs, streams) e de forma confiável e escalável. implementar processos de ingestão. Projetar e implementar soluções de armazenamento Assegurar que os dados estejam (Data Lakes, Data Warehouses, armazenados de maneira segura, Mover / Armazenar Lakehouses) e construir organizada e acessível para pipelines para movimentar processamento futuro. dados entre sistemas. Construir e otimizar processos de ETL (Extração, Converter dados brutos em um Transformação e Carga) e ELT formato estruturado e de alta Explorar / Transformar para limpar, enriquecer, qualidade, pronto para análise e padronizar e modelar os dados consumo. brutos. Desenvolver processos que Disponibilizar visões consolidadas agregam dados em diferentes dos dados que respondam a níveis de granularidade e os Agregar / Categorizar perguntas de negócio específicas e categorizam para criar alimentem dashboards e datasets analíticos e modelos relatórios. de dados otimizados. Fonte: (Adaptado de Reis; Housley, 2023). Essas fases demonstram que o trabalho do engenheiro de dados é a base que possibilita atividades mais avançadas, como a aplicação de algoritmos de deep learning e a realização de testes A/B, que dependem de dados bem estruturados e acessíveis (Reis; Housley, 2023). A Natureza Multifacetada do Trabalho em Engenharia de DadosE-Book Printed Handout A engenharia de dados, embora inegavelmente estratégica e com um impacto profundo na capacidade analítica e decisória das organizações, é uma disciplina que frequentemente se manifesta através de uma abordagem pragmática, iterativa e, por vezes, repetitiva. A observação de que "a engenharia de dados muitas vezes parece uma forma de resolver os mesmos problemas repetidamente" (Konieczny, 2025) ressoa profundamente com a realidade do dia a dia de muitos profissionais da área. Esta percepção, longe de ser uma crítica, sublinha a importância crítica de estabelecer padrões robustos, adotar boas práticas de desenvolvimento e projetar arquiteturas escaláveis. objetivo primordial é garantir a manutenibilidade, a confiabilidade e a eficiência das soluções de dados desenvolvidas. verdadeiro desafio para engenheiro de dados não reside apenas em solucionar um problema pontual ou em atender a uma demanda específica, mas sim em construir sistemas inteligentes e resilientes que consigam resolver esses problemas de forma automatizada, garantindo a qualidade e a disponibilidade dos dados ao longo do tempo. Contudo, é crucial reconhecer que o título "Engenheiro de Dados" funciona como um guarda-chuva para uma gama diversificada de perfis e especializações, o que, lamentavelmente, pode gerar confusão e desalinhamento de expectativas em diversas organizações. Como astutamente aponta Anunciação (2024), "há dois tipos diferentes de engenharia de dados. Há dois tipos diferentes de trabalho com o título de engenheiro de dados". Essa dualidade não é meramente uma nuance semântica; ela reflete diferenças substanciais nas responsabilidades, nas habilidades exigidas e nas trilhas de carreira. Essa distinção fundamental pode se manifestar, por exemplo, na separação entre os seguintes perfis: 1. Engenheiro de Dados com Foco em Pipelines/ETL (Extração, Transformação e Carga): este profissional é o arquiteto e construtor dos fluxos de dados que alimentam os sistemas analíticos e operacionais de uma empresa. Sua expertise reside na construção, orquestração e otimização de pipelines de dados robustos. As principais responsabilidades incluem: 1. Extração de Dados: conectar-se a diversas fontes de dados (bancos de dados relacionais, NoSQL, APIs, arquivos, sistemas legados, etc.) e extrair informações de forma eficiente e segura. 2. Transformação de Dados: limpar, enriquecer, normalizar e agregar dados brutos, transformando-os em um formato adequado para análise e modelagem. Isso frequentemente envolve uso de ferramentas ETL/ELT (como Apache Airflow, dbt, Apache Nifi, ou ferramentas baseadas em nuvem como Dataflow, Glue, Synapse Analytics). 3. Carga de Dados: carregar os dados transformados em data warehouses, data lakes, bancos de dados analíticos ou outras 5 - 32E-Book Printed Handout plataformas de armazenamento que servirão de base para analistas, cientistas de dados e aplicações de negócio. 4. Modelagem de Dados: projetar esquemas de banco de dados e modelos de dados otimizados para consultas analíticas e para o consumo por outras equipes. 5. Monitoramento e Otimização: assegurar a qualidade, a performance e a confiabilidade dos pipelines, implementando rotinas de monitoramento, tratamento de erros e otimização contínua. 6. Colaboração: trabalhar em estreita colaboração com analistas de dados, cientistas de dados e equipes de negócios para entender as necessidades de dados e entregar soluções que atendam aos requisitos. 1. Engenheiro de Dados com Foco em Plataforma/Infraestrutura: este perfil se inclina mais para o lado da engenharia de software e infraestrutura, sendo responsável por construir e manter os alicerces tecnológicos sobre os quais os pipelines de dados operam. Seu foco está na arquitetura, escalabilidade e performance do ambiente de dados como um todo. As responsabilidades típicas englobam: Arquitetura de Sistemas de Dados: projetar e implementar arquiteturas de dados escaláveis e resilientes, que possam lidar com grandes volumes e alta velocidade de dados (Big Data). Gerenciamento de Clusters: administrar e otimizar plataformas distribuídas como Apache Spark, Apache Hadoop, Apache Kafka, ou ambientes de contêineres como Kubernetes, garantindo sua alta disponibilidade e performance. Otimização de Performance de Bancos de Dados: especializar-se na configuração e ajuste fino de bancos de dados (relacionais e NoSQL), data warehouses (como Snowflake, BigQuery, Redshift) e data lakes, visando maximizar a velocidade de consulta e a eficiência de armazenamento. Infraestrutura como Código (laC): implementar e gerenciar a infraestrutura de dados utilizando ferramentas de laC (como Terraform, CloudFormation), promovendo a automação e a reprodutibilidade dos ambientes. Segurança e Governança de Dados: implementar políticas de segurança, controle de acesso e governança de dados em toda a plataforma, garantindo a conformidade e a proteção das informações. Desenvolvimento de Ferramentas Internas: criar e manter ferramentas, bibliotecas e frameworks internos que simplifiquem o trabalho dos engenheiros de dados focados em pipelines. Pesquisa e Avaliação Tecnológica: avaliar novas tecnologias e soluções de dados para integrar na plataforma, buscando inovação e melhoria contínua. 6 - 32E-Book Printed Handout Essa distinção é absolutamente fundamental para que as organizações possam definir corretamente as expectativas ao contratar engenheiros de dados, elaborando descrições de cargo precisas e alinhadas às suas necessidades específicas. Da mesma forma, para os profissionais em formação ou em transição de carreira, compreender essas diferentes trilhas é essencial para direcionar seus estudos, desenvolver as habilidades mais relevantes para seus interesses e objetivos, e, em última análise, navegar com sucesso dentro desta vasta, dinâmica e crucial disciplina da engenharia de dados. Ignorar essa dualidade pode levar a desalinhamentos, frustrações e, em última instância, a falhas na entrega de valor a partir dos dados. Engenheiro de Dados como Habilitador Fundamental engenheiro de dados é profissional que constrói e pavimenta as "estradas" por onde os dados trafegam. Sem seu trabalho, os cientistas de dados não teriam matéria-prima confiável para seus modelos, os analistas de negócios não teriam acesso a informações consolidadas e as lideranças não poderiam tomar decisões baseadas em evidências. Ele é, portanto, habilitador silencioso, mas indispensável, da economia orientada a dados. papel do engenheiro de dados é multifacetado e central para o ecossistema de dados moderno. Ele combina habilidades de engenharia de software, arquitetura de sistemas e conhecimento de domínio para transformar o potencial latente dos dados brutos em valor tangível para as organizações. Diferenças e sinergias A distinção entre engenharia de dados, ciência de dados e análise de dados é crucial para a formação de equipes coesas e a execução de projetos bem-sucedidos. Embora comumente empregados de forma intercambiável, esses termos representam domínios distintos, cada qual com seu foco específico, conjunto de habilidades e metas, ainda que intrinsecamente conectados. A confusão é compreensível, em parte, pela própria ambiguidade do mercado, onde "há dois tipos diferentes de trabalho com o título de engenheiro de dados", conforme observado por Anunciação (2024), o que pode desorientar tanto organizações quanto profissionais em início de carreira. Para se compreender a sinergia entre essas disciplinas, é fundamental, antes de tudo, delimitar o escopo e as responsabilidades de cada uma. Engenharia de Dados 7 - 32E-Book Printed Handout A engenharia de dados constitui a base sobre a qual todas as demais atividades relacionadas a dados são edificadas. Seu "papel vital" (Rodrigues, 2024) manifesta-se na concepção, construção e manutenção da infraestrutura e das arquiteturas de dados. engenheiro de dados é o arquiteto e construtor dos sistemas que permitem o fluxo e o processamento de informações, sendo responsável por "criar e manter infraestruturas que permitem o armazenamento, processamento e análise de grandes volumes de dados" (Lucchesi, 2025). Em essência, esta disciplina assegura que os dados estejam disponíveis, sejam confiáveis e acessíveis para os demais profissionais da área. ciclo de vida dos dados, conforme ilustrado por Reis e Housley (2023), inicia-se com etapas que são primordialmente domínio da engenharia de dados: Coletar, Mover / Armazenar e uma parcela significativa de Explorar / Transformar. engenheiro de dados projeta e implementa os pipelines de ETL (Extract, Transform, Load) ou ELT (Extract, Load, Transform), gerencia os diversos tipos de armazenamentos (bancos de dados relacionais e não relacionais, data warehouses, data lakes), e garante a qualidade e a governança dos dados brutos, transformando-os em um recurso valioso e utilizável. Trata-se de uma disciplina que, como pontua Konieczny (2025), busca sistematizar a solução de problemas recorrentes na manipulação de dados em larga escala, otimizando o processo e assegurando a integridade e a escalabilidade. Análise de Dados A análise de dados focaliza-se no exame minucioso dos dados já processados e armazenados pela engenharia de dados para extrair insights acionáveis. analista de dados atua como um investigador, buscando responder a perguntas sobre o que ocorreu no passado e as razões subjacentes a esses eventos. Suas atividades se concentram nas fases de Explorar / Transformar e Agregar / Categorizar (Reis; Housley, 2023). Utilizando uma gama de ferramentas, que vão desde plataformas de Business Intelligence (BI) e linguagens como SQL até técnicas de estatística descritiva, os analistas constroem relatórios detalhados, dashboards interativos e visualizações gráficas que comunicam tendências, padrões e métricas de desempenho essenciais para as diversas áreas de negócio. cerne do trabalho do analista reside no presente e no passado, com o objetivo primordial de embasar a tomada de decisões estratégicas com base em evidências históricas e dados concretos. Ciência de Dados 8 - 32E-Book Printed Handout A ciência de dados transcende a análise descritiva, projetando-se para futuro. cientista de dados utiliza os dados preparados e validados para desenvolver modelos preditivos e prescritivos. Seu trabalho está intrinsecamente alinhado com as fases de Aprender / Otimizar do ciclo de vida dos dados, empregando metodologias e tecnologias avançadas como "IA, Deep Learning, [...] Experimentação, [e] Algoritmos" (Reis; Housley, 2023). As indagações centrais que um cientista de dados busca responder são: que é provável que aconteça a seguir?" e "Qual a melhor ação a ser tomada para otimizar um determinado resultado?". Eles aplicam técnicas sofisticadas de estatística, machine learning (aprendizado de máquina) e otimização para desvendar padrões complexos, prever comportamentos futuros e, muitas vezes, criar novos produtos ou funcionalidades que são intrinsecamente orientadas por dados, impulsionando a inovação e a vantagem competitiva. Quadro 2 Quadro Comparativo das Disciplinas de Dados Critério Engenharia de Dados Análise de Dados Ciência de Dados Construir e manter Utilizar dados para Extrair e comunicar sistemas robustos e prever resultados futuros insights de dados escaláveis para coleta, e prescrever ações por Objetivo Principal existentes para armazenamento e meio de modelos responder a questões processamento de estatísticos e de machine de negócio. dados. learning. Passado e Presente Passado e Presente Futuro (predição, (infraestrutura para Foco Temporal (análise histórica e prognóstico e suportar operações monitoramento atual). otimização). atuais e futuras). "Como podemos "O que acontecerá a coletar e armazenar "O que aconteceu e por Questões-Chave seguir e o que devemos esses dados de forma quê?" fazer a respeito?" eficiente e confiável?" Modelos de machine Pipelines de dados, learning, algoritmos Dashboards, relatórios, data warehouses, preditivos, sistemas de Resultados Típicos visualizações, análises data lakes, APIs de recomendação, ad-hoc. dados. resultados de experimentação. Coletar, Mover / Fases do Ciclo de Explorar, Agregar / Aprender / Otimizar, Armazenar, Dados Categorizar. Experimentação. Transformar. 9 - 32E-Book Printed Handout Fonte: Elaborado com base em Reis; Housley, 2023 Sinergias e Interdependências Apesar de suas distinções claras, essas três disciplinas não operam de forma isolada, como silos independentes. Pelo contrário, elas se entrelaçam para formar uma cadeia de valor de dados coesa e altamente interdependente. crescimento exponencial da área de dados tem atraído "engenheiros de software, cientistas e analistas de dados" para os desafios intrínsecos à engenharia de dados, um fenômeno que sublinha a fluidez e a natureza colaborativa que permeia esses papéis (Serra, 2024). A engenharia de dados funciona como o ponto de partida essencial e um facilitador contínuo em todo o processo. Sem a existência de pipelines de dados confiáveis e uma arquitetura bem definida e robusta, os analistas de dados se deparariam com informações de baixa qualidade ou, em muitos casos, com a ausência delas comprometendo a acurácia de suas análises. De forma similar, os cientistas de dados seriam forçados a dedicar a maior parte de seu tempo a tarefas exaustivas de limpeza e preparação de dados, desviando-se de sua missão central de modelagem e inovação. engenheiro de dados, portanto, é reconhecido como a "peça-chave para o sucesso" de qualquer empreendimento ou iniciativa que dependa de dados (Lucchesi, 2024), pois garante que os dados brutos se transformem em um recurso organizado e acessível. trabalho do analista de dados, por sua vez, frequentemente atua como um catalisador para investigações mais aprofundadas. Ao apresentar um dashboard que revela, por exemplo, uma queda inesperada nas vendas, o analista pode instigar o cientista de dados a investigar os fatores preditivos dessa queda, culminando na construção de um modelo capaz de antecipar futuras tendências e mitigar riscos. Essa interação demonstra como os insights do analista podem pavimentar o caminho para a inovação. Finalmente, um modelo de machine learning desenvolvido por um cientista de dados só alcança seu pleno valor quando é efetivamente implantado em um ambiente de produção (um processo conhecido como MLOps). Essa etapa crítica de implantação, que demanda escalabilidade, monitoramento contínuo, robustez e uma integração perfeita com os sistemas existentes da organização, é uma responsabilidade que, mais uma vez, recai sobre os ombros do engenheiro de dados. É ele quem garante que o valor gerado pela ciência de dados seja entregue de forma contínua, eficiente e confiável, fechando o ciclo de valor dos dados. Fluxo de Valor Contínuo dos Dados A interconexão e a colaboração entre as três disciplinas podem ser visualizadas como um fluxo dinâmico e contínuo de geração de valor, onde cada etapa se constrói sobre a anterior e prepara o terreno para a próxima: 10 - 32E-Book Printed Handout 1. Fundação (Engenharia de Dados): nesta fase primordial, os dados brutos, provenientes de diversas fontes, são coletados, armazenados em sistemas apropriados e transformados em conjuntos de dados limpos, estruturados e facilmente acessíveis. A engenharia de dados não apenas move e armazena os dados, mas também constrói e mantém toda a infraestrutura tecnológica que serve de suporte para o ecossistema de dados da organização, garantindo sua robustez e escalabilidade. 2. Compreensão (Análise de Dados): com os dados devidamente preparados e organizados pela engenharia, a análise de dados entra em cena. Nesta etapa, os dados são explorados e interpretados para gerar relatórios detalhados, dashboards intuitivos e visualizações que proporcionam uma compreensão clara e concisa do desempenho passado e presente do negócio. objetivo é responder a perguntas descritivas e diagnósticas. 3. Inovação (Ciência de Dados): munidos dos insights gerados pela análise e dos dados robustos e confiáveis fornecidos pela engenharia, os cientistas de dados desenvolvem e aplicam modelos preditivos e algoritmos complexos. Esta fase é onde a inovação é impulsionada, otimizando processos existentes, criando novas funcionalidades e produtos baseados em previsões e gerando uma vantagem competitiva significativa através da capacidade de antecipar o futuro. 4. Operacionalização (Engenharia de Dados): uma vez que os modelos e algoritmos são desenvolvidos e validados pela ciência de dados, eles precisam ser integrados aos sistemas de produção da empresa para que possam gerar valor de forma contínua. Essa integração, que envolve a construção de APIs, o gerenciamento de ambientes de produção e o monitoramento da performance dos modelos, é uma responsabilidade da engenharia de dados. Esta etapa garante que o valor gerado pela ciência de dados seja entregue de forma sustentável e confiável aos usuários finais e aos sistemas de negócio. Podemos metaforicamente afirmar que a engenharia de dados é a responsável por construir e manter a "estrada" por onde os dados fluem; a análise de dados dedica-se a descrever e entender o "tráfego" que já percorreu essa estrada, identificando padrões e comportamentos passados; e a ciência de dados, por sua vez, utiliza todas essas informações para prever e otimizar "fluxo futuro" desse tráfego, buscando o melhor caminho e a maior eficiência. Uma organização que atinge a maturidade no uso de dados não apenas reconhece a importância intrínseca de cada um desses papéis, mas também fomenta um ambiente de colaboração contínua, onde as fronteiras entre as disciplinas são fluidas e o trabalho em equipe é incentivado para extrair o máximo valor de seus ativos de dados. Evolução das arquiteturas de dados 11 32E-Book Printed Handout É importante notar que essas arquiteturas não são estáticas. Elas passaram por uma evolução significativa, impulsionada pelo crescimento exponencial no volume, variedade e velocidade dos dados (os chamados '3 V's'), e pela crescente sofisticação das demandas analíticas das organizações. Para qualquer profissional da área, é vital compreender essa rica trajetória de desenvolvimento. A seguir, será apresentada uma análise dos principais modelos arquitetônicos, abrangendo desde os sistemas mais antigos, centralizados e monolíticos, até as soluções distribuídas e descentralizadas que caracterizam o cenário atual. Arquitetura Monolítica Nos primórdios da computação, a arquitetura predominante era a monolítica. Nesse modelo, todos os componentes de uma aplicação a interface de usuário, a lógica de negócio e a camada de acesso a dados são acoplados em uma única base de código e implantados como uma unidade singular. banco de dados, geralmente um sistema relacional (RDBMS), era parte integrante desse monólito, servindo exclusivamente à sua aplicação. Características: Acoplamento Forte: todos os componentes são interdependentes. Uma mudança em uma parte do sistema pode impactar todo o resto. Base de Dados Centralizada e Única: o banco de dados é projetado para servir a uma única aplicação, com um esquema rígido e otimizado para as operações daquele sistema (OLTP Online Transaction Processing). Escalabilidade Vertical: o crescimento é tipicamente alcançado através do aumento dos recursos de hardware do servidor (CPU, RAM), um processo conhecido como scale-up. Limitações para Dados: a arquitetura monolítica se torna um gargalo quando a necessidade de análise de dados surge. Acessar os dados diretamente do banco de dados de produção para realizar análises complexas pode degradar a performance da aplicação principal. Além disso, consolidar dados de múltiplos monólitos para uma visão unificada da empresa é uma tarefa complexa e ineficiente. Arquitetura Orientada a Serviços (SOA) Com o aumento da complexidade dos sistemas, a Arquitetura Orientada a Serviços (Service- Oriented Architecture SOA) surgiu como uma alternativa para quebrar o monólito. A ideia central é decompor a aplicação em um conjunto de serviços independentes que se comunicam através de um barramento de serviços empresariais (Enterprise Service Bus ESB). 12 32E-Book Printed Handout Características: Baixo Acoplamento: os serviços são projetados para serem independentes e reutilizáveis. Comunicação Padronizada: a comunicação entre serviços ocorre por meio de protocolos bem definidos (ex: SOAP, REST). Dados Encapsulados: cada serviço geralmente gerencia seu próprio banco de dados, escondendo os detalhes de implementação do resto do sistema. Impacto na Arquitetura de Dados: embora a SOA tenha descentralizado a lógica de aplicação, a gestão de dados para fins analíticos muitas vezes permaneceu um desafio. A necessidade de consolidar informações de dezenas ou centenas de bancos de dados de microsserviços levou à necessidade de soluções mais robustas e centralizadas para análise, pavimentando o caminho para o Data Warehouse. Data Warehouse (DW) Data Warehouse (DW) representa a primeira grande arquitetura projetada especificamente para análise de dados e Business Intelligence (BI). Trata-se de um repositório central que consolida dados de diversas fontes operacionais (OLTP) em um modelo otimizado para consultas analíticas (OLAP Online Analytical Processing). Características: Centralização: agrega dados de toda a organização em um único local. Orientado por Assunto: os dados são modelados em torno de assuntos de negócio (ex: Vendas, Marketing, Finanças). Schema-on-Write: os dados são limpos, transformados e estruturados em um esquema rígido (ex: Star Schema, Snowflake Schema) antes de serem carregados no DW. Esse processo é conhecido como ETL (Extract, Transform, Load). Dados Históricos e Não-Voláteis: o DW armazena um longo histórico de dados que, uma vez inseridos, não são alterados, permitindo análises de tendências ao longo do tempo. Limitações: com o advento do Big Data, o modelo de DW tradicional começou a mostrar suas limitações. Ele é caro para escalar, pouco flexível para acomodar dados não estruturados (ex: textos, imagens, logs) e o processo de ETL em lote (batch) pode introduzir uma alta latência, tornando-o inadequado para análises em tempo real. 13 32E-Book Printed Handout Papel do Engenheiro de Dados no DW No paradigma do Data Warehouse, engenheiro de dados é primariamente responsável por projetar, construir e manter os pipelines de ETL. Esta função exige um profundo conhecimento em modelagem de dados dimensional, otimização de consultas SQL e ferramentas de integração de dados. "aumento exponencial de dados" (Lucchesi, 2025) começou a desafiar a capacidade desses profissionais de manter os pipelines de ETL eficientes e escaláveis dentro do paradigma rígido do DW. Data Lake Data Lake surgiu como uma resposta direta às limitações do Data Warehouse na era do Big Data. É um repositório centralizado que permite armazenar grandes volumes de dados estruturados, semiestruturados e não estruturados em seu formato nativo e bruto. Características: Armazenamento de Dados Brutos: os dados são ingeridos e armazenados "como estão", sem a necessidade de uma transformação prévia. Schema-on-Read: a estrutura dos dados é definida no momento da leitura ou consulta, não no momento da escrita. Isso oferece uma flexibilidade imensa para diferentes tipos de análise. Escalabilidade e Custo-Benefício: utiliza tecnologias de distribuído (como HDFS ou armazenamento de objetos em nuvem como Amazon S3) que são altamente escaláveis e de baixo custo. Suporte a Diversos Casos de Uso: além do BI tradicional, Data Lake é ideal para exploração de dados, ciência de dados e treinamento de modelos de machine learning. Desafios: a grande flexibilidade do Data Lake pode se tornar um problema. Sem governança e metadados adequados, ele pode se transformar em um "data swamp" (pântano de dados), onde os dados são de baixa qualidade, difíceis de encontrar e de usar. A gestão centralizada por uma única equipe de engenharia de dados também pode se tornar um gargalo para a organização. A disciplina de engenhariaE-Book Printed Handout de dados é, portanto, "essencial no cenário atual de big data e analytics" (Rodrigues, 2024) para evitar tais armadilhas. Data Mesh Data Mesh é o paradigma arquitetônico mais recente e representa uma mudança fundamental de pensamento: da centralização (DW, Data Lake) para a descentralização. Ele propõe uma abordagem sociotécnica que trata os dados como um produto e distribui a responsabilidade pela gestão dos dados para as equipes de domínio que os conhecem melhor. 1. Princípios Fundamentais: 2. Propriedade de Dados Orientada a Domínio: as equipes que geram ou entendem profundamente um domínio de negócio (ex: Pagamentos, Logística) são responsáveis por seus próprios dados, desde a ingestão até a disponibilização para consumo analítico. 3. Dados como um Produto (Data as a Product): cada domínio deve tratar seus dados como um produto, com consumidores (outras equipes) em mente. Isso implica em garantir que os dados sejam detectáveis, endereçáveis, confiáveis e seguros. 4. Plataforma de Dados de Autoatendimento (Self-Serve Data Platform): A organização deve fornecer uma plataforma central que abstraia a complexidade da infraestrutura, permitindo que as equipes de domínio gerenciem seus produtos de dados de forma autônoma e eficiente. 5. Governança Computacional Federada (Federated Computational Governance): Um comitê central define padrões globais de governança (qualidade, segurança, interoperabilidade), mas a implementação e automação dessas regras são federadas e aplicadas dentro de cada domínio. Impacto Organizacional: Data Mesh não é apenas uma mudança tecnológica, mas principalmente cultural e organizacional. Ele visa escalar a capacidade analítica de uma empresa, eliminando os gargalos das equipes centrais de dados e capacitando os domínios a gerar valor a partir de seus próprios dados. A escolha de implementar um Data Mesh em detrimento de outras arquiteturas modernas é uma das decisões estratégicas que engenheiros e líderes de dados enfrentam hoje (Serra, 2024). Quadro 3 Comparativo das Arquiteturas Modernas de Dados 15 32E-Book Printed Handout Data Warehouse Característica Data Lake Data Mesh (DW) Descentralizado e Paradigma Centralizado Centralizado Distribuído Dados de domínio, Estruturados, Dados Primários Todos os tipos, brutos tratados como processados produto Schema-on-Write Schema-on-Read Schema definido pelo Esquema (Rígido) (Flexível) domínio produtor Equipe central de Equipes de domínio de Propriedade Equipe central de dados dados/BI negócio Diversos (Analistas, Cientistas de Dados, Principal Usuário Analistas de Negócio Cientistas, outras Engenheiros equipes) Flexibilidade e Agilidade, Qualidade e Principal Vantagem escalabilidade para Big escalabilidade consistência para BI Data organizacional Complexidade Rigidez, custo, dados Risco de "data swamp", Principal Desafio organizacional e não estruturados gargalo central cultural Fonte: (Núcleo Editorial). A jornada das arquiteturas de dados reflete a própria evolução do valor dos dados nas organizações. Partimos de sistemas onde os dados eram um subproduto da operação para um cenário onde os dados são principal ativo estratégico, exigindo abordagens cada vez mais sofisticadas, distribuídas e democráticas para sua gestão. Componentes de uma arquitetura de dados 16 32E-Book Printed Handout Uma arquitetura de dados robusta e eficiente é alicerce sobre o qual as organizações constroem suas capacidades analíticas e de inteligência. Independentemente da tecnologia específica ou do paradigma adotado seja um data warehouse moderno, um data lakehouse ou uma data mesh (Serra, 2024) a funcionalidade de qualquer sistema de dados pode ser decomposta em quatro componentes lógicos fundamentais. Estes componentes representam as etapas sequenciais do ciclo de vida dos dados, desde sua origem até sua utilização para geração de valor. A compreensão aprofundada de cada fase é crucial para o engenheiro de dados, que é o profissional responsável por "criar e manter infraestruturas que permitem o armazenamento, processamento e análise de grandes volumes de dados" (Lucchesi, 2025). A jornada do dado pode ser visualizada como um fluxo contínuo que perpassa as seguintes etapas: Ingestão (Coletar), Armazenamento (Mover/Armazenar), Processamento e Exposição (Aprender/Otimizar) (Reis; Housley, 2023). A seguir, detalharemos cada um desses componentes. Ingestão de Dados A ingestão é o ponto de partida de qualquer pipeline de dados. Corresponde à primeira fase do ciclo de vida, a etapa de "COLETAR" (Reis; Housley, 2023), e consiste no processo de obter dados brutos de uma vasta gama de fontes e movê-los para um sistema de armazenamento centralizado, como um Data lake ou staging Area. As fontes de dados podem ser extremamente heterogêneas, incluindo: Bancos de dados transacionais (OLTP): MySQL, PostgreSQL, SQL Server. Aplicações de negócio: Sistemas de CRM (Salesforce), ERP (SAP). Logs de aplicação e servidores: Arquivos de log em formato texto, JSON, etc. Dispositivos (Internet of Things): Sensores, medidores inteligentes. Fontes externas: APIs de terceiros, feeds de redes sociais, dados públicos. A principal complexidade desta fase reside em lidar com a variedade de formatos, protocolos e velocidades de geração de dados. Os métodos de ingestão são geralmente classificados em duas categorias principais, conforme detalhado na tabela abaixo. Quadro 4 Comparativo entre Ingestão em Lote e em Tempo Real 17 32E-Book Printed Handout Ingestão em Tempo Real Característica Ingestão em Lote (Batch) (Streaming) Processamento de grandes Processamento de dados evento volumes de dados em intervalos Definição a evento ou em micro-lotes, à de tempo definidos (ex: a cada medida que são gerados. hora, diariamente). Baixa (segundos ou Latência Alta (minutos, horas). milissegundos). Relatórios diários, Detecção de fraudes, processamento de faturamento, monitoramento de sistemas, Casos de Uso cargas históricas em Data personalização de websites em Warehouse. tempo real. Apache Sqoop, scripts Apache Kafka, AWS Kinesis, customizados (Python), Tecnologias Google Pub/Sub, Apache Flink, ferramentas de ETL/ELT como Spark Streaming. Airflow, Fivetran. Otimizado para grandes Otimizado para alta velocidade e Volume de Dados volumes de dados acumulados fluxo contínuo de dados. (throughput). Fonte: (Núcleo Editorial). A escolha entre batch e streaming depende intrinsecamente dos requisitos de negócio. Muitas arquiteturas modernas empregam uma abordagem híbrida, utilizando ambos os métodos para atender a diferentes necessidades analíticas. Armazenamento de Dados Uma vez ingeridos, os dados precisam ser persistidos de forma segura, escalável e acessível. Esta é a fase de "MOVER / ARMAZENAR" (Reis; Housley, 2023), e a escolha da solução de armazenamento é uma das decisões mais críticas na concepção de uma arquitetura de dados. engenheiro de dados é responsável por projetar e manter a infraestrutura que suporta este armazenamento (Lucchesi, 2025). As principais abordagens de armazenamento em arquiteturas modernas são: 18 32E-Book Printed Handout Data Lake: um repositório centralizado que permite armazenar grandes volumes de dados estruturados, semiestruturados e não estruturados em seu formato nativo (schema-on-read). Ideal para flexibilidade, exploração de dados e como staging area para dados brutos. Data Warehouse (DW): um repositório de dados estruturados e modelados (schema-on-write), otimizado para consultas analíticas e Business Intelligence (BI). Os dados são limpos, transformados e organizados em um esquema dimensional (fato/dimensão) antes de serem carregados. Data Lakehouse: um paradigma arquitetônico emergente que combina a flexibilidade e o baixo custo de um Data Lake com os recursos de gerenciamento de dados e transações ACID de um Data Warehouse. Como aponta Serra (2024), a engenharia de dados evoluiu para abarcar essas novas soluções que buscam o melhor dos dois mundos. A escolha entre essas abordagens impacta diretamente como os dados serão processados e consumidos. Um Data Lake, por exemplo, é excelente para armazenar dados brutos que ainda não têm um propósito definido, enquanto um Data Warehouse é projetado para responder a perguntas de negócio específicas com alta performance. Processamento e Transformação de Dados Os dados brutos armazenados no Data Lake raramente estão prontos para consumo direto. Eles precisam ser limpos, validados, enriquecidos, agregados e reformatados para se tornarem úteis para análise. Esta é a etapa de processamento, que engloba as fases de "EXPLORAR / TRANSFORMAR" e "AGREGAR / CATEGORIZAR" (Reis; Housley, 2023). objetivo principal desta fase é converter dados brutos em conjuntos de dados curados e confiáveis. As atividades comuns incluem: Limpeza: tratamento de valores nulos, remoção de duplicatas, correção de inconsistências. Enriquecimento: combinação de dados de diferentes fontes para adicionar contexto (ex: juntar dados de transação com dados de clientes). Transformação: mudança de formatos (ex: de JSON para Parquet), aplicação de regras de negócio, cálculos e agregações (ex: sumarizar vendas por dia). Modelagem: estruturação dos dados em um formato otimizado para análise, como tabelas dimensionais em um Data Warehouse. Duas metodologias principais governam como e quando essas transformações ocorrem: 19 32E-Book Printed Handout Quadro 5 Panorama das Metodologias ETL e ELT ETL (Extract, Transform, Metodologia ELT (Extract, Load, Transform) Load) 1. Extrai dados da fonte. 1. Extrai dados da nte.2. 2. Transforma em um Carrega o dado bruto no destino (ex: servidor intermediário. Data Fluxo 3. Carrega o dado já Transforma os dados usando o transformado no destino poder de processamento do próprio (ex: Data Warehouse). destino. Moderno, favorecido por Tradicional, associado a arquiteturas em nuvem com Paradigma Data Warehouses e armazenamento e processamento ferramentas on-premise. desacoplados e escaláveis. Maior. Permite que os dados brutos Menor. As transformações sejam armazenados e Flexibilidade são predefinidas antes do transformados para múltiplos carregamento. propósitos posteriormente. Talend, Informatica, dbt (Data Build Tool), Spark SQL, Ferramentas Pentaho. Snowflake, BigQuery. Fonte: (Núcleo Editorial). A tendência moderna, impulsionada pela escalabilidade da nuvem, pende para ELT, que aproveita a capacidade de processamento massivo de plataformas como Spark, BigQuery e Snowflake para realizar transformações complexas diretamente sobre os dados armazenados. Exposição e Análise de Dados A etapa final do ciclo de vida é a exposição, onde o valor dos dados é finalmente materializado. Após serem ingeridos, armazenados e processados, os dados refinados devem ser disponibilizados para os consumidores finais. Esta fase corresponde ao objetivo de "APRENDER / OTIMIZAR" e habilitar atividades como "TESTAGEM A/B, EXPERIMENTAÇÃO" (Reis; Housley, 2023). A responsabilidade do engenheiro de dados se estende a garantir que a infraestrutura suporte essa "análise de grandes volumes de dados" (Lucchesi, 2025). 20 32E-Book Printed Handout Os dados podem ser expostos de várias maneiras, dependendo do consumidor e do caso de uso: Dashboards e Relatórios de BI: ferramentas como Tableau, Power BI ou Looker se conectam diretamente a Data Warehouses ou Data Marts para fornecer visualizações interativas para analistas de negócio e gestores. APIs (Application Programming Interfaces): aplicações operacionais podem consumir dados processados via APIs para, por exemplo, alimentar um sistema de recomendação em um site de e-commerce. Notebooks de Ciência de Dados: cientistas de dados acessam conjuntos de dados curados para treinar modelos de Machine Learning, realizar análises exploratórias e estatísticas. Acesso SQL Direto: analistas de dados podem executar consultas ad-hoc diretamente no Data Warehouse ou Lakehouse para responder a perguntas de negócio pontuais. A camada de exposição, também chamada de camada de consumo ou "serving layer", deve ser projetada para ser performática, segura e confiável, garantindo que os usuários certos tenham acesso aos dados certos no momento certo e com a latência adequada para sua necessidade. Introdução a pipelines de dados e orquestração No cerne da engenharia de dados moderna reside a necessidade de movimentar, transformar e disponibilizar dados de forma confiável e escalável. A disciplina, que "cresceu rapidamente na última década" (Serra, 2024), tem como um de seus pilares fundamentais a construção de fluxos de trabalho automatizados conhecidos como pipelines de dados. Um pipeline de dados pode ser definido como uma série de etapas computacionais interconectadas, projetadas para processar dados desde sua origem (fonte) até seu destino final. objetivo é automatizar o fluxo de dados, garantindo que eles cheguem ao local correto, no formato adequado e com a qualidade esperada. Essa automação é crucial, pois, como observado, "a engenharia de dados muitas vezes parece uma forma de resolver os mesmos problemas repetidamente" (Konieczny, 2025). Os pipelines, portanto, são o padrão de design que transforma essas tarefas repetitivas em sistemas robustos e eficientes. A responsabilidade do engenheiro de dados é exatamente "criar e manter infraestruturas que permitem o armazenamento, processamento e análise de grandes volumes de dados" (Lucchesi, 2025), e os pipelines são a materialização dessa responsabilidade. 21 32E-Book Printed Handout Anatomia de um Pipeline de Dados Embora a complexidade de um pipeline possa variar imensamente, a maioria pode ser decomposta em um conjunto lógico de estágios. Essa sequência de atividades reflete o ciclo de vida dos dados dentro de uma organização e é uma das "habilidades e funções da engenharia de dados" (Reis; Housley, 2023). Inspirado em uma visão funcional do fluxo de dados, podemos delinear as seguintes fases principais: 1. Coleta (Ingestão): é o ponto de partida do pipeline. Nesta fase, os dados são extraídos de suas fontes originais, que podem incluir bancos de dados transacionais (OLTP), APIs de serviços web, arquivos de log, dispositivos entre outros. desafio aqui é lidar com a heterogeneidade de formatos, protocolos e frequências de geração de dados. 2. Mover e Armazenar (Armazenamento): uma vez coletados, os dados precisam ser transportados e armazenados em um repositório centralizado. Este repositório pode ser um Data Lake, para dados brutos ou semiestruturados, ou um Data Warehouse, para dados já estruturados e modelados (Serra, 2024). Esta etapa garante a persistência e a disponibilidade dos dados para processamentos futuros. 3. Explorar e Transformar (Processamento): este é frequentemente o estágio mais complexo e computacionalmente intensivo. Aqui, os dados brutos são limpos, validados, enriquecidos, normalizados e transformados em um formato útil para análise. As operações podem incluir junções de diferentes fontes, cálculos de métricas, anonimização de dados sensíveis e reestruturação de esquemas. 4. Agregar e Categorizar (Serviço/Exposição): na fase final, os dados processados e transformados são carregados em sistemas de destino para consumo. Isso pode envolver a criação de tabelas agregadas (data marts), a indexação em motores de busca ou a disponibilização via APIs para aplicações ou dashboards de Business Intelligence. objetivo é otimizar os dados para os casos de uso específicos. quadro abaixo resume os estágios e seus objetivos primários. Quadro 6 Estágios e seus objetivos primários do Pipeline 22 32E-Book Printed Handout Estágio do Pipeline Objetivo Principal Exemplos de Atividades Leitura de logs de servidor, Extrair dados de sistemas Coleta (Ingestão) consumo de APIs, streaming de de origem. eventos. Carregar arquivos em um Data Persistir os dados em um Armazenamento Lake (ex: S3, ADLS), inserir dados repositório central. em um staging area. Limpar, enriquecer e Executar jobs Spark/SQL para Processamento transformar os dados limpeza, junção de tabelas, brutos. aplicação de regras de negócio. Disponibilizar os dados Carregar tabelas agregadas em Serviço processados para um Data Warehouse, popular um consumo. dashboard, servir modelos. Fonte: (Núcleo Editorial). Este fluxo estruturado é essencial, pois a engenharia de dados "envolve a criação de" sistemas que sustentam todo o ecossistema de big data e analytics (Rodrigues, 2024). que é Orquestração? Se um pipeline de dados é a sequência de tarefas a serem executadas, a orquestração é maestro que gerencia essa execução. A orquestração é o processo de automatizar, agendar, coordenar e monitorar os fluxos de trabalho (pipelines). Um orquestrador é responsável por: Agendamento: iniciar a execução do pipeline em um horário específico (ex: diariamente às 3h da manhã) ou com base em um gatilho (ex: quando um novo arquivo chega). Gerenciamento de Dependências: garantir que uma tarefa só comece após a conclusão bem-sucedida de suas predecessoras. Tratamento de Falhas e Retentativas: definir o que acontece quando uma tarefa falha. Deve-se tentar executá-la novamente? Quantas vezes? Deve-se notificar um engenheiro? Monitoramento e Alertas: fornecer visibilidade sobre status de cada execução do pipeline, registrando logs e enviando alertas em caso de problemas. 23 32E-Book Printed Handout Enquanto o pipeline define o quê" (quais tarefas), a orquestração gerencia o "como", "quando" e "se" essas tarefas são executadas de forma coesa e confiável. A distinção entre as tarefas do pipeline e sua orquestração é crucial para a construção de sistemas de dados maduros e de fácil manutenção. Ignorar a orquestração leva a um conjunto de scripts isolados e frágeis, enquanto uma abordagem orquestrada resulta em um sistema resiliente e observável. A maestria na construção e orquestração de pipelines de dados é, sem dúvida, um dos principais diferenciais que definem o papel vital que a "engenharia de dados desempenha no mundo moderno" (Rodrigues, 2024). Saiba Mais: Fundamentos da Engenharia de Dados ? KNOW MORE Fundamentos da Engenharia de Dados Considerações Finais Chegamos ao final da nossa primeira unidade, e ao longo deste estudo foi possível compreender que a Engenharia de Dados constitui o alicerce de todo ecossistema de dados moderno. É nessa área que se desenham as estruturas que possibilitam o armazenamento, o processamento e a disponibilização das informações de forma eficiente e escalável. Vimos que o engenheiro de dados não é apenas um executor técnico, mas um profissional estratégico que conecta a tecnologia às necessidades de negócio, transformando dados brutos em um ativo valioso para a tomada de decisão e para a inovação organizacional. A reflexão sobre a evolução das arquiteturas, os papéis e as atribuições desse profissional revelaram que a engenharia de dados vai muito além de infraestrutura: trata-se de pensar sistemicamente, garantindo qualidade, segurança e fluidez na jornada dos dados. 24 32E-Book Printed Handout Essa compreensão inaugura o percurso do curso com bases sólidas mostrando que, sem uma engenharia de dados bem estruturada, não há ciência de dados eficiente, nem inteligência analítica sustentável. Assim, encerramos esta unidade reconhecendo que a engenharia de dados é, antes de tudo, o ponto de partida da transformação digital baseada em dados. Lista de Termos Específicos Termo / Sigla Definição resumida Conjunto de tecnologias e métodos voltados ao armazenamento, processamento e análise de grandes Big Data volumes de dados caracterizados pelos "5Vs": Volume, Velocidade, Variedade, Veracidade e Valor. Campo interdisciplinar que aplica métodos científicos, Data Science (Ciência de Dados) estatística e computação para extrair conhecimento e gerar insights a partir de dados. Subcampo da Inteligência Artificial que permite a Machine Learning (Aprendizado de sistemas aprenderem padrões e realizarem previsões a Máquina) partir de dados sem serem explicitamente programados. Artificial Intelligence (AI Campo da computação que busca simular a capacidade Inteligência Artificial) humana de raciocinar, aprender e tomar decisões. Tomada de decisão orientada por dados; prática que substitui decisões baseadas em intuição por decisões Data-Driven Decision-Making (DDD) embasadas em análise de dados. 25 32E-Book Printed Handout Descoberta ou compreensão significativa extraída da Insight análise de dados. Repositório central de dados estruturados usado em Data Warehouse (DW) relatórios e análises empresariais. Armazenamento de dados brutos em seu formato Data Lake original, usado para análises exploratórias e aprendizado de máquina. Arquitetura híbrida que combina a estrutura do Data Data Lakehouse Warehouse com a flexibilidade do Data Lake. Processo de extração, transformação e carregamento de ETL (Extract, Transform, Load) dados para integração e análise. Variante do ETL que realiza a transformação após o ELT (Extract, Load, Transform) carregamento dos dados. Modelo em que a estrutura dos dados é interpretada Schema-on-Read apenas no momento da leitura. Modelo em que a estrutura é definida antes do armazenamento dos dados. 26 32E-Book Printed Handout Data Engineer (Engenheiro de Dados) Profissional responsável por coletar, organizar, transformar e disponibilizar dados para análise. Profissional que analisa dados e cria modelos preditivos Data Scientist (Cientista de Dados) para extrair valor e apoiar decisões estratégicas. Responsável por projetar e gerenciar a infraestrutura e a Data Architect (Arquiteto de Dados) governança dos dados de uma organização. Conjunto de tecnologias e práticas voltadas à análise Business Intelligence (BI) descritiva e visualização de dados para apoiar decisões de negócio. Painel visual interativo usado para acompanhar Dashboard métricas e indicadores de desempenho (KPIs). Indicadores-chave de desempenho usados para medir o Key Performance Indicators (KPIs) sucesso de processos e estratégias. Técnica de agrupamento de dados semelhantes sem Clusterização (Clustering) rótulos pré-definidos. Método preditivo que estima valores numéricos Regressão (Regression) contínuos com base em dados históricos. Classificação (Classification) 27 32E-Book Printed Handout Técnica de aprendizado de máquina usada para categorizar dados em classes. Análise Preditiva (Predictive Técnica que utiliza dados históricos e algoritmos para Analysis) prever resultados futuros. Análise Prescritiva (Prescriptive Método que recomenda ações baseadas em previsões e Analysis) simulações. Sequência automatizada de processos que coletam, Pipeline de Dados (Data Pipeline) transformam e carregam dados para análise. Frameworks distribuídos usados para armazenamento e Apache Hadoop / Apache Spark processamento massivo de dados em escala. Linguagem padrão usada para consultar e manipular SQL (Structured Query Language) dados em bancos relacionais. Categoria de bancos de dados não relacionais projetada NoSQL (Not Only SQL) para lidar com grandes volumes de dados sem estrutura rígida. Formato leve de intercâmbio de dados usado em JSON (JavaScript Object Notation) sistemas e APIs. API (Application Programming Conjunto de padrões que permitem a integração e Interface) comunicação entre sistemas de software. 28 32E-Book Printed Handout Rede de dispositivos conectados que coletam e (Internet of Things) transmitem dados automaticamente. Modelo que oferece recursos de computação sob Cloud Computing (Computação em demanda via internet, como armazenamento e Nuvem) processamento. Plataforma de serviços de computação em nuvem da AWS (Amazon Web Services) Amazon, amplamente usada em projetos de dados. Microsoft Azure / Google Cloud Plataformas de computação em nuvem que oferecem Platform (GCP) serviços de dados, IA e análise. Arquitetura que integra controle de versionamento e Data Lakehouse com Delta Lake transações ACID a ambientes de Data Lakes. ACID (Atomicity, Consistency, Conjunto de propriedades que garantem a integridade Isolation, Durability) de transações em sistemas de banco de dados. Governança de Dados (Data Conjunto de políticas e práticas que asseguram Governance) qualidade, segurança e conformidade no uso dos dados. Dados sobre dados; descrevem origem, formato, Metadados (Metadata) estrutura e contexto de um conjunto de informações. 29 32E-Book Printed Handout Apache Atlas / Apache Ranger Ferramentas open-source voltadas à governança, auditoria e controle de acesso de dados. Princípio de projetar sistemas e arquiteturas de dados Compliance by Design já em conformidade com legislações como LGPD e GDPR. GDPR (General Data Protection Regulamento europeu de proteção de dados pessoais. Regulation) LGPD (Lei Geral de Proteção de Legislação brasileira que regula o tratamento e a Dados) privacidade de dados pessoais. Abordagem que integra a proteção de dados desde a Privacy by Design concepção de sistemas e processos. Tokenização / Anonimização / Técnicas de proteção de dados pessoais que reduzem Criptografia riscos de exposição e uso indevido. Rastreamento completo da origem, transformação e Data Lineage (Linhagem de Dados) destino de um dado dentro da infraestrutura. Storytelling com Dados (Data Prática de comunicar resultados e análises por meio de Storytelling) narrativas visuais e contextuais. Conjunto de práticas que unem ciência de dados e MLOps (Machine Learning DevOps, automatizando ciclo de vida dos modelos de Operations) ML. 30 32E-Book Printed Handout Engenheiro de Machine Learning (ML Profissional que implementa e mantém modelos de Engineer) machine learning em produção. Engenheiro de dados especializado em arquiteturas e Cloud Data Engineer serviços de computação em nuvem. Profissional que transforma dados brutos em modelos Analytics Engineer analíticos testados e prontos para BI. Profissional responsável por assegurar conformidade Data Privacy Specialist (Especialista com leis de proteção de dados e segurança da em Privacidade de Dados) informação. STEM (Science, Technology, Abordagem educacional voltada à integração de Engineering and Mathematics) ciência, tecnologia, engenharia e matemática. Lifelong Learning (Aprendizagem Princípio de educação permanente para atualização Contínua) constante em áreas tecnológicas. Competências técnicas (hard) e comportamentais (soft) Hard Skills / Soft Skills necessárias ao sucesso profissional. Processos de requalificação e aprimoramento de Reskilling / Upskilling competências para atender às novas demandas do mercado digital. 31 32E-Book Printed Handout Referências ALBUQUERQUE, Alfram Roberto Rodrigues de. Discurso sobre fundamentos de Arquitetura da Informação. 2010. 241 f. (Tese em Doutorado) Universidade de Brasília, Faculdade de Ciência da Informação, Brasília, 2010. ANUNCIAÇÃO, Fernando de Souza. cientista de dados e os seus demônios. 1. ed. Rio de Janeiro: Alta Books, 2024. KONIECZNY, Bartosz. Padrões de design de engenharia de dados: receitas para resolver os problemas mais comuns de engenharia de dados. São Paulo: Novatec Editora, 2025. LUCCHESI, Claudio. Engenharia de computação. Claudio Lucchesi, 2025. LUCCHESI, Claudio. Engenharia de dados: do básico ao avançado domine o futuro dos dados. Claudio L Lucchesi, 2024. PÓVOA, Ana Paula Ferreira Dias Barbosa; MIRANDA, Joao Luís de (org.). Operations research and big data: IO2015-XVII Congress of Portuguese Association of Operational Research (APDIO). Cham: Springer, 2015 REIS, Joe; HOUSLEY, Matt. Fundamentos de engenharia de dados: projete e construa sistemas de dados robustos. São Paulo: Novatec Editora, 2023. RODRIGUES, Diego. Master Python engenharia de dados com tutoria virtual IA. [S.l.]: Diego Rodrigues, 2024. RODRIGUES, Diego. livro de ouro da engenharia de dados: edição 2024 conteúdo essencial para estudantes e profissionais. Diego Rodrigues, 2024. SERRA, James. Decifrando arquiteturas de dados: escolhendo entre data warehouse moderno, data fabric, data lakehouse e data mesh. 1. ed. São Paulo: Novatec Editora, 2024. SIQUEIRA, André Henrique de. Arquitetura da Informação: Uma proposta para fundamentação e caracterização da disciplina científica. 2012. 444 f. (Tese em Doutorado) UNIVERSIDADE DE BRASÍLIA UNB, Brasília, 2012 32 32

Mais conteúdos dessa disciplina