Logo Passei Direto
Buscar

Fundamentos de Big Data e Estatística Computacional

Ferramentas de estudo

Questões resolvidas

Com o crescimento dos dados disponíveis, as ferramentas e técnicas de Big Data têm se tornado indispensáveis. Esta prova aborda conceitos de estatística aplicada em ambientes de grandes volumes de dados, bem como estratégias para análise eficiente e escalável.
Qual das opções abaixo descreve melhor o conceito de Big Data?
a) Dados armazenados em planilhas grandes.
b) Conjuntos de dados extremamente volumosos, variados e que chegam a alta velocidade.
c) Dados estruturados organizados em bancos relacionais.
d) Informações em tempo real sobre redes sociais.
e) Apenas dados coletados de sensores IoT.

Qual é o papel principal do MapReduce em ambientes de Big Data?
a) Melhorar a visualização de grandes dados.
b) Permitir o processamento paralelo de grandes volumes de dados.
c) Criar modelos preditivos avançados.
d) Reduzir a quantidade de dados armazenados.
e) Transformar dados não estruturados em estruturados.

Em estatística computacional, a amostragem estratificada é usada para:
a) Garantir que todas as subpopulações estejam proporcionalmente representadas na amostra.
b) Aumentar a variância das estimativas.
c) Facilitar a análise em dados não estruturados.
d) Reduzir o viés ao calcular a média populacional.
e) Melhorar a eficiência do processamento paralelo.

Qual é a principal característica de um algoritmo distribuído?
a) Executa cálculos apenas em um servidor principal.
b) Divide tarefas complexas em partes menores, processadas por múltiplos nós.
c) Reduz a quantidade de dados de entrada em tempo real.
d) É limitado a bancos de dados relacionais.
e) Necessita de supervisão constante para operar.

O que significa o termo dimensionalidade em um conjunto de dados?
a) A quantidade de linhas no conjunto.
b) A complexidade do algoritmo usado para análise.
c) O número de variáveis ou atributos do conjunto.
d) O tempo necessário para processar os dados.
e) A relação entre dados estruturados e não estruturados.

Qual é a principal razão para aplicar redução de dimensionalidade em Big Data?
a) Aumentar o tamanho dos dados.
b) Tornar os dados mais difíceis de interpretar.
c) Reduzir a complexidade computacional e melhorar a visualização.
d) Garantir que todos os atributos tenham o mesmo peso.
e) Excluir variáveis categóricas do conjunto.

Em qual situação o Spark seria preferido ao Hadoop para processamento de dados?
a) Quando os dados precisam ser processados em tempo real ou com baixa latência.
b) Quando o volume de dados é pequeno e facilmente manipulável.
c) Quando não é necessário paralelismo no processamento.
d) Quando apenas dados estruturados estão disponíveis.
e) Quando há interesse em análise gráfica avançada.

Em um banco de dados distribuído, o que é sharding?
a) A replicação completa de dados em vários servidores.
b) A divisão do banco em partes menores, armazenadas em diferentes servidores.
c) O uso de chaves criptográficas para proteger dados sensíveis.
d) A normalização de dados antes de armazená-los.
e) A compressão de dados para economizar espaço.

Qual método estatístico é usado para encontrar a variável mais importante em um modelo de aprendizado de máquina com alta dimensionalidade?
a) Análise de componentes principais (PCA).
b) Teste t de Student.
c) Qui-quadrado.
d) Análise de variância (ANOVA).
e) Regressão logística.

Qual é o impacto do uso de algoritmos paralelos em estatística computacional?
a) Reduz a precisão dos resultados.
b) Aumenta a escalabilidade e reduz o tempo de execução.
c) Elimina a necessidade de validação cruzada.
d) Depende exclusivamente do uso de hardware dedicado.
e) É útil apenas em conjuntos de dados estruturados.

Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Questões resolvidas

Com o crescimento dos dados disponíveis, as ferramentas e técnicas de Big Data têm se tornado indispensáveis. Esta prova aborda conceitos de estatística aplicada em ambientes de grandes volumes de dados, bem como estratégias para análise eficiente e escalável.
Qual das opções abaixo descreve melhor o conceito de Big Data?
a) Dados armazenados em planilhas grandes.
b) Conjuntos de dados extremamente volumosos, variados e que chegam a alta velocidade.
c) Dados estruturados organizados em bancos relacionais.
d) Informações em tempo real sobre redes sociais.
e) Apenas dados coletados de sensores IoT.

Qual é o papel principal do MapReduce em ambientes de Big Data?
a) Melhorar a visualização de grandes dados.
b) Permitir o processamento paralelo de grandes volumes de dados.
c) Criar modelos preditivos avançados.
d) Reduzir a quantidade de dados armazenados.
e) Transformar dados não estruturados em estruturados.

Em estatística computacional, a amostragem estratificada é usada para:
a) Garantir que todas as subpopulações estejam proporcionalmente representadas na amostra.
b) Aumentar a variância das estimativas.
c) Facilitar a análise em dados não estruturados.
d) Reduzir o viés ao calcular a média populacional.
e) Melhorar a eficiência do processamento paralelo.

Qual é a principal característica de um algoritmo distribuído?
a) Executa cálculos apenas em um servidor principal.
b) Divide tarefas complexas em partes menores, processadas por múltiplos nós.
c) Reduz a quantidade de dados de entrada em tempo real.
d) É limitado a bancos de dados relacionais.
e) Necessita de supervisão constante para operar.

O que significa o termo dimensionalidade em um conjunto de dados?
a) A quantidade de linhas no conjunto.
b) A complexidade do algoritmo usado para análise.
c) O número de variáveis ou atributos do conjunto.
d) O tempo necessário para processar os dados.
e) A relação entre dados estruturados e não estruturados.

Qual é a principal razão para aplicar redução de dimensionalidade em Big Data?
a) Aumentar o tamanho dos dados.
b) Tornar os dados mais difíceis de interpretar.
c) Reduzir a complexidade computacional e melhorar a visualização.
d) Garantir que todos os atributos tenham o mesmo peso.
e) Excluir variáveis categóricas do conjunto.

Em qual situação o Spark seria preferido ao Hadoop para processamento de dados?
a) Quando os dados precisam ser processados em tempo real ou com baixa latência.
b) Quando o volume de dados é pequeno e facilmente manipulável.
c) Quando não é necessário paralelismo no processamento.
d) Quando apenas dados estruturados estão disponíveis.
e) Quando há interesse em análise gráfica avançada.

Em um banco de dados distribuído, o que é sharding?
a) A replicação completa de dados em vários servidores.
b) A divisão do banco em partes menores, armazenadas em diferentes servidores.
c) O uso de chaves criptográficas para proteger dados sensíveis.
d) A normalização de dados antes de armazená-los.
e) A compressão de dados para economizar espaço.

Qual método estatístico é usado para encontrar a variável mais importante em um modelo de aprendizado de máquina com alta dimensionalidade?
a) Análise de componentes principais (PCA).
b) Teste t de Student.
c) Qui-quadrado.
d) Análise de variância (ANOVA).
e) Regressão logística.

Qual é o impacto do uso de algoritmos paralelos em estatística computacional?
a) Reduz a precisão dos resultados.
b) Aumenta a escalabilidade e reduz o tempo de execução.
c) Elimina a necessidade de validação cruzada.
d) Depende exclusivamente do uso de hardware dedicado.
e) É útil apenas em conjuntos de dados estruturados.

Prévia do material em texto

Prova 9: Fundamentos de Big Data e Estatística Computacional
Introdução
Com o crescimento dos dados disponíveis, as ferramentas e técnicas de Big Data têm se tornado indispensáveis. Esta prova aborda conceitos de estatística aplicada em ambientes de grandes volumes de dados, bem como estratégias para análise eficiente e escalável.
Questões
1. Qual das opções abaixo descreve melhor o conceito de Big Data?
a) Dados armazenados em planilhas grandes.
b) Conjuntos de dados extremamente volumosos, variados e que chegam a alta velocidade.
c) Dados estruturados organizados em bancos relacionais.
d) Informações em tempo real sobre redes sociais.
e) Apenas dados coletados de sensores IoT.
2. Qual é o papel principal do MapReduce em ambientes de Big Data?
a) Melhorar a visualização de grandes dados.
b) Permitir o processamento paralelo de grandes volumes de dados.
c) Criar modelos preditivos avançados.
d) Reduzir a quantidade de dados armazenados.
e) Transformar dados não estruturados em estruturados.
3. Em estatística computacional, a amostragem estratificada é usada para:
a) Garantir que todas as subpopulações estejam proporcionalmente representadas na amostra.
b) Aumentar a variância das estimativas.
c) Facilitar a análise em dados não estruturados.
d) Reduzir o viés ao calcular a média populacional.
e) Melhorar a eficiência do processamento paralelo.
4. Qual é a principal característica de um algoritmo distribuído?
a) Executa cálculos apenas em um servidor principal.
b) Divide tarefas complexas em partes menores, processadas por múltiplos nós.
c) Reduz a quantidade de dados de entrada em tempo real.
d) É limitado a bancos de dados relacionais.
e) Necessita de supervisão constante para operar.
5. O que significa o termo dimensionalidade em um conjunto de dados?
a) A quantidade de linhas no conjunto.
b) A complexidade do algoritmo usado para análise.
c) O número de variáveis ou atributos do conjunto.
d) O tempo necessário para processar os dados.
e) A relação entre dados estruturados e não estruturados.
6. Qual é a principal razão para aplicar redução de dimensionalidade em Big Data?
a) Aumentar o tamanho dos dados.
b) Tornar os dados mais difíceis de interpretar.
c) Reduzir a complexidade computacional e melhorar a visualização.
d) Garantir que todos os atributos tenham o mesmo peso.
e) Excluir variáveis categóricas do conjunto.
7. Em qual situação o Spark seria preferido ao Hadoop para processamento de dados?
a) Quando os dados precisam ser processados em tempo real ou com baixa latência.
b) Quando o volume de dados é pequeno e facilmente manipulável.
c) Quando não é necessário paralelismo no processamento.
d) Quando apenas dados estruturados estão disponíveis.
e) Quando há interesse em análise gráfica avançada.
8. Em um banco de dados distribuído, o que é sharding?
a) A replicação completa de dados em vários servidores.
b) A divisão do banco em partes menores, armazenadas em diferentes servidores.
c) O uso de chaves criptográficas para proteger dados sensíveis.
d) A normalização de dados antes de armazená-los.
e) A compressão de dados para economizar espaço.
9. Qual método estatístico é usado para encontrar a variável mais importante em um modelo de aprendizado de máquina com alta dimensionalidade?
a) Análise de componentes principais (PCA).
b) Teste t de Student.
c) Qui-quadrado.
d) Análise de variância (ANOVA).
e) Regressão logística.
10. Qual é o impacto do uso de algoritmos paralelos em estatística computacional?
a) Reduz a precisão dos resultados.
b) Aumenta a escalabilidade e reduz o tempo de execução.
c) Elimina a necessidade de validação cruzada.
d) Depende exclusivamente do uso de hardware dedicado.
e) É útil apenas em conjuntos de dados estruturados.
Gabarito e Justificativas
1. b) Big Data refere-se a conjuntos volumosos, variados e de alta velocidade.
2. b) O MapReduce permite processamento paralelo eficiente.
3. a) Amostragem estratificada representa subpopulações proporcionalmente.
4. b) Algoritmos distribuídos processam tarefas em múltiplos nós para eficiência.
5. c) Dimensionalidade é o número de variáveis ou atributos em um conjunto.
6. c) Redução de dimensionalidade simplifica análises e melhora visualizações.
7. a) Spark é preferido para processamento em tempo real.
8. b) Sharding divide dados em partes menores para armazenamento distribuído.
9. a) PCA reduz dimensionalidade identificando variáveis mais relevantes.
10. b) Algoritmos paralelos aumentam a escalabilidade e reduzem tempos de execução.

Mais conteúdos dessa disciplina