Prévia do material em texto
Prova Impressa GABARITO | Avaliação Final (Objetiva) - Individual (Cod.:1022963) 4,00 99922103 10 8/2 8,00 A classificação é um processo inerente ao comportamento humano, manifestando-se em diversas esferas sociais e cognitivas. Os indivíduos organizam informações e pessoas em categorias distintas, resultando em diferentes formas de tratamento. Essa segmentação influencia a construção de padrões de comportamento em variados contextos, a definição de classes sociais e a perpetuação de estereótipos, que podem impactar as interações e relações interpessoais. Dessa forma, a categorização desempenha um papel essencial na estruturação da sociedade e na tomada de decisões. Fonte: adaptado de: CARVALHO, José Mexia Crespo de. Logística. 3. ed. Lisboa: Edições Silabo, 2002. Sobre clustering supervisionado e clustering não supervisionado, assinale a alternativa correta: A Clustering não supervisionado requer que cada ponto de dado seja pré-classificado em uma categoria específica. B Clustering não supervisionado é utilizado para agrupar dados em clusters sem a necessidade de rótulos predefinidos. C Clustering supervisionado é usado quando há rótulos de classes disponíveis nos dados de treinamento. D Clustering supervisionado é usado para prever valores contínuos em um conjunto de dados. E Clustering não supervisionado é equivalente à regressão linear, pois ambos não necessitam de rótulos de dados. A escolha da medida de similaridade em análise de dados depende das características das variáveis 1 2 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 1 of 9 16/05/2025, 19:38 presentes na base. Para variáveis contínuas, são comumente utilizadas métricas como a distância Euclidiana, que mede a separação linear entre pontos; a distância Euclidiana Generalizada, que incorpora pesos nas dimensões; a distância de Mahalanobis, que considera a correlação entre variáveis; a distância de Minkowski, que generaliza diversas métricas; a distância Manhattan, baseada na soma das diferenças absolutas; e a distância Canberra, sensível a pequenas variações nos dados. Cada uma dessas medidas apresenta aplicações específicas conforme o contexto da análise. Fonte: adaptado de: EVERITT, B. Cluster Analysis. 5. ed. Hoboken: Wiley, 2011. Considerando as informações apresentadas no texto, analise as afirmativas a seguir: I. A ligação de Ward (Ward's linkage) minimiza o aumento da soma dos quadrados das distâncias dentro dos clusters quando eles são unidos. II. A ligação por centroide (centroid linkage) mede a similaridade entre dois clusters considerando a menor distância entre os centroides dos clusters. III. A ligação simples (single linkage) mede a similaridade entre dois clusters com base na menor distância entre um ponto em um cluster e um ponto no outro cluster. IV. A ligação composta (complete linkage) mede a similaridade entre dois clusters com base na maior distância entre um ponto em um cluster e um ponto no outro cluster. É correto o que se afirma em: A I, II, III e IV. B II e III, apenas. C II e IV, apenas. D I, III e IV, apenas. E I, apenas. A recomendação baseada em contexto é uma abordagem em sistemas de recomendação que leva em consideração informações contextuais sobre o usuário e o ambiente em que as recomendações serão aplicadas para fornecer sugestões mais relevantes e úteis. Isso inclui dados como localização geográfica, horário do dia, dispositivo utilizado, histórico de navegação do usuário e qualquer outra informação que possa influenciar a decisão de recomendação. Essa abordagem visa personalizar as recomendações de acordo com o contexto específico em que o usuário se encontra, 3 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 2 of 9 16/05/2025, 19:38 aumentando a probabilidade de sucesso e satisfação do usuário com o sistema. Fonte: adaptado de: ADOMAVICIUS, G.; TUZHILIN, A. Toward the next generation of recommender systems: A survey of the state-of-the-art and possible extensions. IEEE Transactions on Knowledge and Data Engineering, v. 17, n. 6, p. 734-749, 2005. Sobre os sistemas de recomendação baseados em contexto, analise as afirmativas a seguir: I. Os sistemas de recomendação baseados em contexto não levam em consideração o histórico de interações passadas do usuário com o sistema. II. Os sistemas de recomendação baseados em contexto são mais eficazes em ambientes estáticos, em que as condições contextuais não mudam com frequência. III. Os sistemas de recomendação baseados em contexto consideram informações sobre o ambiente em que as recomendações serão aplicadas, como localização geográfica, horário do dia, dispositivo utilizado e histórico de navegação do usuário. IV. Uma das vantagens dos sistemas de recomendação baseados em contexto é sua capacidade de fornecer recomendações mais precisas e personalizadas, levando em consideração as circunstâncias específicas em que as recomendações serão utilizadas. É correto o que se afirma em: A III e IV, apenas. B I, II e III, apenas. C II e III, apenas. D II, III e IV, apenas. E I e IV, apenas. Silhueta: foi proposta por Rousseeuw (1987) e determina a qualidade das soluções com base na proximidade entre os objetos de determinado grupo e na distância desses objetos ao grupo mais próximo. O índice silhueta é calculado para cada objeto, sendo possível identificar se o objeto está alocado ao grupo mais adequado. Esse índice combina as ideias de coesão e de separação. Os valores positivos de silhueta indicam que o objeto está bem localizado em seu grupo, enquanto valores negativos indicam que o objeto está mais próximo de outro(s) grupo(s). Fonte: adaptado de: ROUSSEEUW, P. J. Silhouettes: a graphical aid to the interpretation and 4 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 3 of 9 16/05/2025, 19:38 validation of cluster analysis. Journal of Computational and Applied Mathematics, v. 20, p. 53-65, 1987. Com base nas informações apresentadas, avalie as asserções a seguir e a relação proposta entre elas: I. O Índice de Silhouette mede a qualidade do clustering comparando a distância média entre os pontos dentro do mesmo cluster com a distância média entre os pontos do cluster mais próximo. PORQUE II. Um valor de Índice de Silhouette próximo de -1 indica que os pontos estão bem agrupados dentro dos clusters corretos. A respeito dessas asserções, assinale a opção correta: A As asserções I e II são falsas. B A asserção I é uma proposição verdadeira, e a II é uma proposição falsa. C As asserções I e II são verdadeiras, e a II é uma justificativa correta da I. D As asserções I e II são verdadeiras, mas a II não é uma justificativa correta da I. E A asserção I é uma proposição falsa, e a II é uma proposição verdadeira. A Conditional FP-tree é uma estrutura construída a partir da projeção de um item específico, reduzindo o tamanho do conjunto de dados e permitindo a mineração eficiente sem a necessidade de geração de candidatos. Ao reorganizar os dados de forma compacta e hierárquica, a Conditional FP-tree melhora o desempenho computacional, sendo particularmente vantajosa para conjuntos de dados volumosos. Fonte: adaptado de: HAN, J.; KAMBER, M.; PEI, J. Data Mining: Concepts and Techniques. 3. ed. San Francisco: Morgan Kaufmann, 2012. 744 p. Sobre a Conditional FP-tree, assinale a alternativa correta: A A Conditional FP-tree é uma estrutura de dados utilizada no algoritmo Apriori para representar os padrões frequentes. 5 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 4 of 9 16/05/2025, 19:38 B A Conditional FP-tree é utilizada no algoritmo K-Means para agrupar os dados em clusters com base em sua similaridade. C A Conditional FP-tree requer múltiplas passagens pelos dados para identificarpadrões frequentes, tornando-a menos eficiente que a FP-tree. D A Conditional FP-tree é uma estrutura de árvore balanceada que organiza os itens frequentes de acordo com sua frequência de ocorrência nos dados. E A Conditional FP-tree é uma versão modificada da FP-tree utilizada no algoritmo FP-Growth para melhorar a eficiência da mineração de padrões frequentes. O algoritmo FP-Growth, desenvolvido por Jiawei Han, Jian Pei e Yiwen Yin em 2000, surgiu como uma abordagem otimizada para a extração de padrões frequentes em bases de dados transacionais. Em contraste com o algoritmo Apriori, que depende da geração e verificação de conjuntos candidatos, o FP-Growth utiliza uma estrutura de árvore compacta (FP-tree), reduzindo significativamente a complexidade computacional e o consumo de memória. Fonte: adaptado de: HAN, J.; PEI, J.; YIN, Y. Mining frequent patterns without candidate generation. Proceedings of the 2000 ACM SIGMOD International Conference on Management of Data, p. 1-12, 2000. Sobre o algoritmo FP-Growth, assinale a alternativa correta: A O FP-Growth não utiliza uma estrutura de árvore para representar os padrões frequentes. B O FP-Growth é uma variante do algoritmo K-Means utilizado em análise de clusters. C O FP-Growth utiliza uma abordagem de geração explícita de todos os conjuntos de itens frequentes. D O FP-Growth é menos eficiente que o algoritmo Apriori em conjuntos de dados grandes e esparsos. E O FP-Growth é amplamente utilizado para identificar padrões frequentes em grandes conjuntos de dados transacionais. 6 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 5 of 9 16/05/2025, 19:38 Uma regra de associação é definida como a relação entre conjuntos de itens, conectando um item inicial, denominado item relacionado, a outro item consequente, chamado item pretendido. Essas regras são amplamente utilizadas na mineração de dados para identificar padrões e relações relevantes em bases de dados. Entre suas principais características destacam-se: (1) informações estatísticas sobre a frequência de ocorrência, que avaliam a relevância dos itens analisados; (2) confiança, que mensura a probabilidade de o item pretendido ocorrer dado o item relacionado; e (3) a importância da relação, que reflete o impacto dessa associação no contexto analisado. Fonte: adaptado de: HAN, J.; KAMBER, M.; PEI, J. Data Mining: Concepts and Techniques. 3. ed. Burlington: Morgan Kaufmann, 2011. Sobre Regras de Associação, assinale a alternativa correta: A Regras de associação são sempre úteis para prever comportamentos futuros com precisão. B A confiança indica a frequência relativa de uma associação em relação ao total de transações. C O suporte mede a probabilidade condicional de que a compra de um item seja seguida pela compra de outro item. D Regras de Associação são comumente usadas para análise de cestas de mercado e identificação de padrões de compra dos clientes. E Um lift igual a 1 indica uma associação positiva e relevante entre os itens. “A Matriz de Confusão é uma tabela que permite a visualização do desempenho de um modelo classificatório. Ela apresenta de forma detalhada o resultado da classificação, comparando as previsões do modelo com os valores reais dos dados. Desse modo, a partir dessa comparação, é possível identificar erros e acertos do modelo, ajudando a avaliar sua eficácia”. Fonte: CAMPOS, Renata. Matriz de Confusão: entenda para que serve esse tipo de tabela! Academia Tech, 2024. Disponível em: https://academiatech.blog.br/matriz-de-confusao/. Acesso em: 19 fev. 2025. Considerando o texto apresentado, analise as afirmativas a seguir: I. Na matriz de confusão, a diagonal principal representa os acertos, ou seja, as instâncias corretamente classificadas. 7 8 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 6 of 9 16/05/2025, 19:38 II. A matriz de confusão é apenas útil para modelos de clustering supervisionado, pois requer rótulos de classe para funcionar. III. A matriz de confusão pode ajudar a identificar quais clusters foram confundidos entre si, fornecendo insights sobre a qualidade do clustering. IV. A matriz de confusão pode ser usada para avaliar a precisão de um modelo de clustering ao comparar os clusters preditos com os rótulos reais de classe, se disponíveis. É correto o que se afirma em: A II e III, apenas. B II, III e IV, apenas. C I e II, apenas. D I, III e IV, apenas. E III e IV, apenas. A convicção de uma regra de associação Ri : X ⇒ Y é determinada pela razão entre o complemento do suporte do consequente da regra e o complemento da confiança de Ri. Esse indicador, assim como o lift, quantifica o grau de dependência entre os itens da regra, refletindo a força da relação condicional entre antecedente e consequente. A convicção assume valores superiores a 1 para regras com alta confiabilidade e tende a 1 quando a relação entre os itens é próxima da independência. Fonte: adaptado de: TAN, P.; STEINBACH, M.; KUMAR, V. Introduction to Data Mining. Boston: Pearson, 2005. Sobre o fator de convicção em Regras de Associação, analise as afirmativas a seguir: I. Um fator de convicção igual a 1 indica uma associação fraca e pouco significativa entre os itens da regra. II. O fator de convicção é uma métrica que indica a força da relação entre os itens antecedentes e consequentes de uma regra de associação. 9 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 7 of 9 16/05/2025, 19:38 III. O fator de convicção é uma métrica útil para avaliar a relevância e a importância das regras de associação, especialmente em cenários onde o suporte e a confiança podem ser enganosos. IV. O fator de convicção é uma métrica que mede a confiabilidade de uma regra de associação, indicando a proporção de vezes em que a parte consequente da regra ocorre sem a parte antecedente. É correto o que se afirma em: A II, III e IV, apenas. B I e IV, apenas. C II e III, apenas. D I, II e III, apenas. E III e IV, apenas. No algoritmo Apriori de Regras de Associação, o fator de lift é uma medida que indica o quão mais frequentemente o consequente ocorre em transações contendo o antecedente do que seria esperado se o antecedente e o consequente fossem independentes. É calculado como a razão entre a confiança da regra de associação e o suporte do consequente. Fonte: adaptado de: AGRAWAL, Rakesh et al. Fast algorithms for mining association rules. International Conference on Very Large Data Bases (VLDB), v. 1215, 1994. Sobre o conceito do fator Lift utilizado no algoritmo Apriori de Regras de Associação, assinale a alternativa correta: A O Lift mede a frequência absoluta de um conjunto de itens com relação ao número total de transações. B O Lift é uma medida da frequência com que um conjunto de itens aparece nas transações de um conjunto de dados C O Lift indica a proporção de vezes em que o consequente ocorre dado o antecedente, com relação à frequência esperada se o antecedente e o consequente fossem independentes. 10 Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 8 of 9 16/05/2025, 19:38 D O Lift é uma medida que indica a importância ou relevância de um conjunto de itens em relação a outros conjuntos. E O Lift é a probabilidade de ocorrer um determinado conjunto de itens em uma transação escolhida aleatoriamente do conjunto de dados. Avaliação Final (Objetiva) - Individual https://ava2.uniasselvi.com.br/subject/grades-and-tests/answer-book/... 9 of 9 16/05/2025, 19:38