Prévia do material em texto
PERGUNTAS As técnicas de clusterização são consideradas técnicas de aprendizado não supervisionado. Selecione, dentre as alternativas a seguir, aquela que identifica CORRETAMENTE o porquê são consideradas dessa forma. Devido ao fato de que não há dados rotulados nem expectativa sobre as possibilidades de rótulos de saída. Na clusterização, as medidas são separadas, conceitualmente, em medidas de similaridade e medidas de dissimilaridade. Sobre essa diferença, podemos afirmar, CORRETAMENTE, que: Similaridade indica a proximidade para atributos não numéricos, ou numéricos categóricos, em que o conceito de distância não se aplica. Existem diferentes abordagens de sistemas de recomendação. É CORRETO afirmar que os sistemas de recomendação baseados em filtros colaborativos são assim chamados porque: utilizam as informações das interações e avaliações realizadas pelos clientes sobre os itens para definir a similaridade entre diferentes itens da base de dados. Quanto mais similares as interações, mais provável o interesse do cliente sobre a recomendação. Os algoritmos de clusterização de dados podem ser classificados de acordo com a abordagem utilizada na definição dos clusters. Nesta unidade, aprendemos várias dessas abordagens: métodos baseados em particionamento, em densidade, em base em grafos, em métodos hierárquicos e em modelos. Selecione, dentre as alternativas a seguir, aquelas que identificam, CORRETAMENTE, as características dos métodos estudados. Os métodos baseados em densidade não dependem de um número fixo de clusters. Eles buscam regiões de maior densidade de amostras para encontrar os agrupamentos e as regiões de baixa densidade para definir as suas fronteiras. ✔ Os métodos hierárquicos permitem uma abordagem aglomerativa (agrupando amostras aos pares até que todas as amostras façam parte de um único grupo) e uma abordagem divisiva (dividindo todas as amostras a partir de um único cluster). ✔ Os métodos baseados em modelos utilizam outras técnicas de aprendizado de máquina para construir modelos que representam os dados e permitem a geração de superfícies de decisão que determinam os limites de cada cluster. ✔ Conceitualmente, a clusterização baseada em particionamento é o processo de agrupar amostras por meio das similaridades ou dissimilaridades entre elas. Dessa forma, entender o significado dessa tarefa é essencial para compreender o próprio resultado da clusterização. Selecione, dentre as alternativas a seguir, aquelas que identificam, CORRETAMENTE, os objetivos da clusterização. Maximizar a similaridade entre elementos de clusters distintos. ✔ Maximizar a similaridade entre elementos de um mesmo cluster. ✔ A Análise de Regressão é uma técnica muito utilizada por diversas áreas do conhecimento, como podemos acompanhar durante esta unidade. Ela é um conjunto de ferramentas que auxilia na previsão e nas descobertas de tendências. Assim, é CORRETO defini-la como: Um conjunto de técnicas voltadas para a investigação da correlação entre duas ou mais variáveis para conseguir, com base no valor de uma, prever o valor da outra. A função de custo é um item indispensável à Análise de Regressão e pode se materializar em diversas fórmulas, como MSE ou MAE, dependendo das características do problema que se deseja resolver. Seu propósito pode ser resumido CORRETAMENTE como: Determinar como o erro de previsão sobre cada amostra de um conjunto de dados é utilizado para expressar a qualidade do ajuste do modelo matemático sobre os dados. O Método dos Mínimos Quadrados (MMQ) é uma das mais populares técnicas de regressão. Matematicamente, ele busca minimizar o valor de uma função de custo. Contudo, possui premissas à sua utilização que, quando não respeitadas, podem apresentar viés ao modelo. Identifique, entre as alternativas a seguir, aquelas que apresentam, CORRETAMENTE, premissas do MMQ: A relação entre a variável resposta e os preditores deve ser linear. Deve ser utilizado somente em dados que o erro apresenta distribuição normal. Para realizar essa busca de forma automática, podemos usar o algoritmo Método dos Gradientes Descendentes. Ele é uma ferramenta eficaz para a busca do erro mínimo. O algoritmo do Método dos Gradientes Descendentes pode ser descrito como: Busca iterativa. A cada iteração, varia o conjunto de parâmetros do modelo, avalia a redução por meio de uma função de custo, opta pelo vizinho que apresenta menor derivada e repete o processo até que não haja uma redução estatisticamente relevante na função de custo. A regularização é uma alternativa interessante para lidar com condições adversas de um problema de regressão. Ela aplica uma penalidade sobre a função de custo para evitar o overfitting do modelo. Contudo, a regularização é indicada somente em algumas situações. Assinale as opções que indicam, CORRETAMENTE, situações em que regularização é indicada: Quando a relação entre a quantidade de amostras e o número de variáveis é baixa, ou seja, uma quantidade muito reduzida de dados. A utilização de ensembles é uma forma de melhorar o desempenho do modelo final. Podemos afirmar que as arquiteturas paralelas de ensembles baseiam-se na premissa de que: preditores “fracos” treinados sobre dados diferentes, quando combinados, criam preditores mais precisos e robustos. Uma das técnicas de ensemble combina preditores em série, em que cada preditor é treinado com amostras selecionadas da base de treinamento, dando-se preferência (atribuindo-se pesos) às amostras mal classificadas pelos preditores anteriores. Essa técnica é chamada de: BOOSTING (O Boosting é uma técnica em série em que vários preditores são organizados em sequência, e o treinamento de cada um é ponderado pelos erros de classificação do seu anterior) O viés e a variância em métodos ensemble O trade-off do viés e da variância de um preditor é um problema que podemos abordar por meio do uso de ensembles. Sobre o comportamento do viés e da variância em ensembles, podemos afirmar que: o Bagging visa reduzir a susceptibilidade do modelo aos dados escolhidos para o treinamento, reduzindo a variância. O Q-learning é um método de aprendizado por reforço que utiliza o Processo de Decisão de Markov como base para seu processo de aprendizagem. Sobre esse algoritmo, assinale as alternativas corretas. Utiliza a Q-table para manter as informações das recompensas e penalidades de cada par estado/ação. É capaz de gerar um Q-value para um estado futuro e, assim, decidir qual é a melhor próxima ação. Resposta Correta: - Utiliza a Q-table para manter as informações das recompensas e penalidades de cada par estado/ação. Resposta correta. O Q-learning utiliza o Q-table para manter as informações das recompensas e penalidades de cada par estado/ação. - É capaz de gerar um Q-value para um estado futuro e, assim, decidir qual é a melhor próxima ação. Resposta correta. O Q-learning é capaz de gerar um Q-value para um estado futuro e, assim, decidir qual é a melhor próxima ação. As redes neurais são flexíveis e modulares. A forma como as organizamos e o tipo dos neurônios define a forma de aprendizado e sua topologia. Sobre as topologias apresentadas nessa unidade, assinale as alternativas corretas. As redes feedfoward estabelecem o fluxo de aprendizado da camada de entrada para a camada de saída. As redes recorrentes permitem armazenar valores em neurônios, assemelhando-se a uma memória. Resposta Correta: - As redes feedfoward estabelecem o fluxo de aprendizado da camada de entrada para a camada de saída. Resposta correta. As redes feedfoward estabelecem um fluxo direcionado de aprendizado, da camada de entrada para a camada de saída. - As redes recorrentes permitem armazenar valores em neurônios, assemelhando-se a uma memória. Resposta correta. Uma das vantagens das redes recorrentes é a capacidade de armazenar valores, simulando uma memória.