Prévia do material em texto
Questão 1/12 - Inteligência Artificial Aplicada
Você foi contratado para o posto de cientista de dados, para compor uma equipe, que atualmente
já trabalha com dados, mas não possui experiência em aprendizagem de máquina. Um das suas
primeiras tarefas designadas, foi a tradução de trechos de códigos em linguagem relacionados ao
treinamento de modelos de aprendizagem de máquina.
Um dos trechos que a equipe gostaria de decifrar se refere ao seguinte código:
from sklearn.preprocessing import StandardScaler
X = carrega_dataset()
sc = StandardScaler()
sc.fit(X)
De acordo com os seus conhecimentos de aprendizagem de máquina, o código acima
executa:
Nota: 0.0Você não pontuou essa questão
A um processo de treinamento dos dados
Você assinalou essa alternativa (A)
B um processo de predição
C um processo de normalização dos dados
Justificativa:
O uso do método fit da classe StandardScaler executa um processo de
normalização de dados.
D um processo de expansão dos dados
E não faz nada e pode ser comentado
Questão 2/12 - Inteligência Artificial Aplicada
Como um iniciante na área de ciência de dados, você recebeu uma tarefa de agrupar um conjunto
de dados de pessoas, utilizando um algoritmo de agrupamento. Você executou a separação
utilizando um tutorial de internet, mas os resultados não foram satisfatórios. Buscando melhorar
os resultados você pediu ajuda a um expert que lhe disse apenas o seguinte: “Altere o seu k-
means para usar Manhattan ou Mahalanobis”.
De acordo com o seu conhecimento do algoritmo k-means, o expert estava sugerindo que
você:
Nota: 0.0Você não pontuou essa questão
A utilizasse outro algoritmo
B utilizasse métricas de distância diferentes
Justificativa:
Manhattan e Mahalanobis se referem a dois tipos distintos de métricas de
distância.
C utilizasse uma outra linguagem de programação
Você assinalou essa alternativa (C)
D utilizasse um método supervisionado
E utilizasse um framework
Questão 3/12 - Inteligência Artificial Aplicada
Durante o seu trabalho com redes neurais, buscando conseguir melhorar o seu modelo, você
pediu ajuda para amigo e lhe enviou o seu código de definição do modelo. O seu amigo, enviou
uma resposta dizendo o seguinte:
Altere o código
mlp_clf = MLPClassifier(warm_start=False, max_iter=100)
para
mlp_clf = MLPClassifier(warm_start=True, max_iter=100)
Utilizando os seus conhecimentos você prontamente identificou que o seu amigo estava
sugerindo:
Nota: 0.0Você não pontuou essa questão
A Cria um outro tipo de modelo
Você assinalou essa alternativa (A)
B Eliminar os pesos do seu modelo
C Inicializar os pesos do modelo
Justificativa:
O parâmetro warm_start faz com que os pesos do modelos sejam
inicializados, o que permite um processo de aprendizagem mais rápido.
D Estacionar os pesos do modelo
E Inverter os pesos do modelo
Questão 4/12 - Inteligência Artificial Aplicada
A figura acima mostra um modelo de árvore de decisão aplicado a um conjunto de dados.
Valendo-se dos seus conhecimentos de aprendizagem de máquina e de modelos de
árvores de decisão, podemos afirmar que o modelo foi treinado para classificar um total de
:
Nota: 10.0
A 4 classes
B 5 classes
C 1 classe
D 3 classes
E 2 classes
Você assinalou essa alternativa (E)
Você acertou!
Justificativa:
Analisando visualmente as representações das folhas da árvore de decisão
podemos ver que há duas classes distintas: gosta futebol e não gosta
futebol.
Questão 5/12 - Inteligência Artificial Aplicada
Um classificador bayesiano simples é treinado utilizando um conjunto de classes, C = {c1,c2 ,cn } e
um conjunto de instâncias de dados identificadas pelos vetores de características V = {v1, v2, …,
vn}.
Considerando as informações do texto acima e valendo-se do seu conhecimento sobre
teorema de Bayes, o classificador bayesiano, calcula a probabilidade de:
Nota: 0.0Você não pontuou essa questão
A uma instância ser da classe c, dado que o seu vetor de características
é v
Justificativa:
O classificador bayesiano executa uma classificação utilizando um
informação prévia e determinando qual o probabilidade de um instância
pertencer a uma classe, dado o seu vetor de características.
B uma instância ter o vetor de características v, dado que sua classe é c
C de uma instância ser da classe c, sem considerar o seu vetor de
características
Você assinalou essa alternativa (C)
D de uma instância possuir um vetor de características v
E de uma instância ser de uma classe que não consta em C
Questão 6/12 - Inteligência Artificial Aplicada
Você foi contratado para o posto de cientista de dados, para compor uma equipe, que atualmente
já trabalha com dados, mas não possui experiência em aprendizagem de máquina. Um das suas
primeiras tarefas designadas foi a avaliação de modelos treinados.
A imagem abaixo foi enviada junto com as informações do primeiro modelo que você deveria
avaliar.
Utilizando os seus conhecimentos de aprendizagem de máquina e as informações
fornecidas pelo gráfico, você informou que o modelo treinado:
Nota: 10.0
A deveria ser retreinado para predizer corretamente das as instâncias de
treino
B não tinha dados suficientes para treino
C deveria ser substituído por um kNN
D estava pronto para ser colocado em produção
Você assinalou essa alternativa (D)
Você acertou!
Justificativa:
Quando analisamos visualmente o desempenho de um modelo como
descrito no texto base, quanto mais alinhados com a reta diagonal, melhor
pode ser considerado o desempenho do modelo.
E apresentava um desempenho ruim e deveria ser retreinado
Questão 7/12 - Inteligência Artificial Aplicada
Você foi contratado para o posto de cientista de dados, para compor uma equipe, que atualmente
já trabalha com dados, mas não possui experiência em aprendizagem de máquina. Um das suas
primeiras tarefas designadas, foi a explanação de trechos de códigos em linguagem relacionados
ao treinamento de modelos de aprendizagem de máquina.
Um dos trechos que a equipe gostaria de compreender se refere a uma troca de códigos, onde o
código:
mlp_clf = MLPClassifier(warm_start=True, max_iter=500,
hidden_layer_sizes=(100,))
Foi substituído por:
mlp_clf = MLPClassifier(warm_start=True, max_iter=500,
hidden_layer_sizes=(50,50))
De acordo com os seus conhecimentos de aprendizagem de máquina, a substituição de
código foi feita para:
Nota: 0.0Você não pontuou essa questão
A alterar o tipo do classificador
B aumentar a quantidade de camadas da rede
Justificativa:
O parâmetro hidden_layer_sizes é uma tupla na qual cada elemento indica
a quantidade de neurônios em cada camada. Como o código apresentado o
número de elementos aumenta, a quantidade de camadas da rede também.
C diminuir a quantidade de camadas da rede
D estabilizar as camadas da rede
Você assinalou essa alternativa (D)
E aumentar o número de nós da rede
Questão 8/12 - Inteligência Artificial Aplicada
O chefe de uma equipe de ciência de dados recebeu o resultado do treinamento de um modelo
de aprendizagem de máquina, conforme a imagem acima e gostaria de obter mais informações
sobre os dados de treinamento.
De acordo com os seus conhecimentos de aprendizagem de máquina e utilizando apenas
as informações fornecidas pelo gráfico podemos concluir que:
Nota: 0.0Você não pontuou essa questão
A a base de testes possui 1845 instâncias
Justificativa:
Não se pode fazer inferências sobre a divisão da base de treino ou o seu
uso. Contudo, podemos somar o quantitativo de todas as instâncias preditas
o que nos dá o total de 1845instâncias.
B a base de testes possui 1720 instâncias
C a base de testes está dividida proporcionalmente
Você assinalou essa alternativa (C)
D não foi usada uma base de treino
E não há informações suficientes
Questão 9/12 - Inteligência Artificial Aplicada
Você necessita implementar um módulo de detecção de spam. Como o volume e a frequência de
e-mails muito alta, você precisa de um algoritmo de classificação que permita obter de forma
rápida a identificação se o e-mail recebida se trata ou não de um spam, ainda que alguns falsos
positivos possam ocorrer.
Usando os seus conhecimentos de aprendizagem de máquina, você optaria por um
algoritmo de:
Nota: 0.0Você não pontuou essa questão
A classificador bayesiano
Justificativa:
Modelos de agrupamento hierárquico e do tipo k-NN não são indicados, pois
eles comparam uma instância com todos as outras instâncias, não
respondendo de forma rápida. Métodos de redes neurais (MLP, CNN)
tendem a necessitar de muita memória e processamento, o que faz com que
demorem em dar uma resposta rápida. Já modelos do tipo classificador
bayesiano tendem a ser mais rápidos que os demais, ainda que a sua
precisão e taxa de erros seja maior que outros algoritmos.
B agrupamento hierárquico
C rede neural profunda
Você assinalou essa alternativa (C)
D k-NN
E rede neural do tipo CNN
Questão 10/12 - Inteligência Artificial Aplicada
“Dado categórico é o tipo de dado estatístico que consiste em variáveis categóricas ou em dados
que foram convertidos para esse formato, por exemplo, como dados agrupados. Mais
especificamente, os dados categóricos podem derivar de observações feitas de dados qualitativos
que são resumidos como contagens ou tabulações cruzadas, ou de observações de dados
quantitativos agrupados em determinados intervalos.”
Disponível em <https://pt.wikipedia.org/>.
Como um profissional da área de ciência de dados você sabe que variáveis categóricas
podem receber valores de 1 até o limite dos possíveis valores, ainda que a descrição ou
valor real do campo seja diferente do número que a representa. Assim, podemos considerar
como um exemplo de variável categórica :
Nota: 10.0
A o preço de um produto
B o tipo sanguíneo de uma pessoa
Você assinalou essa alternativa (B)
Você acertou!
Justificativa:
O tipo sanguíneo de uma pessoa pode assumir valores limitados, divididos
em 8 tipos diferentes (A+,A-,B+,B-,AB+, AB-, O+, O-) se consideramos o
fator Rh.
O preço de um produto é um valor contínuo.
A idade e o peso de uma pessoa é apesar de assumir valores limitados, não
pode ser considerado como categórico. Assim como nome também não
pode.
C a idade de uma pessoa
D o nome de uma pessoa
E o peso de uma pessoa
Questão 11/12 - Inteligência Artificial Aplicada (questão opcional)
Os modelos de aprendizagem de máquina, necessitam que os dados que lhe são fornecidos
sejam convertidos para valores numéricos. Assim, quando temos dados que necessitam de
conversão, pode-se utilizar um processo de categorizar uma variável. Representando cada
possível valor por um número distinto, e que, se possível represente uma relação de hierarquia
ou precedência entre os possíveis valores.
De acordo com os seus conhecimentos sobre dados categóricos e one-hot encoding,
podemos dizer que uma grande diferença entre representar uma variável categórica por
valores numéricos e one-hot encoding é:
Nota: 0.0Você não pontuou essa questão
A que a primeira representa melhor que segunda
B que a segunda representa melhor que a primeira
C a primeira serve apenas determinados tipos de valores
D a segunda serve apenas para determinados tipos de valores
E a segunda cria variáveis derivadas, aumentando o número de
atributos
Justificativa:
Quando convertemos um atributo para one-hot encode, passamos a ter
novos atributos que indicam a presença ou não daquele valor. Por exemplo,
se tivermos uma variável com dois valores possíveis, ela seria representada
como atributoN = 1 ou atributoN = 2. Quando temos a codificação one-hot
encode para a mesma variável, ela será feita da seguinte forma,
atributoN_valor1 = 0 ou atributoN_valor1 = 1, atributoN_valor2 = 0 ou
atributoN_valor2 = 1. Assim temos novas variáveis derivadas a partir dos
valores que a mesma pode assumir.
Questão 12/12 - Inteligência Artificial Aplicada (questão opcional)
Você necessita desenvolver um classificador bayesiano para detecção de spam baseado nas
palavras contidas nos e-mails recebidos. Para isso o classificador deverá utilizar o teorema de
Bayes, considerando as classes como spam e não-spam e o vetor de características como a
presença ou ausência de uma palavra, de acordo com a imagem acima.
Considerando do texto acima e valendo-se do seu conhecimento sobre classificação
bayesiana, o elemento P(?) será corretamente substituído por :
Nota: 0.0Você não pontuou essa questão
A P(não-spam | spam)
B P(spam)
C P(palavra)
D P(spam | não-spam)
E P(palavra | spam)
Justificativa:
Como o classificador bayesiano utiliza conhecimento prévio para fazer a
predição, nesse caso ele utilizará a informação da probabilidade de um
documento conter uma palavra, dado que ele é um spam, ou seja P(palavra
| spam).