Prévia do material em texto
UNIVERSIDADE FEDERAL DO MARANHÃO – CAMPUS DE BALSAS
BACHARELADO INTERDISCIPLINAR EM CIÊNCIA E TECNOLOGIA
PROBABILIDADE E ESTATISTICA
Medidas de Tendência Central, Medidas de Variação ou Dispersão e Distribuição de Frequência
Maria Elaine Barbosa dos Santos
Eutima Klayre Pereira Nunes
Balsas – MA
02 de Maio de 2017
Maria Elaine Barbosa dos Santos
Eutima Klayre Pereira Nunes
Medidas de Tendência Central, Medidas de Variação ou Dispersão e Distribuição de Frequência
Este presente trabalho sobre medida de tendência central, variação e distribuição de frequência apresentado como parte dos requisitos para obtenção de nota na disciplina de Probabilidade e Estatística do curso BICT da UFMA – Campus de Balsas.
Prof.: Paulo Queiroz
Balsas – MA
02 de maio de 2017
SUMÁRIO
1 INTRODUÇÃO
4
2 DESENVOLVIMENTO
2.1 Medidas de Tendência Central
2.2 Medidas de Variação ou Dispersão
2.3 Distribuição de Frequência
3 CONCLUSÃO
8
1. INTRODUÇÃO
Estatística é o segmento da ciência encarregado pela coleta, organização e interpretação de dados experimentais e pela extrapolação dos resultados da amostra para a população. É importante ter conhecimento de alguns termos utilizados na estatística para amostragem de dados.
População é qualquer conjunto, que formam todo o universo de dados que se necessita. Por exemplo, se em uma organização o diretor desejar saber se os funcionários estão contentes com os privilégios concedidos, a população de estudo são todos os funcionários dessa organização. Note que a concepção de população necessita do objetivo do estudo.
Amostra equivale a uma associação representativa da população. Por exemplo, uma emissora de televisão tem o interesse de saber como está sua audiência com os telespectadores da cidade nos canais que eles transmitem. Sabemos que não é possível perguntar a todos as pessoas que assistem a essa emissora qual canal eles preferem. Então procuramos uma amostra dessa população, isto significa, perguntar somente a alguns telespectadores qual canal eles optam em assistir.
No momento em que se faz uma pesquisa, existem algumas características de interesse na população. Por exemplo, se queremos estudar o índice de massa corporal (IMC) de alunos dos da universidade Federal do Maranhão da cidade de Balsas, usaremos uma amostra dessa população, e consideraremos a altura e o peso de cada aluno, já que o IMC é obtido como uma divisão entre o peso e o quadrado da altura do aluno. Nesse caso, o peso e a altura desses alunos são as variáveis de interesse.
Uma variável pode ser considerada, de acordo com os dados, em quantitativa ou qualitativa. Variável quantitativa é a que mede quantidade, por exemplo, idade, altura, preço, quantidade de vendas etc. Já a variável qualitativa é a que mede uma qualidade do indivíduo e pode ser separada em grupos, por exemplo, sexo: masculino ou feminino; nível de escolaridade: nível fundamental, médio ou superior; satisfação: baixa, média, alta e assim por diante. Em cada classe dessas variáveis podemos ainda realizar mais uma divisão, das variáveis quantitativas em quantitativa discreta ou quantitativa contínua. Uma variável quantitativa contínua é a que exprime uma medida como um valor real, por exemplo, peso e altura. Uma variável quantitativa discreta exprime o valor de uma contagem, por exemplo, idade, quantidade de cadeiras numa casa, quantidade de clínicas de uma cidade. Referente às variáveis qualitativas pode conceituar a classe das variáveis qualitativas nominais e das variáveis qualitativas ordinais. A variável qualitativa ordinal é a que dividi os indivíduos em classes com uma determinada ordem, por exemplo, nível de escolaridade: fundamental, médio e superior. Claramente, existe uma correlação de ordem nessas classes. Quanto à variável qualitativa nominal, dividi os indivíduos em classes, mas não é provável determinar uma ordem.
A tendência central ou medida de tendência central é um valor central para uma distribuição de probabilidade que proporciona medidas tendo potencial de representar o procedimento dos elementos de uma série, possibilitando estabelecer se um valor está entre o maior ou menor valor de uma série. Essas medidas podem ser aplicadas em dados unidimensionais.
Podem ser definidos os conceitos de média, mediana moda e ponto médio.
Média é a soma de todas as medidas dividida pelo número de observações no conjunto de dados, ou seja, a média aritmética de um conjunto de dados é o valor obtido pela soma de todos os elementos do conjunto e dividindo a soma pelo número total de elementos.
Mediana é o componente que abrange o posicionamento central de uma série de dados. Para encontrá-la os em ordem crescente ou decrescente; se a série obtiver um número ímpar de dados o valor que ocupar o meio da série se chamará mediana; se obtiver um número par de dados deve-se extrair a média aritmética dos dois valores centrais, uma vez que, o valor correspondente a mediana acha-se entre eles. A mediana e a moda são as únicas medidas de tendência central que podem ser usadas para nível de medição.
A moda é o valor que acontece com maior ocorrência em uma série de dados. Pode ser identificada apenas observando-se a série nos casos de dados não agrupados. Quando a série possuir dois valores com a mesma frequência máxima, cada um deles é uma moda, e o conjunto diz-se bimodal. Se mais de dois valores ocorrerem com a mesma frequência máxima, o conjunto é multimodal. Quando nenhum valor é repetido, o conjunto não tem moda. Essa é a única medida de tendência central que pode ser usada com dados nominais, os quais têm atribuições de categoria puramente qualitativa.
O ponto médio é o valor que está no meio entre o maior e o menor valor da série de dados. Este é o ponto de equilíbrio de um segmento de reta. Podemos conceituar o ponto médio como o ponto que divide o segmento de reta exatamente no meio tendo dois novos segmentos iguais.
A medidas de variação ou dispersão é a maior ou menor modalização dos valores de uma variável em torno de um valor de tendência central a partir de ponto de comparação. Para caracterizar os valores de uma dada variável, ressaltando a menor ou maior dispersão ou variabilidade entre esses valores e a sua medida de dispersão, a estatística recorre às medidas de dispersão ou de variabilidade.
Através do conceito de variação ou dispersão, pode-se conceituar: Amplitude Total, Desvio padrão, Variação e Assimetria.
Amplitude total é a mais simples das medidas de dispersão anotada por “h”, e definida como sendo a diferença entre os valores extremos do conjunto, isto é: h = Xmax – Xmin. Amplitude total é diretamente proporcional à dispersão ou variabilidade.
Desvio Padrão é a média aritmética do valor absoluto dos desvios de cada elemento em relação à média.
· Desvio padrão amostral: é uma medida de dispersão dos dados relativamente à média, que se obtém tomando a raiz quadrada da variância amostral.
· Desvio populacional é uma medida de dispersão da variável relativamente ao seu valor médio, que se obtém tomando a raiz quadrada da variância populacional.
A Variância é uma medida estatística da dispersão dos dados em torno da média de um conjunto de dados, é o quadrado do desvio – padrão.
A Assimetria é determinar-se-á a grandeza e o Sinal de Assimetria de uma Distribuição ou de uma Curva através:
a) da relação entre as Medidas de Tendência Central e o Desvio-Padrão;
b) da relação entre os Quartis e a Mediana.
Os graus das curvas são simétrica, Assimetria Positiva e Assimetria Negativa. Que compreende a classificação quando:
A= 0 Distribuição simétrica;
A>0 Distribuição Assimétrica positiva;
A<0 Distribuição Assimétrica Negativa.
Curtose é o menor ou maior grau de "achatamento” da Distribuição ou Curva de Frequência considerada em relação a uma Curva Normal representativa da Distribuição. Tipos de curtose são:
a) Se o valor de K=0,263 então o Grau de "achatamento" ou Grau de Curtose é igual ao da Curva Normal (simétrica) de mesma área denomina-sea este tipo de Curva MESOCÚRTICA.
b) Se K > 0,263 a distribuição é mais achatada do que a Curva Normal de mesma área e diz que é uma Curva PLATICÚRTICA.
c) Se K < 0,263 a distribuição é menos achatada (mais afilada) do que a Curva Normal de mesma área, denominando-se de Curva LEPTOCÚRTICA.
A Distribuição de frequência é definida por um arranjo de valores que uma ou mais variáveis tomam em uma amostra. Cada entrada na tabela contém a frequência ou a contagem de ocorrências de valores dentro de um grupo ou intervalo específico, e deste modo, a tabela resume a distribuição dos valores da amostra.
Tabela de frequência uni variada é um esquema de tabulação diferente agrega valores em caixas de forma que cada classe engloba uma gama de valores.
Alguns conceitos que necessita para aplicamos a distribuição de frequência:
· População: conjunto de pessoas ou objetos com uma característica comum;
· Amostra: qualquer subconjunto de uma população;
· Variável randômica: é quando uma variável pode ter resultados ou valores que tendem a mudar de uma observação para outra devido a fatores de chance de ocorrer;
· Variável discreta: é uma variável Xi é denominada discreta, quando entre dois de seus valores inteiros não atingirem os valores intermediários;
· Variável contínua: quando entre dois dos números inteiros atingirem os valores intermediários;
· Dados Brutos: denomina-se após a crítica de seus valores. Na crítica de valores são desprezados os dados que destoam da maioria;
· Rol: é a ordenação dos dados brutos. Pode ser ordem crescente ou decrescente de seus valores;
· Amplitude total ou da amostra: é dada pela diferença entre o maior e o menor valor do rol;
· Frequência Absoluta: indicam quantas vezes cada elemento aparece no rol;
· Tabelas de variável discreta: é a representação da variável discreta através de uma distribuição de frequência. Cada variável com sua respectiva frequência simples ou absoluta.
· Tabela de variável contínua: são valores que representam uma classe;
Ponto Médio: é dada através da média aritmética dos limites de classe;
MEDIDAS DE TENDÊNCIA CENTRAL
Exemplos de Estatística e Probabilidade em Engenharia
Média
A tabela abaixo informa a cotação do dólar (moeda estrangeira) durante uma determinada semana. De acordo com a tabela informática, determine o valor médio da moeda estrangeira na semana, sempre lembrando que esse valor é cotado de acordo com a moeda nacional: o Real.
Segunda – feira
Terça – Feira
Quarta Feira
Quinta Feira
Sexta – feira
R$ 2,20
R$ 2,30
R$ 2,38
R$ 2,10
R$ 2,25
O dólar obteve o valor médio de R$ 2,25 na semana especializada.
MÉDIANA
Considere o conjunto de dados abaixo, referentes ao salário médio dos funcionários de uma empresa em reais.
Salário: 1500, 1300, 1200, 1250, 1600, 1100, 1450, 1210, 1980
Observe que nesse conjunto de dados temos 9 elementos, 9 salários. Primeiro devemos montar o rol:
Rol = {1100, 1200, 1210, 1250, 1300, 1450, 1500, 1600, 1980}
Quando o número de elementos do conjunto de dados for ímpar, a mediana é o valor que divide o conjunto ao meio, portanto Md = 1300. Observe que à esquerda e à direita de 1300 existem 4 elementos.
Considere o conjunto de dados abaixo, referente ao salário médio dos funcionários de uma empresa.
Salário: 1500, 1300, 1200, 1250, 1600, 1100, 1450, 1210, 1980, 1420
Rol = {1100, 1200, 1210, 1250, 1300, 1420, 1450, 1500, 1600, 1980}
Nesse conjunto existem 10 elementos. Nesse caso a mediana será a média aritmética dos dois valores centrais. Note que tanto à direita como à esquerda dos dois valores centrais há 4 elementos. Assim,
MODA
Por exemplo, a amostra {1, 2, 3, 5, 5, 6, 7} tem moda 5. Amostras que possuem duas modas são chamadas bimodais. Por exemplo, a amostra {1, 2, 3, 5, 5, 6, 6} tem modas 5 e 6. Amostras que possuem várias modas são chamadas multimodais. Por exemplo, a amostra {1, 2 3, 5, 5, 6, 6, 7, 7} tem modas 5, 6 e 7. Amostras que não possuem moda são chamadas amodais. Por exemplo, a amostra {1, 3, 2, 5, 7, 6} não tem moda.
DESVIO PADRÃO:
Para calcularmos o desvio padrão devemos primeiramente calcular a média , isto é:
Agora vamos subtrair de cada valor, elevar os resultados ao quadrado e somá-los. Então dividimos o total dos quadrados pelo número de valores menos 1, ou seja, por (n-1) e extraímos a raiz quadrada:
65-67,875 = -2,875
(-2,875)2 = 8,265625
72-67,875 = 4,125
(4,125)2 = 17,015625
70-67,875 = 2,125
(2,125)2 = 4,515625
72-67,875 = 4,125
(4,125)2 = 17,015625
60-67,875 = -7,875
(-7,875)2 = 62,015625
67-67,875 = -0,875
(-0,875)2 = 0,765625
69-67,875 = 1,125
(1,125)2 = 1,265625
68-67,875 = 0,125
(0,125)2 = 0,015625
Total = 110,875
Portanto, o desvio padrão é 3,97986. (ESSE ESTA IGUAL AO EXEMPLO NO DESENVOLVIMENTO)
2. DESENVOLVIMENTO
A utilização de estatística na engenharia é usada no controle de processos de produtos e serviços. Mas também é aplicada, por exemplo, no planejamento de novas recursos de produção, vendas, etc. Existe uma preocupação da Estatística aplicada à Engenharia que se localiza no Controle de Processos e Manufatura, analisando distribuições e lotes para padrões de qualidade nos produtos. Por exemplo, para a Engenharia civil, há certa estatística na Análise Sensorial, para observar a satisfação de um serviço prestado a uma empresa. A estatística é usada na produção para conduzir a estabilidade dos processos, esta estabilidade é analisada por cartas de acompanhamento conhecida como cartas de controle estatístico de processo. Utiliza-se estatística em calibração de equipamentos de medição e na análise dos mesmos também na verificação da condição de uso dos meios de medição.
2.1 Medidas de Tendência Central
Média
A tabela abaixo informa a cotação do dólar (moeda estrangeira) durante uma determinada semana. De acordo com a tabela informática, determine o valor médio da moeda estrangeira na semana, sempre lembrando que esse valor é cotado de acordo com a moeda nacional: o Real.
Segunda – feira
Terça – Feira
Quarta Feira
Quinta Feira
Sexta – feira
R$ 2,20
R$ 2,30
R$ 2,38
R$ 2,10
R$ 2,25
O dólar obteve o valor médio de R$ 2,25 na semana especializada.
MÉDIANA
Considere o conjunto de dados abaixo, referentes ao salário médio dos funcionários de uma empresa em reais.
Salário: 1500 1300 1200 1250 1600 1100 1450 1210 1980
Observe que nesse conjunto de dados temos 9 elementos, 9 salários. Primeiro devemos montar o rol:
Rol = {1100, 1200, 1210, 1250, 1300, 1450, 1500, 1600, 1980}
Quando o número de elementos do conjunto de dados for ímpar, a mediana é o valor que divide o conjunto ao meio, portanto Md = 1300. Observe que à esquerda e à direita de 1300 existem 4 elementos.
Considere o conjunto de dados abaixo, referente ao salário médio dos funcionários de uma empresa.
Salário: 1500 1300 1200 1250 1600 1100 1450 1210 1980 1420
Rol = {1100, 1200, 1210, 1250, 1300, 1420, 1450, 1500, 1600, 1980}
Nesse conjunto existem 10 elementos. Nesse caso a mediana será a média aritmética dos dois valores centrais. Note que tanto à direita como à esquerda dos dois valores centrais há 4 elementos. Assim,
MODA
Por exemplo, a amostra {1, 2, 3, 5, 5, 6, 7} tem moda 5. Amostras que possuem duas modas são chamadas bimodais. Por exemplo, a amostra {1, 2, 3, 5, 5, 6, 6} tem modas 5 e 6. Amostras que possuem várias modas são chamadas multimodais. Por exemplo, a amostra {1, 2 3, 5, 5, 6, 6, 7, 7} tem modas 5, 6 e 7. Amostras que não possuem moda são chamadas amodais. Por exemplo, a amostra {1, 3, 2, 5, 7, 6} não tem moda.
2.2 Medidas de Variação ou Dispersão
DESVIO PADRÃO:
Para calcularmos o desvio padrão devemos primeiramente calcular a média , isto é:
Agora vamos subtrair de cada valor, elevar os resultados ao quadrado e somá-los. Então dividimos o total dos quadrados pelo número de valores menos 1, ou seja, por (n-1) e extraímos a raiz quadrada:
65-67,875 = -2,875
(-2,875)2 = 8,265625
72-67,875 = 4,125
(4,125)2 = 17,015625
70-67,875 = 2,125
(2,125)2 = 4,515625
72-67,875 = 4,125
(4,125)2 = 17,015625
60-67,875 = -7,875(-7,875)2 = 62,015625
67-67,875 = -0,875
(-0,875)2 = 0,765625
69-67,875 = 1,125
(1,125)2 = 1,265625
68-67,875 = 0,125
(0,125)2 = 0,015625
Total = 110,875
Portanto, o desvio padrão é 3,97986.
DISTRIBUIÇÃO DE FREQUENCIA
Representação dos Dados (Amostrais ou Populacionais) Dados brutos: são aqueles que não foram numericamente organizados, ou seja, estão na forma com que foram coletados.
Por exemplo: Números de filhos de um grupo de 50 casais
2
3
0
2
1
1
1
3
2
5
6
1
1
4
0
1
5
6
0
2
1
4
1
3
1
7
6
2
0
1
3
1
3
5
7
1
3
1
1
0
3
0
4
1
2
2
1
2
3
2
Rol: é a organização dos dados brutos em ordem de grandeza crescente ou decrescente.
Por exemplo: Números de filhos de um grupo de 50 casais
0
0
0
0
0
0
1
1
1
1
1
1
1
1
1
1
1
1
1
1
1
1
2
2
2
2
2
2
2
2
2
3
3
3
3
3
3
3
3
4
4
4
5
5
5
6
6
6
7
7
Distribuição de frequência sem intervalos de classe: É a simples condensação dos dados conforme as repetições de seus valores. Para um rol de tamanho razoável esta distribuição de frequência é inconveniente, já que exige muito espaço. Veja exemplo abaixo:
Número de pontos obtidos pelos alunos na disciplina-X, colégio-Y, em 2007.
Pontos
Número de Alunos
4
8
5
10
6
7
7
5
8
8
9
5
10
7
Distribuição de frequência com intervalos de classe: Quando o tamanho da amostra é elevado e o número de variáveis é muito grande, é mais racional efetuar o agrupamento dos valores em vários intervalos de classe.
Veja o Exemplo:
Peso(kg)
Número de Alunos
40-50
30
50-60
25
60-70
13
70-80
12
80-90
0
Vamos, agora, analisar um exemplo prático de coleta de dados e organização destes valores em tabelas de frequências com intervalos de classe.
Dados Brutos: Taxas municipais de urbanização (em percentual) no Estado X –2005
8
24
46
13
38
54
44
20
17
14
18
15
30
24
20
8
24
18
9
10
38
79
15
62
23
13
62
18
8
22
11
17
9
35
23
22
37
36
8
13
10
6
92
16
15
23
37
36
8
13
44
17
9
30
26
18
37
43
14
9
28
41
42
35
35
42
71
50
52
17
19
7
28
23
29
29
58
77
72
34
12
40
25
7
32
34
22
7
44
15
9
16
31
30
Rol: Taxas municipais de urbanização (em percentual) no Estado X – 2005
6
6
7
7
7
8
8
8
8
9
9
9
9
9
10
10
11
12
13
13
13
13
14
14
14
15
15
15
15
16
16
17
17
17
17
18
18
18
18
19
20
20
22
22
22
23
23
23
23
24
24
24
25
26
28
28
29
29
30
30
30
31
32
34
34
34
35
35
35
36
37
37
38
38
40
41
42
42
43
44
44
44
46
50
52
54
58
62
62
71
72
77
79
92
Distribuição de frequências para dados agrupados em classes:
Taxas (em %)
Número de Municípios (f i)
6-16
29
16-26
24
26-36
16
36-46
13
46-56
4
56-66
3
66-76
2
76-86
2
86-966
1
Total (∑)
94
Observação:
Representaremos o somatório pela letra grega maiúscula sigma (∑) elementos de uma distribuição de Frequência
Classe: são intervalos de variação da variável. As classes são representadas simbolicamente por i, sendo i = 1, 2, 3, . . ., k (onde k é o número total de classes da distribuição).
Pelo exemplo prático anterior o intervalo 16 - 26 define a segunda classe (i = 2).
A distribuição é formada por nove classes, podemos afirmar que i = 9.
3. CONCLUSÃO
Perante as pesquisas feitas nota-se que a estatística tem um papel de fundamental importância na engenharia de um modo em geral. Essa impotência não se deve apenas por que precisa-se analisar dados que apareça nessa área, nesse sentido terá uma noção bem clara das aplicações práticas desse conhecimento na engenharia.
A estatística pode ser aplicado a engenharia de diversas formas e em diversas áreas, para melhorar o projeto de um produto, aumentar a confiabilidade e qualidade de um processo de produção. Na engenharia civil, por exemplo, poderá ser definido o risco de catástrofe ambientais, antecipar a resistência de materiais. Na engenharia mecânica é usado para minimizar o custo de produção de um produto e, ao mesmo tempo, manter sua confiabilidade. Por meio de uma análise estatística de falhas, é possível conseguir um melhor design de produto.
Percebe-se que dentro desses estudos de estatística existem diversas outras definições muito importante para a engenharia. Uma delas é a medida de tendência central, onde usa-se bastante a distribuição de probabilidade, na resolução de problemas variacionais, como no senso de cálculos de variações, por exemplo, que visa minimizar a variação a partir do centro. Essa tendência central analisa as adequações das medidas de tendência de pesquisa (média, mediana e moda) a natureza dos dados e relaciona-las a intepretação de diagramas.
Nota-se que raramente uma única medida é suficiente para descrever de modo satisfatório um conjunto de dados. Um caso a ser tomado como exemplo é a média aritmética, que é uma medida de locação largamente empregada. Percebeu-se que as medidas de dispersão são as medidas que mostram o grau de concentração os dados em torno da média tendo como as principais variância, desvio padrão e coeficiente de variação.
Um conjunto de observações de certo fenômeno, não estando adequadamente organizado, fornece pouca informação de interesse ao pesquisador e ao leitor. Para uma visão rápida e global do fenômeno em estudo é preciso que os dados estejam organizados. Uma das formas de se fazer a organização dos dados coletados em uma pesquisa é através das distribuições de frequência. Nota-se que a distribuição de frequência é muito utilizado em um método de grupamento de dados em classe, ou intervalos, de tal forma que se determina o número cada classe. Isso proporciona uma forma de visualizar um conjunto de números sem precisar levar em conta os números individuais, e pode ter grande utilidade quando precisamos lidar com grande quantidade de dados.
Todos os exemplos feitos com dados, gráficos, tabelas, utilizando formulas de estatísticas nota –se a importância na organizações de informações para serem aplicadas a determinados resultados. Com todas essas medidas e distribuições estudadas torna-se mais fácil saber lidar com determinada situação dentro da área de estudo. Contatou-se a importância desses estudos na engenharia sendo, por isso, umas das ferramentas mais utilizadas por engenheiros.
4. REFERÊNCIAS
https://pt.wikipedia.org/wiki/Estat%C3%ADstica_aplicada_%C3%A0_engenha
https://unitedstatisticians.com/blog/estatistica-na-engenharia/