Vista previa del material en texto
Guía de trabajo SPSS
Aná lisis de Correspondenciás Mu ltiples
Material de ayudantía
Estadística IV – 2012
Facultad de Ciencias Sociales – Universidad de Chile
Andrea Baeza, Carla Brega, Catalina Canals, Carolina Galleguillos
RESUMEN: Correspondencias Múltiples
El análisis de correspondencias múltiples es una técnica estadística para analizar la relación entre
categorías de variables cualitativas. A diferencia del análisis de correspondencia simple, este trabaja con
más de 2 variables, lo que permite incluir variables objetos, que son aquellas donde cada categoría tiene
frecuencia igual a 1 (como países o comunas).
Al igual que en el análisis de correspondencias simples, las relaciones entre las categorías de las
variables, se analizan a través de los mapas perceptuales, donde cada categoría es ubicada en un punto.
La distancia entre las distintas categorías nos permitirá analizar qué tan relacionadas están.
Usos:
Profundizar el análisis de la asociación entre variables cualitativas (nominales u ordinales)
Analizar la estructura de la relación entre categorías de variables
Identificar dimensiones que representen esquemas conceptuales de análisis
Corroborar dependencia entre dos variables cualitativas
Condiciones:
a) Cantidad de variables: más de 2.
b) Variables admitidas: nominales y ordinales. Si existen variables cuantitativas, éstas pueden
recodificarse a ordinales (Por ejemplo, “tendencia política de 1 a 7”, donde 1= extrema izquierda y 7=
extrema derecha, podemos tener 1,2 y 4= izquierda extrema o moderada, 4=centro, 5,6 y 7= derecha
moderada o extrema).
c) Relación entre las variables: de asociación según el estadígrafo chi2. Si no hay relación entre las
variables, no tiene sentido realizar un análisis de correspondencias.
EJERCICIO DE APLICACIÓN
0. DISPONER LA BASE DE DATOS
La base de datos utilizada para este ejercicio es parte de una encuesta sobre percepciones socio-
culturales en la población adulta (mayor de 18 años) en algunos distritos de España. La base consta de
1.200 casos, por tanto, es una muestra grande. Se trabajará con 3 variables.
La pregunta que guía este ejercicio es ¿Cómo se relacionan los distintos tramos etarios con los aspectos
que más les preocupan en su vida y aquellos con los que más se sienten satisfechos?
0.a. Variables a utilizar y Valores perdidos
Las variables que vamos a usar son:
*Tramos de edad (tedad): variable ordinal, cuyas categorías son:
{1, Jóvenes}
{2, Adultos jóvenes}
{3, Adultos}
{4, Adultos mayores}
*Preocupaciones: aspecto que más le preocupa (a1): variable nominal, cuyas categorías son:
{1, Su vida afectiva}
{2, El dinero}
{3, Armonía familiar}
{4, Su salud}
{9, NS/NR} Marcar como Valor Perdido
*Satisfacción: aspecto con que se siente más satisfecho (a2): variable nominal, cuyas categorías son:
{1, Tiempo libre}
{2, Casa en que vive}
{3, Calidad del medioambiente}
{4, Comprar lo que quiere}
{9, NS/NR} Marcar como Valor Perdido
O.b. Descriptivos
Analizar Estadísticos Descriptivos
Descriptivos
Ingresar variables
“Tramos de edad”
“Preocupaciones: aspectos que más le
preocupan”
“Satisfacción: aspecto con que se siente
más satisfecho”
Opciones
Media
Desviación Típica
Mínimo
Máximo
Lista de Variables
PEGAR
SINTAXIS Ejecutar
DATASET ACTIVATE Conjunto_de_datos1.
DESCRIPTIVES VARIABLES=tedad a1 a2
/STATISTICS=MEAN STDDEV MIN MAX.
1. ESTADÍSTICOS DESCRIPTIVOS
La tabla muestra los descriptivos para cada variable: Media, Desviación típica, Mínimo, Máximo y
Número de casos válidos.
Cómo se observa, hay la variable tramos de edad tiene 1200 casos; mientras que la variable referente a
los aspectos de mayor preocupación tiene 42 casos menos y la variable referente al aspecto de mayor
satisfacción tiene 55 casos menos. Esta disminución de casos se debe a los casos perdidos que
establecimos anteriormente (9=NS/NR).
A partir de esto, el número de casos válidos con el que trabajaremos será de 1.108, ya que excluye
según lista como se indica en la tabla (que no es significativamente distinto de los 1.200 casos de la
muestra total inicial).
Por lo demás, también podemos observar la media de cada variable, pero es difícil de interpretar dado
que estas no son variables cuantitativas. En cuanto a la desviación típica, podemos ver que la variable
tramos de edad, es la que presenta mayor dispersión, y la variable Satisfacción… es la que presenta
menos.
2. ANÁLISIS DE CORRESPONDENCIAS MÚLTIPLES
Analizar → Reducción de datos (o dimensiones, según la versión SPSS) → Escalamiento óptimo…
Nivel de escalamiento óptimo:
Todas las variables son nominales múltiples
Número de conjuntos de Variables:
Un conjunto
Análisis seleccionado: Análisis de correspondencias múltiple
→ DEFINIR
En la nueva ventana, tenemos que tomar decisiones referentes al Análisis propiamente tal:
Variables de análisis: Agregamos aquellas variables que nos interesa analizar sus relaciones.
Preocupaciones más importantes (a1)
Aspectos de mayor satisfacción (a2)
Tramos de edad (tedad)
Al agregar las variables de análisis aparece entre paréntesis un valor =1. Este indica el peso –
proporcional- asignado a cada variable. Es decir, en nuestro modelo se le otorgará igual peso
(importancia) a cada variable. Eventualmente, en “Definir ponderación de la variable” se le pueden
asignar distintos pesos a las variables según la importancia para el modelo, pero en este caso,
mantendremos todas las variables con peso =1.
Variables suplementarias: En esta sección se pueden agregar variables, que no serán parte del modelo,
pero que nos interesa que sean igualmente ubicadas en el mapa generado por este. En este caso no
ingresaremos variables suplementarias.
Variables de etiqueta: Si quisiéramos etiquetar a todos los casos, es decir, si quisiéramos utilizar una
variable objeto, la incluimos en este módulo. Sin embargo, esto solo es útil cuando se trabaja con pocos
casos.
Dimensiones de la solución: Aquí dejaremos el valor predeterminado 2, ya que la solución entregada en
un plano (2 dimensiones) es la más sencilla para interpretar los resultados.
*Discretizar: En este modulo podemos definir las categorías de cada variable. Esto se usa para
transofrmar variables continuas (cadena), en discretas. En nuestro caso no es necesario.
Continuar
Perdidos: Aquí se determina qué hacer con los valores perdidos. Hay tres opciones posibles:
1. Excluir casos perdidos; para las correlaciones
imputar tras cuentificación: Se trata de excluir a
los sujetos sólo en las variables en las que
presentan valores perdidos, imputando la moda
o un valor de categoría extra para el cálculo de
correlaciones entre variables.
2. Imputar valores perdidos: Rellenar los casos
perdidos con algun valor (moda u otra
categoria).
3. Excluir a los objetos con valores perdidos en
esta variable: Dejar fuera los sujetos con valores
perdidos.
Dejaremos la opcion predeterminada (1).
Continuar
Opciones
Objetos suplementarios: Se puede asignar una condición
de suplemetariedad a un individuo u objeto. Con ello
este es ignorado en la construcción del modelo. En este
caso no se ignorará ningun individuo/objeto.
Método de Normalización: Principal por variable.
Esta opción optimiza la asociación entre las variables, es
útil cuando el interés principal está en la correlación
entre las variables. Cuando se utilizan variables objeto,
se recomienda utilizar el método Simétrico. Este
distribuye la normalización entre variables y ojetos.
Criterios: El criterio de convergencia e iteraciones
máximas determinan hasta qué punto el programa debe intentar optimizar la solución. Dejamos las
opciones predeterminadas.
Convergencia: ,00001Iteraciones máximas: 100
Etiquetar gráficos con: Se puede optar por etiquetar según (1) etiquetas, (2) Nombres. Para el caso de la
etiqueta hay que determinar la longitud máxima. Dejamos las opciones predeterminadas.
Etiquetas de variable o de valor
Limite de longitud de etiqueta: 20
Dimensiones del gráfico: Cuando uno trabaja con
muchas dimensiones, se puede elegir gráficar una
menor cantidad de ellas. En este caso como
trabajamos con 2, no es necesario. Por tanto,
dejamos las opciones predeterminadas.
Mostrar todas las dimensiones de la solución
Continuar
Resultados
Tablas: Marcaremos todas las opciones menos
puntuaciones de los objetos (esto se utiliza para conocer
las coordenadas de las variables objeto; en nuestro caso
no utilizamos variables objeto por lo que no tendría
sentido pedir esta salida).
Medidas Discriminantes
Historial de iteración
Correlaciones de variables originales
Correlaciones de variables transformadas
Cuantificaciones y contribuciones de las categorías:
Indican las coordenadas de posicionamiento en el mapa
perceptual de las categorías y sus contribución a las
dimensiones. Incluímos aquí todas las variables.
Estadísticos descriptivos: Incluímos aquí todas las
variables.
Continuar
*Guardar: Esta ventana puede ser util cuando se quiere guardar información en la base de datos. En
este caso no guardaremos nada.
*Gráficos: Objetos. Se utiliza para gráficar las categorías de las variables objetos. En este caso no es
necesario.
Gráficos: Variable. En Gráficos de categorías conjuntas se pide el mapa de posicionamiento conjunto
de las categorías de las variables que participaron en la construcción del modelo. Este es la principal
herramienta de interpretación del mismo. Incluir aquí todas las variables.
Continuar
PEGAR
MULTIPLE CORRES VARIABLES=tedad a1 a2
/ANALYSIS=tedad(WEIGHT=1) a1(WEIGHT=1) a2(WEIGHT=1)
/MISSING=tedad(PASSIVE,MODEIMPU) a1(PASSIVE,MODEIMPU) a2(PASSIVE,MODEIMPU)
/DIMENSION=2
/NORMALIZATION=VPRINCIPAL
/MAXITER=100
/CRITITER=.00001
/PRINT=CORR DESCRIP(tedad a1 a2) HISTORY DISCRIM OCORR QUANT(tedad a1 a2)
/PLOT=OBJECT(20) JOINTCAT(tedad a1 a2) (20) DISCRIM (20).
→ Ejecutar
3. RESULTADOS
3.a. Resumen del procesamiento de casos
Resumen del procesamiento de los
casos
Casos activos válidos 1108
Casos activos con valores
perdidos
92
Casos suplementarios 0
Total 1200
Casos usados en el análisis 1200
La primera salida nos indica la cantidad de casos válidos (1108).
3.b. Estadísticos descriptivos
A continuación se presentan los estadísticos
descriptivos, que nos permiten conocer mejor las
características de la población y muestra, en
cuanto a los tramos de edad, hay alrededor de 300
casos para cada categoría.
En cuanto a las preocupaciones, hay 63 personas,
donde el aspecto de mayor preocupación es la vida
afectiva, casi 300 que se preocupan por el dinero, y
prácticamente la misma cantidad que se preocupa
por la armonía familiar, y 525 preocupado por su
salud.
Finalmente, en cuanto a la satisfacción, la mayor
parte de las personas, están más satisfechas con la
casa en que viven (574), una parte importante
(310) con su tiempo libre, 184 con la calidad del
medioambiente y solo 77 con comprar lo que
quiere.
Satisfacción: aspecto con el que se siente más
satisfecho
Frecuencia
Válidos Tiempo libre 310
Casa en que vive
a
574
Tramos de edad
Frecuencia
Válidos Jovenes (18 a 30)
a
341
Adultos jovenes (31 a 45) 307
Adultos 249
Adulto Mayor 303
Total 1200
a. Modo.
Preocupaciones: aspecto que más le preocupa
Frecuencia
Válidos Su vida afectiva 63
El dinero 290
Armonía familiar 280
Su salud
a
525
Total 1158
Perdidos
b
Definidos por el usuario 42
Total 42
Total 1200
a. Modo.
b. Estrategia para valores perdidos: Excluir valores.
Calidad Med.Ambiente 184
Comprar lo que quiere 77
Total 1145
Perdidos
b
Definidos por el usuario 55
Total 55
Total 1200
a. Modo.
b. Estrategia para valores perdidos: Excluir valores.
3.c. Historial de iteraciones (Se muestra solo una parte)
El historial de iteraciones muestra los pasos que fueron
necesarios para llegar a la solución última. Observamos
que el paso 34 se detuvo, dado que el incremento de
varianza explicada dejó de ser significativo como para
seguir iterando.
3.d. Resumen del Modelo
La tabla de resumen del modelo, permite observar que se crearon 2 dimensiones (tal como nosotros
señalamos). El autovalor da cuenta de la proporción de información del modelo que es explicada por
cada dimensión; permite analizar de la importancia de cada una de ellas. Acá se puede observar que la
primera dimensión es más importante para el modelo que la segunda. A su vez, la primera explica más
inercia (0,5) que la segunda (0,414). Esto quiere decir que las categorías presentan mayor varianza en la
dimensión 1, sin embargo las diferencias entre ambas dimensiones no parecen muy grandes.
Resumen del modelo
Dimensi
ón Alfa de Cronbach
Varianza explicada
Total
(Autovalores) Inercia
1 ,501 1,501 ,500
2 ,293 1,243 ,414
Total 2,744 ,915
Media ,407
a
1,372 ,457
a. El Alfa de Cronbach Promedio está basado en los
autovalores promedio.
Historial de iteraciones
Número
de
iteracio
nes
Varianza explicada
Pérdida Total Incremento
32 1,37185 ,00001 1,62815
33 1,37187 ,00001 1,62813
34
a
1,37187 ,00001 1,62813
a. Se ha detenido el proceso de iteración debido
a que se ha alcanzado el valor de la prueba para
la convergencia.
3.e. Cuantificaciones
Las siguientes tablas muestran las coordenadas de cada una de las categorías en ambas dimensiones:
puntajes altos en las dimensiones indican que la categoría se asocia a dicha dimensión.
En el caso de los tramos de edad, observamos que los jóvenes, adultos jóvenes y adultos mayores se
asocian más a la dimensión 1; mientras que los adultos se asocian más a la dimensión 2. Aun así, los
adultos jóvenes no parecen tener una asociación muy fuerte a ninguna dimensión.
Tramos de edad
Puntos:Coordenadas
Categoría Frecuencia
Coordenadas de centroide
Dimensión
1 2
Jovenes (18 a 30) 341 ,883 -,691
Adultos jovenes (31 a 45) 307 ,460 ,396
Adultos 249 -,242 1,251
Adulto Mayor 303 -1,254 -,611
Normalización principal por variable.
En el caso de las preocupaciones, la vida afectiva, el dinero y la salud se asocia a la dimensión 1,
mientras que la armonía familiar a la dimensión 2. Vale señalar que la vida afectiva parece altamente
asociada a ambas dimensiones.
Preocupaciones: aspecto que más le preocupa
Puntos:Coordenadas
Categoría Frecuencia
Coordenadas de centroide
Dimensión
1 2
Su vida afectiva 63 1,311 -1,095
El dinero 290 ,965 ,087
Armonía familiar 280 ,281 ,720
Su salud 525 -,820 -,309
Perdidos 42
Normalización principal por variable.
En el caso de las satisfacciones, la casa y comprar lo que se quiere se asocia a la dimensión 1, y el tiempo
libre y calidad del medio ambiente a la dimensión 2.
Satisfacción: aspecto con el que se siente más satisfecho
Puntos:Coordenadas
Categoría Frecuencia
Coordenadas de centroide
Dimensión
1 2
Tiempo libre 310 ,315 -1,019
Casa en que vive 574 -,445 ,339
Calidad Med.Ambiente 184 ,531 ,763
Comprar lo que quiere 77 ,618 -,348
Perdidos 55
Normalización principal por variable.
3.e. Gráfico
Al observar el mapa perceptual se puede asociar cada tramo etario a ciertas preocupaciones y/o
satisfacciones.
Jóvenes; se sienten satisfechos con el uso que le dan a su tiempo libre y con sus prácticas de
consumo, siendo lo más relevante para ellos su vida afectiva y el dinero.
Adultos jóvenes: disfrutan de la calidad del medio ambiente y se preocupan por la armonía
familiar y el dinero.
Adultos: disfrutan de la casa en queviven y de la calidad del medio ambiente a la vez que les
preocupa la armonía familiar.
Adultos mayores: se encuentran preocupados por su salud.
Pistas para interpretar mapas perceptuales:
1. Interpretación polar: aglomeración de las categorías de las variables.
2. Interpretación por proyección: proyección de puntos tal que se genera
la interpretación de la asociación de las categorías de las variables con los
factores. Los puntos se proyectan, de modo que los más polares dan
sentido a los factores.
3. Interpretación por cercanía: áreas compartidas por categorías en el
mapa perceptual.
3.f. Correlaciones
Las siguientes tablas dan cuenta de qué tan asociadas se encuentran las variables. En ambos caso se
evidencia que la variable tramos de edad se correlaciona moderadamente (0,38) con las
preocupaciones. Sin embargo las correlaciones entre los otros pares de variables son menores.
Correlaciones de las Variables originales
Tramos de edad
Preocupaciones:
aspecto que más
le preocupa
Satisfacción:
aspecto con el
que se siente
más satisfecho
Tramos de edad 1,000 ,380 ,002
Preocupaciones: aspecto que
más le preocupa
,380 1,000 -,036
Satisfacción: aspecto con el
que se siente más satisfecho
,002 -,036 1,000
Dimensión 1 2 3
Autovalores 1,381 1,000 ,619
Se han imputado los valores con la moda de la variable.
Correlaciones de las Variables transformadas
Dimensión:1
Tramos de edad
Preocupaciones:
aspecto que más
le preocupa
Satisfacción:
aspecto con el
que se siente
más satisfecho
Tramos de edad 1,000 ,400 ,140
Preocupaciones: aspecto que
más le preocupa
a
,400 1,000 ,092
Satisfacción: aspecto con el
que se siente más satisfecho
a
,140 ,092 1,000
Dimensión 1 2 3
Autovalores 1,459 ,944 ,597
a. Se han imputado los valores perdidos con la moda de la variable cuantificada.
3.g. Objetos
El siguiente gráfico presenta dodos los casos en el mapa perceptual. Solo es útil cuando hay pocos casos.
3.h. Medidas de discriminación
Esta tabla permite ver cuánto discrimina cada variable en cada dimensión; indican la importancia de
cada variable para cada una de las dimensiones. Acá se ve que la dimensión 1 se encuentra explicada
principalmente por los tramos de edad y aspectos que más preocupan en la vida y la dimensión 2 por el
aspecto con el que se siente más satisfecho.
Medidas de discriminación
Dimensión
Media 1 2
Tramos de edad ,685 ,595 ,640
Preocupaciones: aspecto que
más le preocupa
,628 ,227 ,428
Satisfacción: aspecto con el
que se siente más satisfecho
,188 ,420 ,304
Total activo 1,501 1,243 1,372
El gráfico presenta la misma información, tramos de edad, se encuentra a más menos igual distancia de
ambos ejes, dando cuenta de que es importante en ambas dimensiones; satisfacción en cambio, se
encuentra más cerca de la dimensión 2, siendo más importante en esta; mientras que las
preocupaciones se acercan más a la dimensión 1, evidenciando se más importantes para esta que para
la dimensión 2.