Análisis Cuantitativo del Comportamiento Político
Carlos García Rivero Universidad de Valencia
apuntes
Copyright ® 2018 Todos los derechos reservados. Ni la totalidad ni parte de este libro puede reproducirse o transmitirse por ningún procedimiento electrónico o mecánico, incluyendo fotocopia, grabación magnética, o cualquier almacenamiento de información y sistema de recuperación sin permiso escrito del autor y del editor. En caso de erratas y actualizaciones, la Editorial Tirant lo Blanch publicará la pertinente corrección en la página web www.tirant.com.
© TIRANT LO BLANCH EDITA: TIRANT LO BLANCH VALENCIA TELFS.: 96/361 00 48 - 50
Email: tlb@tirant.com www.tirant.com Librería Virtual: www.tirant.es DEPOSITO LEGAL: V-42-2018 ISBN: 978-84-9169-872-2 MAQUETA E IMPRIME:
´
Si tiene alguna queja o sugerencia, envíenos un mail a: atencioncliente@tirant.com. En caso de no ser atendida su sugerencia, por favor, lea nuestro procedimiento de quejas en: www.tirant.net/index.php/empresa/politicas-de-empresa Responsabilidad Social Corporativa http://www.tirant.net/Docs/RSCTirant.pdf
Análisis Cuantitativo del Comportamiento Político
Carlos García Rivero Universidad de Valencia
Comportamiento político y análisis cuantitativo .................................................................... 7
1. Introducción al SPSS ...................................................................................................................... 9 1.1 Apertura de un fichero SPSS ................................................................................................................ 9 1.2 Valores perdidos ....................................................................................................................................... 9 1.3 Etiquetas de los valores ....................................................................................................................... 10 1.4 Frecuencias ............................................................................................................................................... 11 1.5 Recodificación de variables ................................................................................................................ 13 1.6 Índices ......................................................................................................................................................... 14 1.8 Selección de casos .................................................................................................................................. 16 1.9 Ponderación del fichero ....................................................................................................................... 18
2. En busca de asociación................................................................................................................20
2.1 Tablas de contingencia ......................................................................................................................... 20 2.2 Comparación de medias....................................................................................................................... 23 2.3 Ejercicio 1. Tablas cruzadas ............................................................................................................... 24
3. Análisis Factorial ...........................................................................................................................25
3.1 Introducción ............................................................................................................................................. 25 3.2 Proceso........................................................................................................................................................ 25 3.3 Resultados ................................................................................................................................................. 27 3.4 Ejercicio 2. Análisis factorial .............................................................................................................. 31
4. Análisis de Regresión Lineal .....................................................................................................32
4.1 Introducción ............................................................................................................................................. 32 4.2 Variables nominales en análisis de regresión............................................................................. 34 4.3 Estadísticos ............................................................................................................................................... 36 4.4 Fórmula ...................................................................................................................................................... 37 4.5 Resultados ................................................................................................................................................. 37 4.6 Ejercicio 3. Regresión lineal ............................................................................................................... 41
5. Análisis de Regresión Logística Binaria ...............................................................................43
5.1 Introducción ............................................................................................................................................. 43 5.2 Proceso........................................................................................................................................................ 44 5.3. Resultados ................................................................................................................................................ 46 5.4 Ejercicio 4. Regresión Logística binaria ........................................................................................ 51
6. Análisis de Regresión Logística Multinomial .....................................................................52
6.1 Introducción ............................................................................................................................................. 52 6.2 Test de ajuste del modelo. Logaritmo de la verosimilitud..................................................... 53 6.3 Medida similares a R2........................................................................................................................... 54 6.4 La matriz de clasificación .................................................................................................................... 54 6.5 Posibles problemas ................................................................................................................................ 55 6.6 Interpretación de los resultados ...................................................................................................... 56 6.6.1 Variables estadísticamente significativas: ........................................................................... 56 6.6.2. Dirección de la relación y contribución sobre la variable dependiente ................. 57 6.7 Presentación de resultados. ............................................................................................................... 59
7. Análisis Discriminante ................................................................................................................60
7.1 Introducción ............................................................................................................................................. 60 7.2 Proceso........................................................................................................................................................ 60 7.3 Resultados ................................................................................................................................................. 64
Bibliografía de apoyo........................................................................................................................66 Apéndice 1. Referencias en textos ...............................................................................................67
Apéndice 2. Soluciones de los ejercicios ...................................................................................70
Comportamiento político y análisis cuantitativo El comportamiento político es una de las áreas de mayor relevancia en la Ciencia Política y su análisis una pieza fundamental de la investigación politológica. Principalmente, el análisis del comportamiento político se centra en explicar por qué los individuos se comportan como lo hacen cuando, por ejemplo, votan a un partido u otro, se abstienen en unas elecciones o no, por qué acuden a una huelga, se afilian a un partido,
participan
en
un
movimiento
social,
muestran
los
niveles
de
confianza institucional o los niveles de tolerancia política que tienen. Como en otras muchas disciplinas, la Ciencia Política ha desarrollado dos principales metodologías de investigación, la cuantitativa y la cualitativa. En el caso de la Ciencia Política existe un claro predominio a nivel internacional de las técnicas cuantitativas sobre las cualitativas. Esto no significa que estas últimas no tengan validez o no merezca la pena su aprendizaje. Todo lo contrario, la triangulación entre distintas metodologías refuerza la investigación y sus conclusiones, pero, aclarado esto, debería ser obligatorio para cualquier politólogo un buen conocimiento de la metodología imperante en su formación en análisis del comportamiento político. Siguiendo esa línea, este texto muestra el funcionamiento de una herramienta básica de investigación en ciencia política, como es SPSS, para el análisis cuantitativo del comportamiento político de los ciudadanos a través de datos de encuesta. Todo ello pensado para alumnado de grado en ciencia política o/y sociología con lo que parte de un mínimo o nulo conocimiento del programa y de estadística y avanza hasta la presentación de técnicas como la regresión logística multinomial. Habida cuenta del perfil del alumnado para el que está pensado, el texto no se adentra en fórmulas estadísticas ni cálculos complejos sino que pretende que entienda el razonamiento detrás de cada técnica aplicada, sea capaz de aplicarlas en su investigación e interpretar los indicadores principales cuando los vea en algún texto de investigación politológica. En cursos posteriores de posgrado sobre investigación avanzada se profundizará en aspectos más técnicos y sofisticados de la investigación cuantitativa. El objetivo básico de este texto es que se adquiera un conocimiento general de herramientas avanzadas que se encontrará no sólo en trabajos de investigación en el grado, si no en artículos en revistas especializadas y sea capaz de interpretarlos con solvencia. En una primera parte se presenta el programa informático y sus principales ventanas y accesos así como las dos formas de dar instrucciones al programa, ya sea con los botones del interfaz o con los comandos desde la ventada de sintaxis. Una 7
primera recomendación es el uso del sintaxis ya que éste permite tener un registro de todas las técnicas aplicadas y cambios realizados sobre el fichero de datos, acceder a cálculos que se hicieron en el pasado y modificarlos de forma inmediata siendo así el trabajo más operativo y eficiente, especialmente cuando se trabaja en equipo. En una segunda parte se muestran aspectos básicos de estadística descriptiva como
preparación
para
la
tercera
parte,
donde
se
muestran
técnicas
de
estadística inferencial que son las que más se aplican en investigación y más comúnmente se encuentran en artículos de revistas especializadas. Habida cuenta de que tan relevante es el análisis estadístico como su correcta presentación en un trabajo final ya sea para su evaluación, publicación o presentación en público, también se muestra qué indicadores presentar en una tabla (en el caso de las regresiones), así como, al final del texto, en un apéndice, de forma breve, la forma correcta de citar obras en textos, tanto el sistema anglosajón de cita en el texto como el sistema europeo de cita a pie de página. En los temas de tablas cruzadas, factorial y regresión se incorporan ejercicios, con sus soluciones en el apéndice 2. Los datos usados son los del Estudio Mundial de Valores,
disponibles
en
la
página
http://www.worldvaluessurvey.org/wvs.jsp
desde
web
de
Data
&
forma
gratuita:
Documentation
à
Documentation/Downloads. Se incorpora también un listado de bibliografía, clásica y específica de regresión lineal y logística así como de análisis factorial, para que una vez entendido el procedimiento y el significado de los coeficientes principales, se pueda profundizar más en aspectos técnicos si así se desea.
8
1. Introducción al SPSS El SPSS (Statistical Package for Social Science) es básicamente una hoja de cálculo de más potencia y versatilidad que las hojas de cálculo convencionales y cuenta con tres ventanas en su interfaz. La ventana principal (figura 1.1) que, a su vez, contiene dos subventanas, una de los datos y otra de las variables; una ventada de resultados y una ventada de sintaxis. Esta última es simplemente un editor de texto desde el cual se le pueden dar las mismas ordenes al SPSS con la ventaja de que quedan grabadas cuantas operaciones se hagan, permitiendo la vuelta atrás, y su rectificación en cualquier momento. Así, se obtiene claridad y se gana tiempo en caso de necesidad de rectificación. Figura 1.1: Ventana de datos (izquierda) y de variables (derecha)
1.1 Apertura de un fichero SPSS Los ficheros de SPSS tiene extensión .sav con lo que sólo es necesario pulsar en ellos y automáticamente se abre el SPSS con el fichero. También se puede acceder al fichero como se indica en la figura 1.2. Figura 1.2: Abrir un fichero de datos de SPSS
También es posible abrir ficheros de hojas de cálculo, bases de datos, ficheros en formato texto o ASCII. 1.2 Valores perdidos Se deben indicar qué valores no deben ser incorporados en el cálculo de cualquier estadístico. Generalmente son aquellos como “No sabe” o “No contesta”.
9
Esto es tan básico como importante ya que de no hacerlo, en cualquier cálculo o modificación de una variable, se incorporarían los valores perdidos al cálculo quedando éste afectado y dando lugar a conclusiones erróneas. Un simple cálculo de la edad media de un grupo de encuestados donde el “no sabe” o “no contesta” tuviera un valor de 999, sin asignar dicho valor como perdido, haría que la media se distorsionara al alza. Figura 1.3: Valores perdidos
Esta orden también se puede dar desde el comando sintaxis, recordando siempre que todo comando sintaxis debe terminar con un punto para indicarle al programa el final de dicho comando. Si no se pone, el comando no se ejecutará, siendo éste un error bastante frecuente a la hora de trabajar con sintaxis. El comando en sintaxis es como sigue: MISSING VALUE var1 (-5, -1). 1.3 Etiquetas de los valores Cada variable tiene una serie de posibles respuestas, como “mucho”, “poco”, etc. Cada una de estas respuestas tiene un valor numérico asignado (1 es “mucho”; 2 es “poco”, etc.). Es necesario indicarle al SPSS qué valores (1, 2, 3, etc.) tienen qué etiquetas (mucho, poco, etc.)
10
Figura 1.4: Etiquetas de valor
Del mismo modo esta orden también se puede dar desde el fichero sintaxis. En el ejemplo se otorga a la variable “var1” las etiquetas a los valores 1 y 2. Siempre con un punto al final del comando. VALUE LABELS var1 1 “mucho” 2 “bastante” . 1.4 Frecuencias Uno de los primeros pasos a la hora de analizar los datos es su descripción. El primer paso suele ser un listado de frecuencias; es decir, observar cuántas veces se repiten los distintos valores. Figura 1.5: Frecuencias (1)
11
Figura 1.6: Frecuencias (2)
Figura 1.7: Frecuencias (3) – estadísticos –
Desde el sintaxis la orden se da con el siguiente comando: FREQUENCIES VARIABLES=V1 /ORDER=ANALYSIS. En función del tipo de variable (nominal, ordinal, etc.) así se podrá pedir un estadístico u otros (media, moda, etc.). (figura 1.7) Por defecto, en la ventana de resultados, el listado de frecuencias del SPSS nos dará un listado de las etiquetas de los valores de la variable, pero no de los valores en cada etiqueta. Para poder tener en el listado tanto las etiquetas de los valores (por defecto) como de los valores de cada etiqueta hay que hacer lo siguiente. Edición Opciones Etiquetas de los resultados y marcar en todas las posibles opciones “Nombres y etiquetas”; “Valores y etiquetas”; “Nombres y etiquetas” y “Valores y etiquetas”. El proceso se muestra en la figura 1.8.
12
Figura 1.8: Etiquetas de los resultados
1.5 Recodificación de variables A veces no se desea trabajar con la variable original ya que su distribución no es
la
más
manejable
(por
ejemplo
la
edad).
En
estos
casos
es
conveniente “recodificar” la variable (en otra). Esto consiste en crear una nueva variable (no es conveniente “recodificar” en la misma variable ya que la información original se perdería) en la que los nuevos valores están compuestos por “grupos” de valores de la variable original. La figura 1.9 muestra la ventana de introducción de datos. A ella se llega: Transformar à numérica”
Recodificar
en
distintas
variables.
En
“variable
se introduce la variable original a recodificar. En nombre de la
“variable recodificada”, se introduce el nombre de la nueva variable y en "etiqueta", la etiqueta de la nueva
variable.
Después
se
debe
pulsar
“cambiar”.
A
continuación, se deben introducir los nuevos valores (“valores antiguos y nuevos”).
13
Figura 1.9: Recodificación
Si se pulsa en “pegar” en vez de “aceptar”, obtenemos el comando de sintaxis:
RECODE v4 (1THRU 3=1) (4 THRU 7=2) (8 THRU 12=3) (ELSE=SYSMIS) INTO var1_rec . VARIABLE LABELS var1_rec 'Variable 1 recodificada”. EXECUTE . La expresión (ELSE= SYSMIS) indica que cualquier valor distinto a los expuestos en el comando se deber dar por perdido. En el ejemplo, cualquier valor inferior a 1 y superior a 12. Después sería necesario proporcionar etiquetas a los valores de la variable recodificada. VALUE LABELS var1_rec 1 "grupo de 1 a 3” 2 "grupo de 4 a 7" 3 “grupo de 8 a 12". 1.6 Índices Los índices son variables resultantes de la combinación de otras variables individuales. Su importancia radica en que incluyen más información que una única variable con lo que miden mejor la realidad que se pretende medir que una única variable. El procedimiento se explica en la figura 1.10. A ella se llega mediante Transformar Calcular variable.
14
Figura 1.10: Cálculo de índices
En “variable de destino” se introduce el nombre de la nueva variable índice. En expresión numérica, se computa en índice con las variables individuales. El listado de variables aparece a la izquierda. Al pulsar sobre “tipo y etiqueta” aparece la ventana “calcular variable: tipo y etiqueta”. Desde la que se pueden dar etiquetas a la nueva variable.
Si pulsamos “pegar” en vez de aceptar, el resultado se muestra en la
ventana de sintaxis como sigue: COMPUTE var2 = v13 + v14 . VARIABLE LABELS var2 “Índice nuevo” . EXECUTE . 1.7 Ventana “Si la opción” Tanto en la recodificación (recode) como en la creación de variables (compute) es posible establecer un filtro. Si se quiere que la variable recodificada o el índice a crear, sólo contenga, por ejemplo, a varones y no a mujeres, es necesario utilizar la función “Si la opción”.
15
Figura 1.11: Opción “SI”
Para la opción RECODE, por ejemplo, y en sintaxis, se obtendría un comando DO IF (sexo=1), indicando la realización de una orden (RECODE) sólo si se cumple la condición entre paréntesis; y otro comando END IF, que indica el final del filtro. (marcados en negrita) DO IF (sexo=1). RECODE var1 (1THRU 3=1) (4 THRU 7=2) (8 THRU 12=3) (ELSE=SYSMIS) INTO var1_rec . END IF. VARIABLE LABELS var1_rec 'Variable 1 recodificada”. EXECUTE. La recodificación es útil cuando las variables se van a emplear en técnicas descriptivas como tablas de contingencia, por la mejor visualización de resultados que ofrece en la presentación final, pero no se deben recodificar si las variables se van a emplear e n técnicas de estadística inferencial ya que al recodificar en grupos como el ejemplo anterior se reduce la varianza innecesariamente. 1.8 Selección de casos Cuando se usan datos secundarios, como por ejemplo del Estudio Mundial de Valores, la Encuesta Social Europea, Barómetros del CIS y similares, generalmente sólo se quiere trabajar con parte del fichero. Un ejemplo es descargar el Estudio Mundial de Valores para trabajar sólo con datos de España, una selección de países o una oleada determinada y no con toda la base de datos. Para ello es necesario seleccionar sólo parte de los datos. Existen 3 formas de seleccionar datos con el SPSS:
16
1) Seleccionar parte del fichero y crear, con esos datos, un nuevo fichero independiente del original. 2) Seleccionar parte del fichero pero mantener el resto de datos en segundo plano. El ordenador trabaja con el fichero original pero sólo aplica las órdenes que se le den a los casos seleccionados. 3) Seleccionar parte del fichero y eliminar el resto. Si los datos no seleccionados no se van a utilizar en el trabajo es conveniente crear un nuevo fichero con los casos seleccionados y trabajar con ese nuevo fichero, manteniendo el original para futuros trabajos (opción 1). Esta opción tiene la ventaja de que el fichero resultante suele ser más pequeño que el original, y por ende, el programa trabaja de forma más rápida a la hora de ejecutar las órdenes que se le den. El almacenamiento y envío por medios electrónicos del fichero también es más cómodo por su menor tamaño. Un caso en el que se utilizaría esta opción es, por ejemplo, si se quisiera hacer un estudio del comportamiento político en el Sur de Europa y se usaran datos de la Encuesta Social Europea o Estudio Mundial de Valores. Se seleccionarían España, Portugal e Italia por ejemplo y se crearía un nuevo fichero con esos tres países. Al comando se llega desde Datos à Seleccionar casos. La figura 1.12 muestra la ventana resultante desde la que se hace la selección (parte superior de la figura 1.12). Se marca la segunda opción “si se satisface la condición” y al pulsar en “si la opción” aparece la nueva ventana (parte inferior de la figura 1.12). Ahí se indica qué casos se seleccionan (en el ejemplo aquellos países – variable V2 – cuyos valores sean 724 “España” o 380 “Italia”). El símbolo “ | ” significa “o” mientras que el símbolo “&” significa “y” con lo que si se quiere seleccionar casos de España e Italia se debe usar la expresión v2=724 | v2= 380. Si se usa la expresión v2=724 & v2= 380 el programa intentará seleccionar casos que pertenezcan a España (valor 724) y al mismo tiempo a Italia (valor 380) con lo que no seleccionará ningún caso. Este suele ser un error típico de todo principiante. Por último, es necesario recordar que se debe seleccionar en base a valores (números 724 y 380 en el ejemplo) y no a etiquetas (España e Italia). El programa hará cálculos en base a valores (números) no en base a texto (etiquetas). Es decir, la expresión v2= España en lugar de v2=724 generará un mensaje de error (Nombre de variable incorrecta). Una vez se pulsa “continuar” se vuelve a la parte superior de la figura 1.12 y se decide qué hacer con la selección de casos: 1) Seguir trabajando con el fichero original pero aplicando sólo las órdenes que se den a los datos seleccionados
17
(“resultado: descartar casos no seleccionados”). Opción a utilizar sólo si se van a usar otros países posteriormente que no sean los seleccionados (España e Italia). Por ejemplo si posteriormente se van a seleccionar otros países para comparar resultados con los del sur de Europa. 2) Crear un nuevo fichero en que se incluyen sólo los casos seleccionados. En el ejemplo, España e Italia (“resultado: copiar casos seleccionados a un nuevo conjunto de datos”). Esta opción abrirá una nueva ventana de datos que habrá que guardar y asignar un nombre y se usa si no se van a usar más datos en el estudio. Se mantiene el fichero original intacto. 3) También se pueden eliminar los casos no seleccionados. En el ejemplo, todos los países que no sean España e Italia. Esta opción (“resultado: eliminar casos no seleccionados”) sólo se debe usar si se tiene copia del fichero original o se puede acceder a la fuente de datos cuando se desee para obtener una nueva copia. Figura 1.12. Selección de casos
1.9 Ponderación del fichero No siempre se puede realizar una muestra que sea un reflejo de la población de la que se extrae. Generalmente acceder a zonas rurales suele ser más caro por los
18
costes de desplazamiento y demás, con lo que la muestra no siempre refleja la diversidad social de la población. En esos casos es necesario crear una variable de ponderación que “ajuste” esos desequilibrios para que la muestra sea un reflejo más fiel de la población, en base a los criterios que se desee, por ejemplo, edad, sexo, zona rural-urbana y similares. Si por ejemplo una sociedad tiene un 50% de población residente en zonas urbanas y un 50% en zonas rurales pero la muestra sólo tiene un 25% de encuestados en zonas rurales es necesario ajustar la muestra (ponderar) para que el fichero final tenga un 50% rural – 50% urbano. Para ello se crea una variable de ponderación (generalmente llamada WEIGHT o PESO) que ajusta la muestra. Es necesario saber la distribución real
de
la
población
(universo) mediante un censo o similar.
secundarios depositados en bancos de datos
suelen
tener
Los
datos
la variable de
ponderación incluida con lo que sólo es necesario activar la ponderación. Si no se pondera las conclusiones a las que se lleguen serán erróneas con lo que es muy importante comprobar si hay variable de ponderación y activarla. A ello se llega mediante Datos à Ponderar casos. La figura 1.13 muestra la ventana de asignación de Mundial
de
variable Valores,
de
ponderación.
la Encuesta
Social
En
ficheros como
Europea
una
variable,
generalmente
llamada
“Weight”,
Estudio
o Eurobarómetro suele
haber más de una variable de ponderación: Si se analiza un usa
el
y
solo
país
se
otra, generalmente
llamada “weight_1500” o similar, que pondera para que cada país tenga 1500 casos y que se usa cuando se analizan varios países a la vez. Esta última asegura que cada país tiene el mismo número de casos y ningún país tiene un “peso” mayor a la hora de realizar cálculos. Figura 1.13 Ponderación de casos
Cuando la ponderación está activa aparece en la parte inferior derecha de la ventada de datos el texto “ponderación activada”. Es necesario estar seguro de que la ponderación está activada y de qué variable se está usando para ponderar.
19