Skip to main content

1_9788418802836

Page 1

FUNDAMENTOS DE ESTADÍSTICA CON R PARA LINGÜISTAS


COMITÉ CIENTÍFICO DE LA EDITORIAL TIRANT HUMANIDADES Manuel Asensi Pérez

Catedrático de Teoría de la Literatura y de la Literatura Comparada Universitat de València

Ramón Cotarelo

Catedrático de Ciencia Política y de la Administración de la Facultad de Ciencias Políticas y Sociología de la Universidad Nacional de Educación a Distancia

Mª Teresa Echenique Elizondo Catedrática de Lengua Española Universitat de València

Juan Manuel Fernández Soria

Catedrático de Teoría e Historia de la Educación Universitat de València

Pablo Oñate Rubalcaba

Catedrático de Ciencia Política y de la Administración Universitat de València

Joan Romero

Catedrático de Geografía Humana Universitat de València

Juan José Tamayo

Director de la Cátedra de Teología y Ciencias de las Religiones Universidad Carlos III de Madrid

Procedimiento de selección de originales, ver página web: www.tirant.net/index.php/editorial/procedimiento-de-seleccion-de-originales


FUNDAMENTOS DE ESTADÍSTICA CON R PARA LINGÜISTAS

Autor ADRIÁN CABEDO NEBOT

tirant humanidades Valencia, 2021


Copyright ® 2021 Todos los derechos reservados. Ni la totalidad ni parte de este libro puede reproducirse o transmitirse por ningún procedimiento electrónico o mecánico, incluyendo fotocopia, grabación magnética, o cualquier almacenamiento de información y sistema de recuperación sin permiso escrito de los autores y del editor. En caso de erratas y actualizaciones, la Editorial Tirant lo Blanch publicará la pertinente corrección en la página web www.tirant.com.

Proyecto “La atenuación pragmática en su variación genérica: géneros discursivos escritos y orales en el español de España y América” (MINECO, FFI2016-75249-P)

© Adrián Cabedo Nebot

©

TIRANT HUMANIDADES EDITA: TIRANT HUMANIDADES C/ Artes Gráficas, 14 - 46010 - Valencia TELFS.: 96/361 00 48 - 50 FAX: 96/369 41 51 Email:tlb@tirant.com www.tirant.com Librería virtual: www.tirant.es DEPÓSITO LEGAL: V-3220-2021 ISBN: 978-84-18802-83-6 MAQUETA: Tink Factoría de Color

Si tiene alguna queja o sugerencia, envíenos un mail a: atencioncliente@tirant.com. En caso de no ser atendida su sugerencia, por favor, lea en www.tirant.net/index.php/empresa/ politicas-de-empresa nuestro procedimiento de quejas. Responsabilidad Social Corporativa: http://www.tirant.net/Docs/RSCTirant.pdf


A Maria, Ricard y Luis


ÍNDICE 1. AGRADECIMIENTOS................................................................................. 13 2. FINANCIACIÓN.......................................................................................... 15 3. INTRODUCCIÓN........................................................................................ 17 4. ¿POR QUÉ R?............................................................................................... 19 5. LECTURAS PREVIAS.................................................................................. 21 5.1. Sobre estadística descriptiva e inferencial......................................... 21 5.2. Sobre R y estadística........................................................................ 22 5.3.Sobre estadística y métodos avanzados en R..................................... 23 6. DATOS CUANTITATIVOS EN ESTUDIOS HUMANÍSTICOS................... 25 6.1. Conjuntos de datos.......................................................................... 26 6.2. Fichas de análisis.............................................................................. 27 6.3. Hojas de cálculo y tablas dinámicas................................................. 28 7. BASES DE DATOS DE ESTE LIBRO............................................................ 31 7.1. Descripción...................................................................................... 31 7.2. Ubicación......................................................................................... 33 7.3. Leyenda y explicación de las variables.............................................. 33 7.3.1. Fonocortesía.......................................................................... 33 7.3.2. Géneros y atenuación fónica.................................................. 36 8. CONCEPTOS BÁSICOS DE ESTADÍSTICA................................................ 39 8.1. Variables.......................................................................................... 39 8.2. Diferencia entre descriptivo e inferencial.......................................... 41 8.3. Población / muestra.......................................................................... 42 8.4. Hipótesis de investigación................................................................ 44 8.5. Valor p y nivel de significación......................................................... 45 8.6. Error de muestreo............................................................................ 47 8.7. Distribución normalizada................................................................. 48 8.8. Correlaciones absurdas.................................................................... 49 9. R Y RSTUDIO.............................................................................................. 51 9.1. Versiones utilizadas.......................................................................... 52 9.2. Operaciones básicas con R............................................................... 52 9.2.1. Instalar y ejecutar librerías.................................................... 52 9.2.2. Importar, crear y visualizar data frame.................................. 54 9.2.3. Tipología de variables............................................................ 56 9.2.4. Operaciones matemáticas...................................................... 58


10

Índice

9.2.5. Citar R y librerías.................................................................. 59 9.2.6. Ayuda.................................................................................... 60 9.2.7. Crear y modificar variables.................................................... 61 9.2.8. Crear variables en el data frame............................................ 63 9.2.9. Errores.................................................................................. 66 9.2.10. Crear subconjuntos............................................................. 66 10. PRIMER ACERCAMIENTO Y UTILIDADES............................................ 69 10.1 Probabilidades................................................................................. 69 10.1.1. Ver el histograma de la distribución..................................... 70 10.1.2. Calcular probabilidades....................................................... 71 10.2. Tamaño de la muestra con R.......................................................... 72 10.3. Modificar nombres......................................................................... 73 10.3.1. Reemplazar nombres de variables........................................ 74 10.3.2. Reemplazar nombres de categorías...................................... 76 10.4. Convertir en factor......................................................................... 76 10.5. Filtrar categorías poco representadas............................................. 78 10.6. Sustituir valores perdidos por media.............................................. 80 11. ESTADÍSTICA DESCRIPTIVA................................................................... 83 11.1. Tablas simples o tablas de contingencia.......................................... 83 11.2. Resumen estadístico....................................................................... 87 11.3. Valores del resumen estadístico....................................................... 90 11.4. Informe con DataExplorer............................................................. 91 12. GRÁFICOS................................................................................................. 95 12.1. Gráfico protípico............................................................................ 95 12.2. Histogramas................................................................................... 97 12.3. Diagramas de caja.......................................................................... 99 12.4. Gráficos de barras........................................................................ 101 12.5. Gráficos de círculo....................................................................... 103 12.6. Scatterplots.................................................................................. 103 12.7. Treemaps...................................................................................... 105 12.8. Mapa de calor.............................................................................. 107 12.9. Motion charts.............................................................................. 110 12.10. Más opciones de gráficos............................................................ 112 13. RELACIONES, AGRUPACIONES Y VISUALIZACIÓN........................... 115 13.1. Chi cuadrado............................................................................... 115


11

ïndice

13.1.1. Bondad de ajuste............................................................... 117 13.1.2. Chi cuadrado entre dos variables....................................... 120 13.1.2.1. Relación entre combinación y género.................. 120 13.1.2.2. Relación entre cortesía y tonemas....................... 126 13.2. T test y ANOVA........................................................................... 128 13.2.1. F0 Media según (des)cortesía............................................. 128 13.2.2. Variables fónicas según género discursivo.......................... 129 13.3. Análisis múltiple de correspondencias.......................................... 133 13.3.1. Referencias para ampliar................................................... 134 13.3.2. Condiciones de la prueba.................................................. 134 13.3.3. Ejemplo de AMC............................................................... 135 13.3.3.1. Análisis de clúster derivado................................. 139 13.3.3.2. Informe generado por FactoInvestigate............... 142 13.4. Descripción de categorías con FactoMineR.................................. 144 13.4.1. Desviaciones fónicas y atenuación..................................... 145 13.4.2. Géneros y atenuación fónica.............................................. 149 13.5. Árbol de decisiones y Random Foerst........................................... 151 13.5.1. Referencias para ampliar................................................... 152 13.5.2. Condiciones de la prueba.................................................. 152 13.5.3. Árbol con variable dependiente numérica.......................... 152 13.5.4. Árbol con variable dependiente categórica........................ 156 13.5.5. Random Forest.................................................................. 159 14. REFLEXIONES FINALES......................................................................... 165 15. BIBLIOGRAFÍA........................................................................................ 169 16. LIBRERÍAS UTILIZADAS........................................................................ 171 17. LISTA DE COMANDOS MÁS IMPORTANTES...................................... 173


1. AGRADECIMIENTOS

Miro atrás en el tiempo y busco el momento en que comencé mi camino de investigación. Si alguien me hubiera dicho en 2006 que quince años después estaría escribiendo un libro primero sobre estadística y luego sobre un lenguaje de programación, hubiera pensado que me estaban gastando una broma pesada. Pero lo cierto es que aquí estamos, escribiendo un libro sobre estadística y sobre el programa R. En 2009 realicé mi tesis doctoral sobre segmentación prosódica en español coloquial. En ella utilicé un amplio número de pruebas estadísticas sobre una base de datos de centenares de registros. Lo hice con el programa comercial SPSS, cuya repercusión es amplia en sectores de muy diversa producción científica como es, de hecho, el ámbito de las Humanidades, en el que me incluyo como investigador. En 2014 o 2015, más o menos, después de una estancia como profesor invitado en la Universidad de Gante, colegas de allí me hablaron de las grandezas de un programa gratuito que se llamaba R y me recomendaron la lectura de un para mí desconocido Stefan Gries. Desde entonces, y de modo algo errático, fui cogiendo experiencia con el uso del programa, empecé a realizar mis primeros artículos de investigación usando R e incluso, recientemente, me he aventurado en la creación de sistemas de visualización dinámica y páginas web (obviamente, también con R). Utilizo esta sección al principio del libro para agradecer a todas las personas que, a lo largo de los años, me han pedido que les explique alguna cuestión de estadística y que, últimamente, me han pedido también la realización de cursos aplicados en lingüística para aprender R. No voy a personalizar en nadie porque seguramente son muchas las personas que me dejaría por nombrar, pero a todos los que me han pedido ayuda estadística en algún momento y a todos los que me han retado a pensar les dedico lo poco o mucho bueno que este libro pueda ofrecer.


2. FINANCIACIÓN

La publicación del libro ha sido posible gracias a la financiación del proyecto Es.VaG.Atenuacion: “La atenuación pragmática en su variación genérica: géneros discursivos escritos y orales en el español de España y América” (MINECO, FFI2016-75249-P). Directoras: Marta Albelda / Maria Estellés (Departamento de Filología Española, UV).


3. INTRODUCCIÓN La redacción de este libro procede de la experiencia adquirida durante los últimos años a partir del análisis cuantitativo de datos y, más específicamente, del análisis de datos realizado mediante el uso del programa R. Nuestro objetivo es exponer análisis realizados sobre bases de datos lingüísticas reales, desarrolladas a partir de estudios particulares, con un claro énfasis en la vinculación entre el dominio prosódico y el domino pragmático. No se trata de un libro construido a modo de manual, sino del relato de una serie de procedimientos técnicos y metodológicos que, a lo largo de los últimos tiempos, han contribuido a explorar relaciones entre datos de diferente tipología. Todas las líneas de código expuestas en este libro están canalizadas siempre a partir de ejemplos y de bases de datos reales, documentación e información que procede de proyectos de investigación particulares. La voluntad última, por lo tanto, es ilustrar las enormes posibilidades de análisis que tanto la estadística, por un lado, como el programa R, por otro, ofrecen a los investigadores. Esta ilustración puede resultar de utilidad igualmente a los que se inician ahora en el análisis científico y también a los que no han tenido interés en estudiar datos hasta el momento presente, pero que han decidido empezar a hacerlo. Cualquier estudiante de grado, máster o doctorado, o incluso cualquier investigador senior, puede decidir en algún momento de su vida explorar investigaciones particulares que precisen del análisis de datos. En estos casos, afloran dudas o preguntas de diferente índole como: ¿cuántos datos necesito en mi estudio?, ¿cómo analizo esos datos?, ¿qué programas puedo utilizar para gestionar toda la información recogida?, ¿necesito aplicar pruebas estadísticas…? A estas preguntas intentaremos dar respuesta en las secciones de este libro, bien sea de modo general, bien sea de manera particular a partir de la explotación y análisis de bases de datos lingüísticas. Como se indica en Cabedo y Recio (2021): La investigación empírica impone retos a quienes la abordan. En primer lugar, por su carácter inherentemente interdisciplinar –el origen de la lingüística experimental, de hecho, se encuentra en la psicología–. Como se vio, los datos de corpus y obtenidos en experimentos suelen recabarse empleando equipos técnicos, en algunos casos múltiples, se gestionan con programas informáticos y se evalúan estadísticamente. Esto exige que el lingüista sea perito en aspectos técnicos que trascienden la filología y la lingüística en su concepción tradicional. En segundo lugar, por la supuesta artificiosidad o desnaturalización de las situaciones que se (re)crean en un laboratorio. Los estímulos de un experimento pueden ser muestras reales de discurso, pero siempre deben manipularse mínimamente; o, más


18

Adrián Cabedo Nebot

frecuentemente, son creados por el investigador, con lo que terminan conformando meras potencialidades de/en la lengua. Por otra parte, en el laboratorio los participantes están sometidos a situaciones artificiales que pueden influir sobre sus patrones de comportamiento, que son, al fin y al cabo, los indicadores del efecto del fenómeno que se estudia. Los experimentadores deben ser conscientes de estas limitaciones y manejar técnicas para limitar su impacto sobre los datos.

Cada día aparecen en el dominio computacional más programas para facilitar a los investigadores el tratamiento y el análisis de datos. Y cada vez más esos programas son más sencillos de manejar y ofrecen mayores prestaciones. En todo caso, en el sector de estudio filológico, no es nada frecuente haber recibido formación sobre estas cuestiones técnicas, por lo que es aún más complicado tener la voluntad de querer incorporarlas a una manera de hacer las cosas, de investigar, que tradicionalmente se ha centrado más en la valoración subjetiva que en el análisis estadístico de un conjunto de datos previamente recogidos. En todo este contexto, consideramos que R (https://www.r-project.org/) puede ser una herramienta de gran ayuda. En resumidas cuentas, R es al mismo tiempo un lenguaje de programación y un programa. Fue escrito por Ross Ihaka y Robert Gentleman, en el Departamento de Estadística de la Universidad de Auckland (Nueva Zelanda). Como se indica en la propia página web del programa: The core of R is an interpreted computer language which allows branching and looping as well as modular programming using functions. Most of the user-visible functions in R are written in R. It is possible for the user to interface to procedures written in the C, C++, or FORTRAN languages for efficiency. The R distribution contains functionality for a large number of statistical procedures. Among these are: linear and generalized linear models, nonlinear regression models, time series analysis, classical parametric and nonparametric tests, clustering and smoothing. There is also a large set of functions which provide a flexible graphical environment for creating various kinds of data presentations. Additional modules (“add-on packages”) are available for a variety of specific purposes.

Por lo tanto, con R pueden realizarse pruebas estadísticas de diversa funcionalidad y también se pueden diseñar y visualizar gráficos, pero también es posible desarrollar pequeños scripts o programas particulares que permiten realizar diferentes funciones de manera recurrente y automática. Todas estas son actividades comunes en investigaciones científicas que tengan un determinado volumen de datos como entrada. En tal sentido, R puede considerarse como un epicentro de distribución para poder desarrollar estudios de caso sin salir de un entorno compartido. De hecho, el documento base de este libro ha sido redactado íntegramente dentro de RStudio, que veremos a continuacion en la sección 9, con un sistema de marcado textual conocido como Rmarkdown, disponible en https://rmarkdown.rstudio.com/.


4. ¿POR QUÉ R? Esta es una pregunta habitual en todo curso o formación sobre R. Hay varias cuestiones que se esconden detrás y que conviene desarrollar con algo de detenimiento. Por tanto, si ahondamos un poco, podríamos desglosar esa pregunta inicial en un grupo de cuestiones relacionadas: ¿por qué aprender un lenguaje de programación?, ¿por qué no usar otros programas como SPSS o Excel?, ¿por qué aprender estadística para mi objeto de estudio si soy de letras? A todas estas preguntas intentaremos darles una respuesta por separado: 1. En los días que corren tener conocimientos de lingüística computacional parece de obligado cumplimiento para cualquier investigador, pertenezca o no su disciplina al espacio más instrumental o numérico. Tener conocimientos computacionales no necesariamente significa saber utilizar lenguajes de programación o expresiones regulares, sino que puede suponer simplemente tener una predisposición positiva hacia la tecnología o hacia el uso de programas que, aunque pueden tener una curva de aprendizaje acentuada al principio, también ofrecen una gran rentabilidad de cara a estudios futuros. 2. SPSS o Excel son programas de pago, mientras que R es un programa gratuito hasta el día de hoy. Aun así, para Excel o SPSS, muchas universidades ofrecen la opción de adquirir una licencia académica que puede ser gratuita para profesores y en algunos casos para estudiantes. Más allá de eso, la respuesta a la preferencia por R también es diferente según el ámbito desde el que se produzca. Por ejemplo, desde un punto de vista técnico, el lenguaje de programación R es mucho más sencillo para codificar y para programar secuencias específicas. Además, R dispone de una gran comunidad científica, que está en constante movimiento creando librerías que facilitan las tareas regulares de otros investigadores; es decir, existe una escalabilidad constante. También se observa una voluntad de compartir y de mejorar los canales de comunicación entre investigadores que, a lo mejor, son de diferentes disciplinas, pero que pueden estar unidos en un determinado momento por una técnica concreta de explotación de datos. 3. Algunos investigadores procedentes del sector humanístico consideran que la estadística, la referencia a números, no es necesaria ni adecuada en el propio estudio o desarrollo de la disciplina, sin embargo, prácticamente en un alto porcentaje de estudios sobre materia lingüística podemos observar abundantes referencias a estadística descriptiva o incluso a estadística inferencial. La presencia de gráficos, de líneas temporales, de datos o frecuencias recurrentes es común en cualquier estudio de esta


20

Adrián Cabedo Nebot

índole. La consideración negativa sobre la estadística suele proceder de etapas iniciales de la formación particular de un investigador; muchas veces, los datos numéricos quedaron relegados a una etapa del pasado académico, por lo que volver a recuperar una motivación sobre un objeto de estudio que se descartó en un momento lejano de la etapa formativa causa bastante rechazo. En todo caso, la estadística no es únicamente un elemento exótico que introducir en nuestras investigaciones, en nuestros artículos, o en nuestros trabajos. La estadística no solo ofrece validaciones poblacionales, sino que también en cierta medida nos permite acceder a técnicas de visualización o de agrupado que no serían posibles únicamente desde una aproximación valorativa a esos mismos datos, sobre todo cuando se ha recogido una gran cantidad. Por esa misma razón, una base de datos que tenga 1000 o más registros necesita muchas veces de labores de relación, de aglutinación y de vinculación entre los datos. Dicho de otra manera, algunas técnicas estadísticas permiten visualizar núcleos de significado dentro de un bosque de elementos dispuestos sin aparente orden y que no necesariamente aparecen relacionados a primer golpe de vista. De entre un amplio abanico de técnicas útiles para este cometido veremos algunos ejemplos en este libro (análisis múltiple de correspondencias, árbol de decisiones, etc.). Así pues, en los siguientes apartados vamos a intentar exponer aspectos básicos sobre diseño de bases de datos y sobre fundamentos estadísticos, así como ofrecer referencias bibliográficas que consideramos adecuadas para la iniciación y formación en el estudio estadístico de datos. La orientación de estos apartados es marcadamente práctica, enfocada al análisis lingüístico con el que más familiarizados nos encontramos (pragmática y fonética) y pretende contextualizar algo más algunos contenidos que aparecerán posteriormente en el uso del programa R y que siempre conviene tener claros con anterioridad al estudio particular ofrecido por el programa.


Turn static files into dynamic content formats.

Create a flipbook
1_9788418802836 by Editorial Tirant Lo Blanch - Issuu