VARIA LECCIÓN DE LA LENGUA ESPAÑOLA Estudios sobre el corpus CODEA
COMITÉ CIENTÍFICO DE LA EDITORIAL TIRANT HUMANIDADES Manuel Asensi Pérez
Catedrático de Teoría de la Literatura y de la Literatura Comparada Universitat de València
Ramón Cotarelo
Catedrático de Ciencia Política y de la Administración de la Facultad de Ciencias Políticas y Sociología de la Universidad Nacional de Educación a Distancia
M.ª Teresa Echenique Elizondo Catedrática de Lengua Española Universitat de València
Juan Manuel Fernández Soria
Catedrático de Teoría e Historia de la Educación Universitat de València
Pablo Oñate Rubalcaba
Catedrático de Ciencia Política y de la Administración Universitat de València
Joan Romero
Catedrático de Geografía Humana Universitat de València
Juan José Tamayo
Director de la Cátedra de Teología y Ciencias de las Religiones Universidad Carlos III de Madrid
Procedimiento de selección de originales, ver página web: www.tirant.net/index.php/editorial/procedimiento-de-seleccion-de-originales
VARIA LECCIÓN DE LA LENGUA ESPAÑOLA Estudios sobre el corpus CODEA
BELÉN ALMEIDA CABREJAS PEDRO SÁNCHEZ-PRIETO BORJA Coordinadores
tirant humanidades Valencia, 2023
Copyright ® 2023 Todos los derechos reservados. Ni la totalidad ni parte de este libro puede reproducirse o transmitirse por ningún procedimiento electrónico o mecánico, incluyendo fotocopia, grabación magnética, o cualquier almacenamiento de información y sistema de recuperación sin permiso escrito de los autores y de los editores. En caso de erratas y actualizaciones, la Editorial Tirant Humanidades publicará la pertinente corrección en la página web www.tirant.com. Este estudio se ha realizado dentro del proyecto “Corpus de Documentos Españoles Anteriores a 1900: CODEA+ 2020” (FFI2017-82770-P), financiado por el Ministerio de Economía y Competitividad.
©
©
VV.AA.
TIRANT HUMANIDADES EDITA: TIRANT HUMANIDADES C/ Artes Gráficas, 14 - 46010 - Valencia TELFS.: 96/361 00 48 - 50 FAX: 96/369 41 51 Email: tlb@tirant.com www.tirant.com Librería virtual: www.tirant.es ISBN: 978-84-19376-73-2 MAQUETA: Innovatext Si tiene alguna queja o sugerencia, envíenos un mail a: atencioncliente@tirant.com. En caso de no ser atendida su sugerencia, por favor, lea en www.tirant.net/index.php/empresa/politicas-de-empresa nuestro Procedimiento de quejas. Responsabilidad Social Corporativa: http://www.tirant.net/Docs/RSCTirant.pdf
Belén Almeida Cabrejas Andrés Enrique-Arias Florencio del Barrio de la Rosa Rocío Díaz Moreno María del Carmen Fernández López Marina Gomila Albal Raquel M. López López Cristina Matute Florentino Paredes García José Luis Ramírez Luengo Patricia Ribas Marí Pedro Sánchez-Prieto Borja Diego Sánchez Sierra Marina Serrano Marín Hiroto Ueda Delfina Vázquez Balonga
Índice
INTRODUCCIÓN....................................................................................................
11
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
Allde, testamto O ihu xpo: EL SISTEMA BRAQUIGRÁFICO EN TESTAMENTOS, INVENTARIOS Y CARTAS DE PODER DE CODEA DURANTE LOS SIGLOS XVI Y XVII...................................................................
33
Rocío Díaz Moreno
EL USO DE LAS GRAFÍAS <PH, TH, CH> EN LA ESCRITURA DEL ESPAÑOL (SIGLOS XIII- XVII): LOS DATOS DE CODEA.......................
71
José Luis Ramírez Luengo
EVOLUCIÓN DE LAS FORMAS DE DIMINUTIVO EN ESPAÑOL. PARA LA HISTORIA DEL CAMBIO -ILLO > -ITO ....................................
97
Florentino Paredes García
ALGUNOS TRASVASES LINGÜÍSTICOS ENTRE CASTILLA Y EL ORIENTE PENINSULAR EN LA BAJA EDAD MEDIA*.............................
137
Andrés Enrique-Arias, Patricia Ribas Marí y Marina Gomila Albal
VENRÁ, VERRÁ, VERNÁ Y VENDRÁ: APROXIMACIÓN A LAS FORMAS SINTÉTICAS DE FUTURO CON METÁTESIS Y EPÉNTESIS EN CODEA+ 2015......................................................................................................
173
Marina Serrano Marín
EL FUTURO DE SUBJUNTIVO EN EL CORPUS DE DOCUMENTOS ESPAÑOLES ANTERIORES A 1800 (CODEA) (1401-1796)........................
201
Florencio del Barrio de la Rosa
HISTORIA Y GEOGRAFÍA DEL TIEMPO COMPUESTO ESPAÑOL. OBSERVACIONES DEL CORPUS CODEA....................................................
231
Hiroto Ueda
LA VARIACIÓN ESTRUCTURAL DE LOS PREDICADOS COMPLEJOS CON VERBOS LIVIANOS EN EL CORPUS CODEA+ 2015*............. Cristina Matute
263
10
Índice
VARIACIÓN GEOGRÁFICA EN EL ORDEN DE PALABRAS: DOCUMENTOS LEONESES, ARAGONESES Y CASTELLANOS DE LA EDAD MEDIA...................................................................................................................
291
APROXIMACIÓN AL LÉXICO DE LA AGRICULTURA EN CODEA (SIGLOS XVI-XVIII)..........................................................................................
329
ACEPCIONES NO CONTEMPLADAS EN LAS OBRAS LEXICOGRÁFICAS DE REFERENCIA PRESENTES EN RELACIONES DE BIENES EXTREMEÑAS DEL SIGLO xvii ....................................................................
351
ESCRITURA DE MUJERES EN UN CORPUS DIACRÓNICO: EL CASO DE CODEA ...........................................................................................................
391
CONTRIBUCIÓN AL ESTUDIO DE LA ANTROPONIMIA HISPÁNICA FEMENINA....................................................................................................
439
UNA HISTORIA BIBLIOGRÁFICA DE CODEA.........................................
511
Pedro Sánchez-Prieto Borja
Delfina Vázquez Balonga
Diego Sánchez Sierra
Belén Almeida
María del Carmen Fernández López Raquel M. López López
INTRODUCCIÓN Belén Almeida Cabrejas Pedro Sánchez-Prieto Borja Universidad de Alcalá
Hace 40 años se publicaba la 9ª edición, corregida y aumentada, de la Historia de la lengua española de Rafael Lapesa; hoy causa asombro el que una sola persona pudiera manejar tal caudal de datos desde la época prerromana al s. xx, y no podemos evitar preguntarnos qué habría podido hacer Lapesa, o Menéndez Pidal, de haber contado con corpus lingüísticos en sus indagaciones. Pero, a poco que se reflexione, no todo habrían sido ventajas para estos grandes maestros, porque su método y el que, al menos a primera vista, puede desarrollarse con los corpus tienen diferencias de tal grado que los hace casi incompatibles. Los corpus, con su abrumadora riqueza, adolecen de falta de jerarquización de los datos; estos últimos se presentan, sobre todo en los primeros desarrollos de los años 90, a bulto, mientras que imaginamos a los viejos filólogos leyendo incansablemente obras de todo tiempo y clase, y seleccionando y anotando los usos que les llamaban la atención, unos usos que se ofrecían en su contexto, no solo sintáctico, sino también discursivo y referencial, con lo que esto implica para la comprensión del texto y sus funciones1. Se podía apreciar así no solo el microcontexto, sino también el macrocontexto, la obra entera como construcción2. La paradoja más
1
2
Nos llama la atención la tendencia a dar contextos cortos, lo que impide valorar adecuadamente muchas secuencias; p. ej., esta merma dificulta la valoración de casos de leísmo, en los que no se puede identificar con claridad el referente. Como se dirá, el corpus debe permitir examinar todo el contexto. Somos conscientes de que ni siquiera el concepto de “obra” es siempre apropiado y suficiente. En la tradición manuscrita, hay una fuerte tendencia a acomunar en un mismo códice obras distintas sobre el mismo tema. En los documentos, tampoco
12
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
radical es que hoy, gracias a los corpus, puede hacerse un estudio lingüístico de cualquier obra o conjunto de obras... sin haberlas leído. De este modo, en su mayor ventaja, la facilidad de acceso a la información, se encuentra su mayor inconveniente (Sánchez-Prieto, Carrera, Isasi, Spence, 2011), pues esto mismo favorece su acceso descontextualizado, con la merma de información que ello representa en los planos que interesan para la valoración lingüística de los testimonios escritos: tiempo, espacio, sociedad, estilo. Reconocemos que, al principio, nos deslumbró la inconmensurable riqueza de los grandes corpus, y donde más fácilmente se valora esta amplitud es en el léxico, lo cual depende de que se traten asuntos diversos, es decir, que los temas de los textos sean muy variados3. Cabe, con todo, establecer matices acerca de los patrones de clasificación del léxico, pues una cosa es la riqueza bruta del léxico de un corpus y otra el que este brinde herramientas adecuadas para la jerarquización y clasificación del mismo, en el sentido de poder establecer su dispersión frente a su frecuencia absoluta, es decir, el que aparezca mucho en unos pocos textos o que se presente en una gran parte de los textos o poco pero en muchos textos. La cuestión es también si es posible determinar en un corpus los patrones geográficos y sociolingüísticos respecto de los que se presenta ese léxico. Pero, volviendo al aspecto diferencial con la lectura, precisamente, de los grandes corpus cabe señalar el que a veces sean “de referencia”, es decir, que muestren un contexto limitado, más o menos amplio, en el
3
faltan los casos de copia de varias cartas de compraventa, donación y trueque, e incluso no se descarta esta solución para originales. Para corpus con gran variedad temática, resulta evidente la dificultad de clasificación, como puede comprobarse en la casilla “Tema” del CORDE <https://corpus. rae.es/cordenet.html>. Para un corpus documental como es ALDICAM <https:// aldicam.blogspot.com>, con piezas, en su mayor parte, procedentes de fondos municipales, los temas establecidos son los siguientes: gobierno, sanidad, educación, cultura, beneficencia, ganadería, agricultura, animales, contaduría y abastos, apeo y deslindes, obras y urbanismo, justicia, orden público, quintas y milicias, genealogía y limpieza de sangre, testamentos e inventarios, bienes patrimoniales, mujer, infancia, minorías étnicas y religiosas.
Introducción
13
que se inserte la palabra buscada. Esto puede ser desventaja pequeña en el caso de textos accesibles, publicados, incluso, muchas veces, como los literarios, de los que circulen versiones electrónicas, como el Cid o Quijote, pero en caso de textos raros, inéditos, como las fuentes documentales, es conveniente mostrarlos íntegros, debido a que, de otro modo, se ocultan elementos formales, como, en los documentos, p. ej., los protocolos inicial y final o escatocolo, ya que estas secciones nos dan la clave acerca del tipo de texto, nos proporcionan información sobre autoría, que malamente pueden suplir los metadatos de la cabecera descriptiva. Una consideración de peso, y que, seguramente, condiciona la metodología de elaboración de los corpus, tiene que ver con el escaso aprecio que muchos investigadores han hecho en nuestro ámbito del trabajo de edición, que consideran meramente ancilar, subsidiario y preparatorio del trabajo “propiamente científico”, que es el de estudio, sea de orientación literaria o lingüística. Esta idea la hemos combatido a lo largo de décadas desde GITHE, tanto aplicada a los estudios literarios como lingüísticos, por considerar que la edición de textos es una operación central en el estudio de la lengua. Aplicada a los corpus, ello exige que los textos de un corpus se preparen expresamente para el mismo, de acuerdo con unos requisitos bien establecidos. Por contra, ignorar esta exigencia ha llevado a acopiar ediciones previas, a veces de diferente época y criterio, de manera que unas ediciones consisten en una transcripción de un manuscrito, mientras que otras proporcionen lo que convencionalmente llamaríamos un “texto crítico”, es decir, el establecido a partir de la tradición manuscrita o impresa. En conexión con esto, las primeras suelen mostrar un texto paleográfico, resultado de la transcripción detallada, mientras que otras presentan distintos grados de modernización de la forma gráfica, aunque no necesariamente en consonancia con la metodología de una edición crítica4. 4
Por esta razón, distinguimos entre “edición crítica”, sintagma que no nos parece pertinente para los documentos de archivo, y “presentación crítica”, que sigue los patrones de normalización gráfica que son propios de las ediciones críticas y que,
14
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
De una manera sintética, se podría decir que cada época necesita sus propias ediciones, porque han de estar hechas pensando en los lectores coetáneos. Pero, en el caso de los corpus lingüísticos, no termina aquí la cuestión, ni se dirime este problema en el plano general, teórico y metodológico, sino que adquiere una dimensión práctica, pues las decisiones sobre cómo ha de llevarse a cabo la edición condicionan la explotación del corpus, el modo en que este puede aprovecharse, y, sobre todo, para qué. Decisiones no tomadas en la elaboración son irreversibles en la recuperación de los datos: lo que no está, no puede aprovecharse. Por ejemplo, no vamos a poder estudiar la puntuación de un manuscrito o impreso si en la transcripción de estos esta no se ha reflejado. Si se nos permite un símil grosero, pero ilustrativo, es como si quisieras cubrirte pies y hombros con una manta demasiado corta. Es decir, si afinamos mucho en el reflejo de los signos gráficos de un manuscrito, y proporcionamos todo detalle acerca de los elementos abreviativos y de puntuación, no podemos pretender, al mismo tiempo, ofrecer una puntuación interpretativa, que refleje la estructura sintáctica del texto, sus cláusulas, y proporcione una presentación que facilite que ese texto sea comprendido. Esta limitación práctica justifica el modelo de doble presentación de los textos, paleográfica y crítica. De este modo, postulamos la necesidad de una planificación completa de la elaboración del corpus. Por otra parte, pronto vimos la dificultad de procesar todo el caudal de información que proporcionan los grandes corpus. Necesitábamos, además, un corpus específico, coherente en lo textual, pero susceptible de prolongarse en el tiempo, sin saltos significativos, como señala Ueda en este mismo volumen, lo que no sucede, casi nunca en los géen los corpus elaborados en GITHE, y dentro de la red CHARTA, se concretan en unos criterios que son el resultado de un estudio sistemático del objetivo de una presentación formal de los textos que transcienda el nivel meramente paelográfico, según se fundamenta en Sánchez-Prieto Borja 1998 y 2011. Los criterios de la red CHARTA, de amplia aceptación para la edición de fuentes documentales con orientación filológica, pueden verse en <http://www.redcharta.es/criterios-de-edicion/>.
Introducción
15
neros literarios, salvo, si acaso, en la poesía, y esto con muchos matices. En este sentido, el pequeño corpus, frente al grande, lo que pierde en amplitud textual puede ganarlo en coherencia y comparabilidad de diferentes textos a lo largo del tiempo. Si incluye un único tipo textual, gana en coherencia, pero a condición de que tenga amplitud. Todo esto nos llevó a seleccionar como objeto del corpus CODEA la recopilación de documentos de archivo. La validez de un proyecto de esta naturaleza dependía de que se consiguiera una variedad que permitiera valorar y estudiar los usos textuales, lingüísticos y discursivos respecto de los cuatro parámetros básicos de la variación: diacronía, diatopía, diafasia y diastratía (además de la variación idiolectal). Un corpus documental para la historia del español, ¿no será aburrido, monolítico, formulario? Esto es lo que sugería el sintagma “documento de archivo” hace algunas décadas, pero desde los años 80 del siglo pasado se ha indagado en otros fondos, como las cartas entre particulares, de mujeres, del Archivo de la Nobleza, y de los archivos privados5. Menéndez Pidal limitó la recuperación de documentos a la época de orígenes, pues dijo que a partir del s. XV las obras literarias proporcionan riquísima información, frente al “amaneramiento” cada vez mayor de los documentos; no es el caso, desde luego de la “carta privada de Andrés de Valenzuela al Duque de Pastrana sobre la información inquisitorial hecha de un hijo de Magdalena Cantero”: 5
Referencias como Castillo Gómez y Sierra Blas (2014) incluyen textos de gran interés histórico, y que invitan a tratar el s. XX como una centuria objeto de la historia de la lengua, y no como representación del español actual, como ha sido habitual hacerlo hasta ahora. El concepto de archivo privado resulta especialmente importante, porque da categoría oficial a lo que, en realidad, no son otra cosa que documentos conservados por particulares, y que se difunden en redes de investigadores y aficionados, así como de personas que, por iniciativa particular, difunden documentos, muchas veces, de enorme valor. Véase por ejemplo, este documento elaborado al inicio de la guerra subsiguiente al golpe de estado del general Franco: “Cuando puedas mandame hilo blanco y negro mecha de encendedor papel y sobres para escribir que no tengo, algunos limones, una vela, no te pido nada más que vastante te pido con las sircuntancias actuales si no puedes primero son los de casa” <http://cartasguerracivil1936-1947.blogspot.com.es/2011/10/5-desde-la-prision.html>.
16
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
Seguíase una alavarda que deve de ser insignia del marido, su cama colgada y dos pistolas a la cavezera, y por adorno rodeados tres retratos del rey, reina reinante y reina madre, nuestra señora, todos con muchos membrillos por orlas, y después un retrato de Carlitos el enano, este en pelo y desnudo sin un membrillo. Después de echo el devido acatamiento, llegaron los informantes, a quien en tropa, niños y mugeres, salimos a recivir. Asomóse un comisariaço con media vara de pera, que puede competir con la del cura de la reina madre, bostezando inquisición, pareciéndole que todos los demás somos unos judíos. (CODEA 2415, Santa Cruz de la Zarza, Toledo, 1687).
Una de las características esenciales de un corpus así concebido es la comparabilidad, que puede, incluso, potenciarse, al seleccionar determinados tipos de documentos; p. ej., los cancillerescos no son representativos para la variación geográfica; en CODEA, es posible deselecionar cualquier ítem de la clasificación mediante (!), p ej., “!cancilleresco”6. Otro criterio que suele citarse es el de la facilidad de uso, o “usabilidad” (ingl. usability). CODEA es intuitivo y no tiene necesidad de muchas explicaciones. Por otra parte, es cierto que hace tres décadas toda exploración en el mundo de las bases textuales estaba marcada por el carácter inédito de las propuestas, mientras que ahora cualquier investigador está familiarizado con tales recursos, por lo que, en general, no encuentra dificultades, aunque también es verdad que se requiere una familiaridad con cada corpus concreto, pues todos tienes rasgos diferenciales, y, CODEA en grado notable7. CODEA 6 7
Y lo mismo para cualquier otro ítem de una columna o campo (p. ej, “!XVIII” significa que no se buscarán ni seleccionarán los documentos del s. XVIII. Una de las peculiaridades es la posibilidad de realizar búsquedas tanto en la presentación crítica (por defecto) como en la paleográfica, si se selecciona esta. Las consultas pueden filtrarse por los campos de la base de datos, combinados entre sí a voluntad del usuario, lo que confiere al corpus un carácter plenamente interactivo. Estos campos son, además del número de identificación (ID), (1) regesto, (2) país, (3) provincia, (4) población, (5) fecha, (6) tipología documental (7) tipología diplomática, (8) archivo, (9), participación femenina (Emisora, Destinataria, Firmante, Amanuense), (10) ámbito de emisión del documento (Cancilleresco, Judicial, Municipal, Eclesiástico, Particular), (11) palabras clave, (12) copista y expresión relativa al acto de escritura.
Introducción
17
se presenta como un corpus gratuito, accesible para todo usuario de manera anónima, sin registro. Uno de los recursos que ofrece es la herramienta “MI CODEA”, que permite a todo usuario guardar consultas anteriores y volver a utilizarlas, bien en la misma forma o modificándola. Esto posibilita realizar cada vez consultas más complejas y afinadas. P. ej., [pa/para dist/2 *ar/*er/*ir] permite la búsqueda en el texto paleográfico de formas abreviadas y no abreviadas de “para” seguidas a una distancia de 0-2 palabras (dist/2) de formas terminadas en -ar, -er, -ir. No es este un corpus de referencia, sino que los textos se reproducen íntegros, pueden visualizarse y leerse en su integridad, y están accesibles directamente en lista (base de datos), mientras que la mayoría de los corpus tienen textos solo accesibles mediante búsqueda. Como se ha indicado, se muestran tanto la transcripción paleográfica como la presentación crítica. Ambas están elaboradas con criterios diferentes, paleográficos la primera, como su nombre indica, y críticos la segunda; es decir, en la primera se marca el desarrollo de las abreviaturas, se refleja la puntuación del manuscrito y los usos gráficos del mismo; en la crítica, se regularizan las grafías sin valor fonético distintivo, se reparten mayúsculas y minúsculas para marcar los nombres propios, y en consonancia con la puntuación; del mismo modo, se puntúa para reflejar la sintaxis. El tipo de estudio que puede hacerse a partir de ambas “ediciones” es distinto, pues la primera permite un acercamiento a los usos escriturarios, sistema braquigráfico (véase aquí la contribución de Rocío Díaz), historia de la interpunción, interpunción, usos gráficos (Ramírez Luengo), o valoración fonética de las grafías, mientras que la presentación crítica favorece el examen de la morfosintaxis (Ueda; Enrique-Arias, Ribas Marí y Gomila Albal; Del Barrio (en cambio, en el estudio de Matute Martínez se prefiere servirse de la transcripción paleográfica8), el or-
8
La autora señala que “empleamos la presentación paleográfica, no la crítica, por si hubiera algún rasgo útil en la interpretación de los predicados, p. ej. la unión o separación de palabras” (268, n.10).
18
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
den de palabras (Sánchez-Prieto Borja), el léxico (Vázquez Balonga), la onomástica (Fernández López); puede, pues, acudirse a una u otra según los intereses, o a ambas, como en el estudio de la documentación femenina de Almeida Cabrejas. Los aspectos históricos, los datos de carácter local y la información divulgativa para el curioso lector resultan más accesibles a partir del texto crítico. Seguramente, el aspecto más destacable de CODEA, y diferencial respecto de otros corpus, es la citabilidad; es decir, el corpus es directamente citable en cualquier uso, sea este divulgativo o científico, por mera curiosidad o en el marco de una investigación, para artículo en revista especializada, libro o tesis doctoral. La supervisión, estandarización, control de calidad, homogeneidad de criterios elaboración en una fase temporal no extraordinariamente dilatada y, sobre todo, la preparación exprofeso de la edición para el corpus confieren garantía de que este puede ser citado en cualquier estudio. En cierta medida, estas ventajas derivan del tamaño pequeño o medio de CODEA, pues es más difícil elaborar un gran corpus exclusivamente con ediciones de textos expresamente preparadas para el mismo. La concepción específica del corpus lo habilita para su uso, pero no basta con que la elaboración técnica (y metodológica, en sentido más amplio) sea apropiada; es necesario proveer cada documento editado de metadatos que permitan recuperar la información, pues de otro modo esta quedaría oculta o difícilmente accesible. Otra de la características que ha de tener un corpus es la implementabilidad; por esta podemos entender la facilidad con la que pueden agregarse no solo nuevos textos, sino nuevos recursos. Una de las diferencias más importantes entre la versión inicial de CODEA 2011 y 2015 fue la incorporación de un recurso digital nuevo, el Atlas Lingüístico Diacrónico y Dinámico del Español (ALDIDI). Como puede leerse en la web, CODEA es un verdadero Atlas diacrónico dinámico del español. Su forma avanzada de visualización, al proyectar directamente sobre el mapa los resultados de las búsquedas, permite hacerse una idea inmediata del peso del factor geográfico en la variación lingüística histórica en espacio
Introducción
19
peninsular desde los orígenes a 1800, y no solo para el léxico, sino para cualquier variante gráfica, fonética, morfosintáctica y léxica susceptible de búsqueda en el corpus. Es así posible entender mejor la distribución espacial de las variantes del español y la interrelación entre el factor diatópico y los demás parámetros de la variación lingüística. Pueden ahora buscarse, aparte de distribuciones léxicas, la extensión geográfica de elementos morfosintácticos como [otro/otri/otre/otrie], agora/ahora, *mente/*mientre, el superlativo en [*ísimo], formas verbales en [*rá/*drá], colocaciones [no ... ning*], [no ...alg*] y cualquiera que se le ocurra al usuario, y proyectarse de manera inmediata sobre el mapa de la Península Ibérica.
Otra de las novedades, esta en curso de incorporación, es la grabación del audio de la lectura de una selección de documentos (160, 4 % del corpus total). Esta versión aporta una lectura comprensiva del texto, de manera que, en paralelo a la visualización de la presentación crítica, permite al usuario no avezado en los textos de otras épocas acceder al sentido del texto, a su contenido sintáctico, tal y como puede valorarse por la entonación y pausas, que proporcionan una información más rica que la del texto escrito y puntuado, aunque, lógicamente, interpretativa en la misma o mayor medida que la presentación crítica y, por tanto, susceptible de errores. En definitiva, los corpus deben actualizarse para incorporar continuamente nuevos elementos textuales (documentos de archivos editados, en el caso de CODEA, hasta 4000 documentos anteriores a 1900 en la versión que estará disponible de manera inmediata) y recursos de recuperación de la información. Todo ello se relaciona con un concepción dinámica en un triple plano: (1) en el de la investigación, (2) en el de los recursos para esa investigación y (3) en la concepción del texto mismo, pues, frente a la idea habitual del texto como “producto”, oponemos la de “proceso”, es decir, como el resultado de un proceso elaborativo9. 9
Muestra de este “proceso” son las correcciones ante errores en su preparación, subsanadas mediante las fórmulas habituales de los notarios (“va emendado ...”, “va escrito sobre raído...” ... “vala”, “vala e non empezca”). La revisión del notario se percibe en los documentos notariales por el cambio de mano. En una plano más amplio, se ha de señalar que el proceso empieza con la iussio, al que sigue la
20
Belén Almeida Cabrejas y Pedro Sánchez-Prieto Borja
Creemos responder así a la pregunta de por qué un corpus de documentos. Este no se presenta en oposición a los literarios, pero sí complementa sus datos con aportaciones en el plano diacrónico o cronológico, diatópico o geográfico, diafásico o registral, diastrático o sociolingüístico. No hay pues, de partida, un corpus mejor que otro y, desde luego, no hay que desechar ninguno para preferir y utilizar solo otros, sino que los diferentes tipos son complementarios, y todos pueden encontrar su lugar en el gran edificio de la historia lingüística actual. Si hubiera que caracterizar el método de la lingüística diacrónica, uno de sus principios más evidente es la presentación cuantitativa de los datos; precisamente, esta es inherente al uso de corpus; existía, desde luego, antes, pero la presentación solía ser simple, y se limitaba a las frecuencias absolutas y relativas, expresadas en %. Los corpus han ido parejos de la cuantificación, pero ahora en modo más complejo, pues ya no basta con relativizar las frecuencias en porcentajes entre dos o más opciones (p. ej., tanto por ciento de -ades, -áis, y ás en un texto), sino que es posible proporcionar un patrón uniforme que permita la comparación entre épocas con desigual número de documentos y entre documentos de diferente extensión. Así, en CODEA se optado por ofrecer número de apariciones de un elemento por cada 10000 palabras, como en la secuencia discontinua “no/non ... ninguno”: lo otro porqu’el dicho lugar segund es pobre e estéril 26 no ay persona ninguna que traya hato de cabras salvo si traen 27 algunas para sustentación de sus pastores porqu’el que más trae 28 no trae de diez arriba, las cuales segund son pocas no pueden 29 hazer perjuizio ninguno (CODEA 1162, Toledo, 152)
La evolución cronológica se muestra en el siguiente gráfico:
notato o minutatio: a partir de esta nota o minuta, el escribano puede elaborar el documento. Para la elaboración de los diplomas de las cancillerías de Fernando III, Alfonso X, Sancho IV y Fernando IV, v. Martín Aizupuru 2020: 62-68).