english Icono del idioma   español Icono del idioma  

Por favor, use este identificador para citar o enlazar este ítem: https://hdl.handle.net/20.500.12008/55953 Cómo citar
Título: FronteiraNLP : Modelando el contacto español-portugués en Uruguay
Autor: Souza García, Rodrigo
Tutor: Chiruzzo, Luis
Góngora, Santiago
Tipo: Tesis de grado
Palabras clave: Portuñol, Procesamiento de Lenguaje Natural, Clasificación de token, Naive Bayes, BERT, Heurísticas
Fecha de publicación: 2026
Resumen: Esta tesis presenta una serie de esfuerzos iniciales para aplicar técnicas de procesamiento de lenguaje natural (PLN) al estudio del portuñol, una variedad lingüística que surge del contacto sostenido entre el español y el portugués en la frontera Uruguay–Brasil. El objetivo principal fue desarrollar y evaluar métodos capaces de clasificar automáticamente cada token en una de seis categorías: español (es), portugués (pt), híbrido (mix), entidad nombrada (ne), extranjero (foreign) y otros símbolos o marcadores (other). Como base experimental, se anotó manualmente un corpus previamente existente, compuesto por transcripciones orales de hablantes de la región norte de Uruguay. Este corpus fue preprocesado, tokenizado y dividido en conjuntos de entrenamiento, desarrollo y prueba, permitiendo realizar experimentos controlados bajo un marco reproducible de evaluación. Se exploraron tres enfoques principales. En primer lugar, se implementaron heurísticas basadas en reglas y diccionarios de español, portugués e inglés. Este método, aunque simple e interpretable, alcanzó una accuracy de 0,88 gracias a su buen desempeño en las clases mayoritarias, pero mostró limitaciones notorias en las categorías minoritarias, especialmente en los tokens híbridos (mix). En segundo lugar, se aplicó un modelo estadístico Naive Bayes en su variante Complement, utilizando representaciones de n-gramas de caracteres. Este enfoque logró mejorar parcialmente el reconocimiento de tokens híbridos (F1=0,54 frente a 0,40 de las heurísticas), aunque su desempeño global no superó a las reglas, con accuracy=0,85 y Macro-F1 =0,64. Por último, se evaluaron modelos neuronales basados en BERT. Se llevó a cabo un fine-tuning de dos variantes: el modelo multilingüe bert-base-multilingualcased y BERTinho, entrenado en gallego, una lengua en contacto histórico con el español y el portugués. Ambos modelos lograron el mejor equilibrio entre clases: mBERT obtuvo Macro-F1 =0,67 y BERTinho 0,66 en el conjunto de prueba, destacándose especialmente en la detección de tokens híbridos (mix). Los resultados confirman que, incluso en este contexto de escasez de datos y fuerte variación lingüística, los enfoques basados en representaciones contextuales profundas ofrecen mayor robustez y capacidad de generalización frente a los métodos estadísticos y heurísticos. El estudio demuestra que el portuñol puede ser modelado computacionalmente mediante técnicas modernas de PLN y sienta las bases para el desarrollo de recursos y modelos específicos que contribuyan al análisis y preservación de las variedades lingüísticas en contacto.
Editorial: Udelar. FI.
Citación: Souza García, R. FronteiraNLP : Modelando el contacto español-portugués en Uruguay [en línea] Tesis de grado. Montevideo : Udelar. FI. INCO, 2026.
Título Obtenido: Licenciado en Computación
Facultad o Servicio que otorga el Título: Universidad de la República (Uruguay). Facultad de Ingeniería
Licencia: Licencia Creative Commons Atribución - No Comercial (CC - By-NC 4.0)
Aparece en las colecciones: Tesis de grado - Instituto de Computación

Ficheros en este ítem:
Fichero Descripción Tamaño Formato   
Sou26.pdfTesis de grado868,95 kBAdobe PDFVisualizar/Abrir


Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons Creative Commons