english Icono del idioma   español Icono del idioma  

Please use this identifier to cite or link to this item: https://hdl.handle.net/20.500.12008/55953 How to cite
Title: FronteiraNLP : Modelando el contacto español-portugués en Uruguay
Authors: Souza García, Rodrigo
Tutor: Chiruzzo, Luis
Góngora, Santiago
Type: Tesis de grado
Keywords: Portuñol, Procesamiento de Lenguaje Natural, Clasificación de token, Naive Bayes, BERT, Heurísticas
Issue Date: 2026
Abstract: Esta tesis presenta una serie de esfuerzos iniciales para aplicar técnicas de procesamiento de lenguaje natural (PLN) al estudio del portuñol, una variedad lingüística que surge del contacto sostenido entre el español y el portugués en la frontera Uruguay–Brasil. El objetivo principal fue desarrollar y evaluar métodos capaces de clasificar automáticamente cada token en una de seis categorías: español (es), portugués (pt), híbrido (mix), entidad nombrada (ne), extranjero (foreign) y otros símbolos o marcadores (other). Como base experimental, se anotó manualmente un corpus previamente existente, compuesto por transcripciones orales de hablantes de la región norte de Uruguay. Este corpus fue preprocesado, tokenizado y dividido en conjuntos de entrenamiento, desarrollo y prueba, permitiendo realizar experimentos controlados bajo un marco reproducible de evaluación. Se exploraron tres enfoques principales. En primer lugar, se implementaron heurísticas basadas en reglas y diccionarios de español, portugués e inglés. Este método, aunque simple e interpretable, alcanzó una accuracy de 0,88 gracias a su buen desempeño en las clases mayoritarias, pero mostró limitaciones notorias en las categorías minoritarias, especialmente en los tokens híbridos (mix). En segundo lugar, se aplicó un modelo estadístico Naive Bayes en su variante Complement, utilizando representaciones de n-gramas de caracteres. Este enfoque logró mejorar parcialmente el reconocimiento de tokens híbridos (F1=0,54 frente a 0,40 de las heurísticas), aunque su desempeño global no superó a las reglas, con accuracy=0,85 y Macro-F1 =0,64. Por último, se evaluaron modelos neuronales basados en BERT. Se llevó a cabo un fine-tuning de dos variantes: el modelo multilingüe bert-base-multilingualcased y BERTinho, entrenado en gallego, una lengua en contacto histórico con el español y el portugués. Ambos modelos lograron el mejor equilibrio entre clases: mBERT obtuvo Macro-F1 =0,67 y BERTinho 0,66 en el conjunto de prueba, destacándose especialmente en la detección de tokens híbridos (mix). Los resultados confirman que, incluso en este contexto de escasez de datos y fuerte variación lingüística, los enfoques basados en representaciones contextuales profundas ofrecen mayor robustez y capacidad de generalización frente a los métodos estadísticos y heurísticos. El estudio demuestra que el portuñol puede ser modelado computacionalmente mediante técnicas modernas de PLN y sienta las bases para el desarrollo de recursos y modelos específicos que contribuyan al análisis y preservación de las variedades lingüísticas en contacto.
Publisher: Udelar. FI.
Citation: Souza García, R. FronteiraNLP : Modelando el contacto español-portugués en Uruguay [en línea] Tesis de grado. Montevideo : Udelar. FI. INCO, 2026.
Obtained title: Licenciado en Computación
University or service that grants the title: Universidad de la República (Uruguay). Facultad de Ingeniería
License: Licencia Creative Commons Atribución - No Comercial (CC - By-NC 4.0)
Appears in Collections:Tesis de grado - Instituto de Computación

Files in This Item:
File Description SizeFormat  
Sou26.pdfTesis de grado868,95 kBAdobe PDFView/Open


This item is licensed under a Creative Commons License Creative Commons