Por favor, use este identificador para citar o enlazar este ítem:
https://hdl.handle.net/20.500.12008/55953
Cómo citar
| Título: | FronteiraNLP : Modelando el contacto español-portugués en Uruguay |
| Autor: | Souza García, Rodrigo |
| Tutor: | Chiruzzo, Luis Góngora, Santiago |
| Tipo: | Tesis de grado |
| Palabras clave: | Portuñol, Procesamiento de Lenguaje Natural, Clasificación de token, Naive Bayes, BERT, Heurísticas |
| Fecha de publicación: | 2026 |
| Resumen: | Esta tesis presenta una serie de esfuerzos iniciales para aplicar técnicas de procesamiento de lenguaje natural (PLN) al estudio del portuñol, una variedad lingüística que surge del contacto sostenido entre el español y el portugués en la frontera Uruguay–Brasil. El objetivo principal fue desarrollar y evaluar métodos capaces de clasificar automáticamente cada token en una de seis categorías: español (es), portugués (pt), híbrido (mix), entidad nombrada (ne), extranjero (foreign) y otros símbolos o marcadores (other). Como base experimental, se anotó manualmente un corpus previamente existente, compuesto por transcripciones orales de hablantes de la región norte de Uruguay. Este corpus fue preprocesado, tokenizado y dividido en conjuntos de entrenamiento, desarrollo y prueba, permitiendo realizar experimentos controlados bajo un marco reproducible de evaluación. Se exploraron tres enfoques principales. En primer lugar, se implementaron heurísticas basadas en reglas y diccionarios de español, portugués e inglés. Este método, aunque simple e interpretable, alcanzó una accuracy de 0,88 gracias a su buen desempeño en las clases mayoritarias, pero mostró limitaciones notorias en las categorías minoritarias, especialmente en los tokens híbridos (mix). En segundo lugar, se aplicó un modelo estadístico Naive Bayes en su variante Complement, utilizando representaciones de n-gramas de caracteres. Este enfoque logró mejorar parcialmente el reconocimiento de tokens híbridos (F1=0,54 frente a 0,40 de las heurísticas), aunque su desempeño global no superó a las reglas, con accuracy=0,85 y Macro-F1 =0,64. Por último, se evaluaron modelos neuronales basados en BERT. Se llevó a cabo un fine-tuning de dos variantes: el modelo multilingüe bert-base-multilingualcased y BERTinho, entrenado en gallego, una lengua en contacto histórico con el español y el portugués. Ambos modelos lograron el mejor equilibrio entre clases: mBERT obtuvo Macro-F1 =0,67 y BERTinho 0,66 en el conjunto de prueba, destacándose especialmente en la detección de tokens híbridos (mix). Los resultados confirman que, incluso en este contexto de escasez de datos y fuerte variación lingüística, los enfoques basados en representaciones contextuales profundas ofrecen mayor robustez y capacidad de generalización frente a los métodos estadísticos y heurísticos. El estudio demuestra que el portuñol puede ser modelado computacionalmente mediante técnicas modernas de PLN y sienta las bases para el desarrollo de recursos y modelos específicos que contribuyan al análisis y preservación de las variedades lingüísticas en contacto. |
| Editorial: | Udelar. FI. |
| Citación: | Souza García, R. FronteiraNLP : Modelando el contacto español-portugués en Uruguay [en línea] Tesis de grado. Montevideo : Udelar. FI. INCO, 2026. |
| Título Obtenido: | Licenciado en Computación |
| Facultad o Servicio que otorga el Título: | Universidad de la República (Uruguay). Facultad de Ingeniería |
| Licencia: | Licencia Creative Commons Atribución - No Comercial (CC - By-NC 4.0) |
| Aparece en las colecciones: | Tesis de grado - Instituto de Computación |
Ficheros en este ítem:
| Fichero | Descripción | Tamaño | Formato | ||
|---|---|---|---|---|---|
| Sou26.pdf | Tesis de grado | 868,95 kB | Adobe PDF | Visualizar/Abrir |
Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons