english Icono del idioma   español Icono del idioma  

Por favor, use este identificador para citar o enlazar este ítem: https://hdl.handle.net/20.500.12008/56413 Cómo citar
Registro completo de metadatos
Campo DC Valor Lengua/Idioma
dc.contributor.authorSastre, Ignacio-
dc.contributor.authorEtcheverry, Lorena-
dc.contributor.authorRey, Guillermo-
dc.contributor.authorMoncecchi, Guillermo-
dc.contributor.authorRosá, Aiala-
dc.date.accessioned2026-08-19T17:52:48Z-
dc.date.available2026-08-19T17:52:48Z-
dc.date.issued2025-
dc.identifier.citationSastre, I., Etcheverry, L., Rey, G. y otros. Post-OCR correction using large language models with constrained decoding [Preprint] Publicado en: Researche Square, julio 2025. 16 p. DOI: doi.org/10.21203/rs.3.rs-6823036/v1.es
dc.identifier.urihttps://hdl.handle.net/20.500.12008/56413-
dc.description.abstractThis article addresses the problem of correcting noisy Optical Character Recognition (OCR) outputs from digitized historical documents, specifically those from the Berrutti Archive related to Uruguay’s civic-military dictatorship. These documents—produced with typewriters, diverse layouts, and overlaid annotations—pose significant hallenges for standard OCR tools, resulting in highly errorprone text. We present a novel post-OCR correction method that leverages fine-tuned open-source Large Language Models (LLMs) combined with a constrained decoding strategy. This strategy incorporates character-level similarity between the OCR input and the generated output at decoding time, steering the model toward corrections that closely preserve the original text structure. We evaluate our method on a gold-standard dataset of over 2000 annotated lines and show that it outperforms prompting and standard fine-tuning approaches, reducing both character error rate (CER) and word error rate (WER). The corrected outputs provide more accurate input for downstream tasks, such as named entity recognition, relation and event extraction, and knowledge graph construction, thereby supporting the broader goal of extracting knowledge from historically significant and sensitive archives.es
dc.description.sponsorshipProyecto ANII IA_1_2022_1_173863es
dc.format.extent16 p.es
dc.format.mimetypeapplication/pdfes
dc.language.isoenes
dc.rightsLas obras depositadas en el Repositorio se rigen por la Ordenanza de los Derechos de la Propiedad Intelectual de la Universidad de la República.(Res. Nº 91 de C.D.C. de 8/III/1994 – D.O. 7/IV/1994) y por la Ordenanza del Repositorio Abierto de la Universidad de la República (Res. Nº 16 de C.D.C. de 07/10/2014)es
dc.subjectNatural Language Processinges
dc.subjectOptical Character Recognition (OCR)es
dc.subjectPost-OCR Correctiones
dc.subjectLLMs with Constrained Decodinges
dc.titlePost-OCR correction using large language models with constrained decodinges
dc.typePreprintes
dc.contributor.filiacionSastre Ignacio, Universidad de la República (Uruguay). Facultad de Ingeniería. Instituto de Computación.-
dc.contributor.filiacionEtcheverry Lorena, Universidad de la República (Uruguay). Facultad de Ingeniería. Instituto de Computación.-
dc.contributor.filiacionRey Guillermo, Universidad de la República (Uruguay). Facultad de Ingeniería. Instituto de Computación.-
dc.contributor.filiacionMoncecchi Guillermo, Universidad de la República (Uruguay). Facultad de Ingeniería. Instituto de Computación.-
dc.contributor.filiacionRosá Aiala, Universidad de la República (Uruguay). Facultad de Ingeniería. Instituto de Computación.-
dc.rights.licenceLicencia Creative Commons Atribución - No Comercial - Sin Derivadas (CC - By-NC-ND 4.0)es
Aparece en las colecciones: Publicaciones académicas y científicas - Instituto de Computación

Ficheros en este ítem:
Fichero Descripción Tamaño Formato   
SERMR25.pdfPreprint1,88 MBAdobe PDFVisualizar/Abrir


Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons Creative Commons