OCR de PDF en español, sin subir el archivo
Reconocimiento de texto en español con tildes y ñ, ejecutado en tu navegador. Ideal para documentos colombianos escaneados.
Sobre esta herramienta
El OCR genérico suele estar afinado para inglés y destroza las tildes, la ñ y los signos de apertura (¿ ¡). Aquí cargamos el modelo de español junto al de inglés, así que un documento en español — o mezclado, como suele pasar en informes técnicos — se reconoce con su ortografía.
Eso importa especialmente para la anonimización: si el OCR escribe «Peña» como «Pena» o parte una cédula en dos, el detector de datos personales puede fallar. Con el modelo correcto, cédulas, NIT y nombres se reconocen enteros y se pueden ocultar.
Cómo funciona
- 1
Suelta el PDF escaneado en español.
- 2
Pulsa «Extraer texto con OCR».
- 3
Revisa los datos personales detectados y copia el Markdown.
Preguntas frecuentes
- ¿Qué idiomas reconoce?
- Español e inglés a la vez, que cubre la mayoría de documentos de la región. Otros idiomas requerirían descargar más modelos.
- ¿Conserva las tildes y la ñ?
- Sí, con el modelo de español cargado. En escaneos de baja calidad las tildes son lo primero que se pierde: revisa el resultado.