Sırdaş

OCR de PDF en español, sin subir el archivo

Reconocimiento de texto en español con tildes y ñ, ejecutado en tu navegador. Ideal para documentos colombianos escaneados.

Enviado a servidores: 0 BNada salió de tu dispositivo

Sobre esta herramienta

El OCR genérico suele estar afinado para inglés y destroza las tildes, la ñ y los signos de apertura (¿ ¡). Aquí cargamos el modelo de español junto al de inglés, así que un documento en español — o mezclado, como suele pasar en informes técnicos — se reconoce con su ortografía.

Eso importa especialmente para la anonimización: si el OCR escribe «Peña» como «Pena» o parte una cédula en dos, el detector de datos personales puede fallar. Con el modelo correcto, cédulas, NIT y nombres se reconocen enteros y se pueden ocultar.

Cómo funciona

  1. 1

    Suelta el PDF escaneado en español.

  2. 2

    Pulsa «Extraer texto con OCR».

  3. 3

    Revisa los datos personales detectados y copia el Markdown.

Preguntas frecuentes

¿Qué idiomas reconoce?
Español e inglés a la vez, que cubre la mayoría de documentos de la región. Otros idiomas requerirían descargar más modelos.
¿Conserva las tildes y la ñ?
Sí, con el modelo de español cargado. En escaneos de baja calidad las tildes son lo primero que se pierde: revisa el resultado.

Otras herramientas