Extraer el texto de un PDF escaneado (OCR local)
Reconoce el texto de un PDF escaneado en tu propio dispositivo y conviértelo a Markdown, sin subir el documento.
Sobre esta herramienta
Un PDF escaneado es, en realidad, una foto de cada página: no tiene texto que se pueda seleccionar, buscar ni copiar. Para leerlo con una IA o para buscar dentro hace falta OCR (reconocimiento óptico de caracteres).
Casi todos los servicios de OCR gratuitos suben tu documento a un servidor. Aquí el motor de reconocimiento se descarga una vez desde este mismo sitio (unos 3 MB) y corre dentro de tu navegador: el escaneo nunca sale del equipo. Después queda guardado y funciona sin internet.
El resultado no es un volcado plano: reutilizamos las mismas reglas de estructura que con un PDF de texto, así que los títulos grandes se convierten en encabezados y los párrafos se agrupan. Y la anonimización se aplica igual sobre el texto reconocido.
Cómo funciona
- 1
Suelta el PDF escaneado.
- 2
Si no tiene texto seleccionable, aparecerá el botón «Extraer texto con OCR».
- 3
Espera el reconocimiento (puedes cancelarlo en cualquier momento).
- 4
Revisa el texto, con los datos personales ya marcados, y cópialo o descárgalo.
Preguntas frecuentes
- ¿El OCR también funciona sin internet?
- Sí, después de la primera vez. El motor y los modelos de idioma quedan guardados en tu navegador; a partir de ahí puedes reconocer documentos con el WiFi apagado.
- ¿Qué tan preciso es?
- Usamos los modelos rápidos de Tesseract para español e inglés. Con un escaneo nítido y derecho el resultado es bueno; con fotos torcidas, con sombras o de baja resolución, empeora. Escanea a 300 dpi si puedes.
- ¿Por qué tarda?
- Reconocer texto es trabajo pesado y ocurre en tu procesador, no en un servidor. Unos segundos por página es normal; verás el progreso y puedes cancelar.
- ¿Reconoce escritura a mano?
- No de forma fiable. Tesseract está pensado para texto impreso.