De PDF a datos de entrenamiento para IA
Documentos en PDF convertidos en un corpus limpio, anonimizado y con procedencia, en tu navegador.
Enviado a servidores: 0 BNada salió de tu dispositivo
Sobre esta herramienta
Las herramientas que convierten PDF a texto terminan en Markdown. Las que limpian corpus empiezan en JSONL y son tuberías de Python pensadas para terabytes de web. El puente entre las dos no existía, y es justo donde viven la procedencia, el reparto y el rastro de anonimización.
Cada registro que sale de aquí dice de qué archivo, de qué sección y con cuántos datos personales sustituidos. Los entrenadores ignoran los campos que no conocen, así que dejarlo puesto sale gratis y sirve para rastrear el ejemplo que provocó una respuesta rara.
Cómo funciona
- 1
Suelta los PDF.
- 2
Elige formato y opciones de limpieza.
- 3
Descarga el JSONL con la procedencia dentro.
Preguntas frecuentes
- ¿Qué es el campo «sirdas» de cada línea?
- La procedencia: documento, número de trozo, encabezado, tokens y cuántos datos personales se sustituyeron. Si un ejemplo te da problemas, sabes de qué página salió.
- ¿Funciona con PDF escaneados?
- Necesita texto seleccionable. Pasa antes cada documento por el OCR local, que también corre en tu navegador.
- ¿Puedo quitar la procedencia?
- Sí, desde la CLI con --no-meta. En la web va incluida porque ocupa poco y evita tener un corpus que nadie puede auditar.