Sırdaş

De PDF a datos de entrenamiento para IA

Documentos en PDF convertidos en un corpus limpio, anonimizado y con procedencia, en tu navegador.

Enviado a servidores: 0 BNada salió de tu dispositivo

Sobre esta herramienta

Las herramientas que convierten PDF a texto terminan en Markdown. Las que limpian corpus empiezan en JSONL y son tuberías de Python pensadas para terabytes de web. El puente entre las dos no existía, y es justo donde viven la procedencia, el reparto y el rastro de anonimización.

Cada registro que sale de aquí dice de qué archivo, de qué sección y con cuántos datos personales sustituidos. Los entrenadores ignoran los campos que no conocen, así que dejarlo puesto sale gratis y sirve para rastrear el ejemplo que provocó una respuesta rara.

Cómo funciona

  1. 1

    Suelta los PDF.

  2. 2

    Elige formato y opciones de limpieza.

  3. 3

    Descarga el JSONL con la procedencia dentro.

Preguntas frecuentes

¿Qué es el campo «sirdas» de cada línea?
La procedencia: documento, número de trozo, encabezado, tokens y cuántos datos personales se sustituyeron. Si un ejemplo te da problemas, sabes de qué página salió.
¿Funciona con PDF escaneados?
Necesita texto seleccionable. Pasa antes cada documento por el OCR local, que también corre en tu navegador.
¿Puedo quitar la procedencia?
Sí, desde la CLI con --no-meta. En la web va incluida porque ocupa poco y evita tener un corpus que nadie puede auditar.

Otras herramientas