Sırdaş

PDF a Markdown para RAG

Prepara tu PDF para RAG: texto limpio en Markdown, datos personales anonimizados y conteo de tokens. Todo en tu dispositivo.

Enviado a servidores: 0 BNada salió de tu dispositivo

Sobre esta herramienta

RAG responde mejor con texto bien estructurado: encabezados, listas y párrafos, sin cabeceras repetidas ni números de página en medio. Convertimos tu PDF a Markdown con esa estructura y estimamos los tokens para que sepas si cabe en una conversación.

Antes de que pegues nada en RAG, reemplazamos los datos personales por etiquetas coherentes ([NOMBRE_1], [DOCUMENTO_1]…): el mismo dato recibe siempre la misma etiqueta, así el modelo entiende el documento sin conocer a las personas.

Para RAG y embeddings, el Markdown con encabezados y párrafos limpios produce fragmentos (chunks) coherentes y recuperables.

Cómo funciona

  1. 1

    Suelta el PDF.

  2. 2

    Revisa el Markdown y los datos marcados en color.

  3. 3

    Copia (o descarga el .md) y pégalo en RAG.

Preguntas frecuentes

¿RAG no puede leer el PDF directamente?
Muchos asistentes aceptan PDF, pero al subirlo el archivo viaja a sus servidores. Con Sırdaş el PDF nunca sale de tu equipo: solo compartes con RAG el texto ya anonimizado que decidas pegar.
¿Qué datos se ocultan antes de pegarlo en RAG?
Cédulas y otros documentos de identidad, NIT, correos, teléfonos, fechas, direcciones, tarjetas, números de historia clínica y nombres con etiqueta (paciente, arrendador, firmado por…). La detección es automática y puede omitir datos: revisa el resultado.
¿Cómo sé cuántos tokens ocupa?
Mostramos una estimación (unos 4 caracteres por token). Es orientativa; cada modelo cuenta un poco distinto.

Otras herramientas