Crear un dataset para fine-tuning desde tus PDF
Convierte tus documentos en el JSONL que esperan los entrenadores, sin subirlos a ningún servicio.
Sobre esta herramienta
Afinar un modelo con tus propios documentos empieza por una tarea aburrida: convertir PDF en un archivo JSONL con los nombres de campo exactos que espera el entrenador. Equivocarte en un nombre significa que la carga falla veinte minutos después, con un error que no explica nada.
Aquí eliges el formato y sale con los campos correctos: «text» para seguir preentrenando, «messages» para conversación, «prompt» y «completion» para instrucción. Son los nombres de TRL, que es también lo que comen Unsloth y el afinado de OpenAI.
Y como el archivo no sale de tu equipo, puedes hacerlo con historias clínicas, contratos o expedientes sin pedirle permiso a nadie.
Cómo funciona
- 1
Suelta todos los PDF de golpe.
- 2
Elige el formato y deja marcadas la anonimización y la limpieza de repetidos.
- 3
Construye y descarga el .jsonl.
Preguntas frecuentes
- ¿Cuántos documentos necesito?
- Depende del entrenador, y conviene mirar su documentación antes de empezar: el afinado de OpenAI pide al menos 10 ejemplos, y el de Claude 3 Haiku en Bedrock, 32. Con el mínimo se puede ejecutar el entrenamiento, que no es lo mismo que obtener un buen resultado.
- ¿El fine-tuning le enseña datos nuevos al modelo?
- Enseña sobre todo formato, tono y forma de responder. Para que el modelo conozca hechos concretos de tus documentos y los cite, casi siempre funciona mejor RAG: recuperar el fragmento y pasárselo en el momento. Nuestra herramienta de PDF a Markdown con troceado prepara justo eso.
- ¿Qué pasa con los datos personales?
- La anonimización viene activada. Un modelo repite lo que ve: se ha demostrado que se pueden extraer nombres, teléfonos y correos del texto con el que se entrenó, incluso de fragmentos que aparecían una sola vez.