Dataset para Llama, Mistral y modelos locales
JSONL en el formato de TRL y Unsloth, listo para afinar un modelo en tu propia máquina.
Enviado a servidores: 0 BNada salió de tu dispositivo
Sobre esta herramienta
Si vas a afinar un modelo abierto en tu equipo o en una GPU alquilada, los documentos nunca tendrían que pasar por un servicio ajeno solo para convertirse en un archivo de texto. Aquí no pasan.
El formato de conversación produce el campo «messages» con sus roles, que es lo que cargan TRL, Unsloth y llama-factory sin traducción de por medio. El formato de texto suelto sirve para seguir preentrenando sobre tu propio material.
Cómo funciona
- 1
Suelta los PDF.
- 2
Elige el formato de conversación.
- 3
Descarga el JSONL y cárgalo con load_dataset.
Preguntas frecuentes
- ¿Sirve para LoRA y QLoRA?
- Sí: el formato del dataset es independiente de la técnica de afinado. LoRA cambia cómo se actualizan los pesos, no cómo se leen los datos.
- ¿Y para DPO o datos de preferencia?
- No los generamos, y es deliberado: un par elegido/rechazado exige producir dos respuestas, o sea llamar a un modelo con tus documentos. Eso rompería lo único que prometemos.
- ¿Puedo automatizarlo para cientos de archivos?
- Sí, con la CLI: npx sirdas dataset *.pdf --split -d ./ds. Es el mismo motor.