Entrenar un modelo de IA con mis propios documentos
El paso previo que nadie explica: preparar los datos bien, en tu equipo, antes de gastar una hora de GPU.
Sobre esta herramienta
«Quiero un modelo que sepa de lo mío» suena a una tarde de trabajo y son tres días, casi todos gastados en los datos. La parte que decide el resultado no es el entrenamiento: es lo que le das de comer.
Tres errores se repiten y ninguno avisa. El texto duplicado se aprende de memoria en vez de generalizarse. El membrete y el pie que van en los cien documentos ocupan un tercio del corpus y no enseñan nada. Y repartir los trozos al azar entre entrenamiento y prueba deja la misma plantilla en los dos lados, así que la métrica sale preciosa y mentirosa.
Esta herramienta se ocupa de los tres, te dice cuánto encontró de cada cosa y no toca nada sin enseñártelo antes.
Cómo funciona
- 1
Suelta todos tus documentos.
- 2
Mira el aviso de cuánto texto es plantilla repetida.
- 3
Marca el reparto en entrenamiento, validación y prueba, y descarga los tres archivos.
Preguntas frecuentes
- ¿Por qué el reparto va por documento y no por trozo?
- Porque dos trozos del mismo contrato en lados opuestos significan que el modelo ya vio la plantilla, el vocabulario y el formato antes de la prueba. Es una fuga silenciosa: la única señal es que la métrica mejora.
- ¿Qué son los «párrafos de plantilla»?
- Los que aparecen idénticos en varios documentos: el membrete, el pie de confidencialidad, la cláusula de tratamiento de datos. Al quitarlos se conserva siempre la primera aparición, así que el texto no desaparece del corpus, deja de estar repetido.
- ¿Puedo hacerlo con documentos de clientes?
- Ese es el motivo de que exista. Nada se sube, y la anonimización viene puesta. Aun así, revisa el resultado: la detección es de reglas y puede no ver un formato poco común.