Sırdaş

Entrenar un modelo de IA con mis propios documentos

El paso previo que nadie explica: preparar los datos bien, en tu equipo, antes de gastar una hora de GPU.

Enviado a servidores: 0 BNada salió de tu dispositivo

Sobre esta herramienta

«Quiero un modelo que sepa de lo mío» suena a una tarde de trabajo y son tres días, casi todos gastados en los datos. La parte que decide el resultado no es el entrenamiento: es lo que le das de comer.

Tres errores se repiten y ninguno avisa. El texto duplicado se aprende de memoria en vez de generalizarse. El membrete y el pie que van en los cien documentos ocupan un tercio del corpus y no enseñan nada. Y repartir los trozos al azar entre entrenamiento y prueba deja la misma plantilla en los dos lados, así que la métrica sale preciosa y mentirosa.

Esta herramienta se ocupa de los tres, te dice cuánto encontró de cada cosa y no toca nada sin enseñártelo antes.

Cómo funciona

  1. 1

    Suelta todos tus documentos.

  2. 2

    Mira el aviso de cuánto texto es plantilla repetida.

  3. 3

    Marca el reparto en entrenamiento, validación y prueba, y descarga los tres archivos.

Preguntas frecuentes

¿Por qué el reparto va por documento y no por trozo?
Porque dos trozos del mismo contrato en lados opuestos significan que el modelo ya vio la plantilla, el vocabulario y el formato antes de la prueba. Es una fuga silenciosa: la única señal es que la métrica mejora.
¿Qué son los «párrafos de plantilla»?
Los que aparecen idénticos en varios documentos: el membrete, el pie de confidencialidad, la cláusula de tratamiento de datos. Al quitarlos se conserva siempre la primera aparición, así que el texto no desaparece del corpus, deja de estar repetido.
¿Puedo hacerlo con documentos de clientes?
Ese es el motivo de que exista. Nada se sube, y la anonimización viene puesta. Aun así, revisa el resultado: la detección es de reglas y puede no ver un formato poco común.

Otras herramientas