Sırdaş

¿Fine-tuning o RAG para mis documentos?

La pregunta que conviene responder antes de preparar un dataset. Las dos salidas se preparan aquí.

Enviado a servidores: 0 BNada salió de tu dispositivo

Sobre esta herramienta

Mucha gente que busca «entrenar un modelo con mis PDF» en realidad quiere RAG, y se ahorraría el entrenamiento entero. Merece la pena separarlo antes de gastar tiempo.

Regla corta: si quieres que el modelo **sepa** algo concreto de tus documentos y lo cite bien, RAG. Recuperas el fragmento en el momento y se lo pasas; se actualiza cambiando un archivo y el modelo puede decir de dónde sacó la respuesta. Si quieres que **escriba de otra manera** —un formato fijo, un tono, una estructura de informe—, fine-tuning.

Lo incómodo: el fine-tuning no es una forma fiable de meter hechos. El modelo aprende el estilo del material mucho antes que su contenido, y cuando le falta un dato lo inventa con el tono correcto, que es peor que no saberlo.

Aquí se preparan las dos cosas. Para RAG, PDF a Markdown con troceado por encabezados. Para fine-tuning, esta herramienta.

Cómo funciona

  1. 1

    Decide si quieres que el modelo sepa algo o que escriba distinto.

  2. 2

    Para RAG, usa PDF a Markdown y sus trozos.

  3. 3

    Para fine-tuning, suelta los PDF aquí y elige el formato.

Preguntas frecuentes

¿Puedo hacer las dos?
Sí, y es lo habitual en producción: fine-tuning para el formato de respuesta y RAG para los hechos. Los dos conjuntos salen de los mismos documentos.
¿Para RAG también hay que anonimizar?
Si el índice o el modelo están en la nube, sí. Si todo corre en tu equipo con un modelo local, es opcional; la anonimización se puede desactivar y luego restaurar los datos reales en la respuesta.
¿Y si mis documentos cambian cada semana?
Argumento fuerte a favor de RAG: reindexar es cuestión de minutos, mientras que reentrenar hay que repetirlo entero.

Otras herramientas