3.2. Arquitectura de RAG
Última actualización
RAG (Retrieval-Augmented Generation) es la arquitectura estándar de la industria para empresas. Resuelve el problema #1 de los LLMs: La alucinación y la falta de contexto.
El sistema no es una sola pieza, es un flujo de tres pasos que ocurre en milisegundos.
1. Ingesta
Embeddings
Convierte tu texto (PDFs) en vectores numéricos (listas de coordenadas matemáticas).
2. Recuperación
Vector DB
Cuando el usuario pregunta, el sistema busca los párrafos matemáticamente más cercanos a la pregunta.
3. Generación
LLM (Llama)
Recibe los párrafos encontrados + la pregunta original y redacta una respuesta coherente.
Muchos creen que deben "entrenar" (Fine-Tuning) a la IA con sus datos. Para el 95% de las PyMEs, eso es un error costoso e innecesario.
Costo: Bajo / Nulo.
Actualización: Inmediata (subes un PDF y la IA ya sabe la nueva política al instante).
Transparencia: Cita las fuentes ("Ver pág 5 del manual").
Uso: Bases de conocimiento, búsqueda en contratos, soporte técnico.
Costo: Alto ($$$ en GPUs y cómputo).
Actualización: Lenta (hay que re-entrenar el modelo para enseñarle algo nuevo).
Transparencia: Caja negra (no cita fuentes, "alucina" datos mezclados).
Uso: Cambiar el "estilo" de hablar o aprender un idioma nuevo (ej. Náhuatl).
ANALOGÍA TÉCNICA Fine-Tuning es mandar a la IA a la universidad a estudiar medicina (aprende a pensar como médico). RAG es darle a la IA el libro de medicina durante el examen para que busque la respuesta exacta (aprende a consultar).
Última actualización

