ragcooking
la biblioteca

Cada fase, una página. Cada pieza, una ficha.

El pipeline completo del RAG en 18 fases, 75 piezas y 7conjuntos (frameworks). Navega por estación, entra en cada fase y compara antes de llevarlo al lienzo.

Conjuntos (frameworks)· el instrumento que orquesta fases7 conjuntos

LlamaIndex

De los datos a la respuesta: readers, node parsers, retrievers y query engines

2 variantes · 4 fasesPY

LangChain / LangGraph

Orquestación de recuperación y generación; LangGraph añade grafos y agentes

2 variantes · 2 fasesPY

Haystack (deepset)

Pipelines declarativos de extremo a extremo, muy apreciado en producción

1 variantes · 4 fasesPY

Azure AI Search

Indexa, trocea, embebe y busca en un solo servicio gestionado

1 variantes · 4 fasesPY.NET

Elasticsearch

BM25 + kNN: búsqueda y almacenamiento en uno

1 variantes · 2 fasesPY

ragkit ★

RAG agéntico llave en mano para .NET (MIT): ingesta idempotente, híbrido BM25+densa con RRF, guardarails y agente con 13 herramientas (github.com/JavierFrauca/Ragkit)

2 variantes · 9 fases.NET★ propio

nucleus ★

El núcleo de servicio del RAG: rack validado, búsqueda determinista y rerank (github.com/JavierFrauca)

2 variantes · 5 fases★ propio
Aprovisionamiento· La compra5 fases

Modelo de conocimiento

Dominios y etiquetas con descripción. Se diseña ANTES de ingestar: lo que nunca se modeló no se puede filtrar. 2 piezas →

recomendada

Corpus

Fuentes del conocimiento: ficheros, web, APIs, MCPs, wikis… 6 piezas →

obligatoria

Ingesta

Extracción y carga: lectores de formato, OCR, scrapers, conectores. 4 piezas →

obligatoria

Normalización de formato

Todo el corpus a un formato común (normalmente Markdown): PDF, DOCX, HTML, correo → una sola bandeja estructurada antes de curar. 4 piezas →

recomendada

Limpieza

Normalización, deduplicación, corrección, calidad. 4 piezas →

recomendada
Preparación· Mise en place5 fases

Estructura

Segmentación y clasificación por dominios y tipos documentales. 2 piezas →

opcional

Transversales

Hilado de documentos: conceptos con respuesta en chunks de distintos dominios. 2 piezas →

opcional

Chunking

La píldora de información: el tamaño se hereda del dominio y debe caber en el modelo de embedding. 4 piezas →

obligatoria

Metaetiquetado

Metadatos por chunk: dominio, etiquetas, vigencia, seguridad, linaje. 10 piezas →

recomendada

Síntesis

Resúmenes con LLM de chunks o documentos (doble campo: resumen + original). 2 piezas →

opcional
Cocción· Cocinar y guardar3 fases

Embedding

Modelo que convierte texto en vectores. Su límite de tokens determina el tamaño máximo de la píldora. 11 piezas →

obligatoria

Almacenamiento

BD vectorial, índice léxico (BM25) o híbrido, con metadatos filtrables y modelo de datos diseñado. 9 piezas →

obligatoria

Medición de ruido

Detectar chunks que se tropiezan con búsquedas de dominios no alineados. 2 piezas →

recomendada
Servicio· Emplatar y servir3 fases

Recuperación

Densa, sparse, híbrida, prefiltro determinista por metadatos. 5 piezas →

obligatoria

Reranking

Cross-encoders, rerankers, boost de transversales. 2 piezas →

recomendada

Generación

LLM generador, plantillas de prompt, citas de fuentes. 2 piezas →

obligatoria
Calidad y gobierno· El crítico2 fases

Evaluación

Dataset áureo, métricas (recall, precisión), umbral de aceptación. 2 piezas →

recomendada

Gobierno

Frescura, ciclo de vida, coste, despliegue continuo. 2 piezas →

opcional