Mejores herramientas de evaluación de RAG en 2026: Ragas, DeepEval y TruLens
Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Una única puntuación no puede explicar si un sistema de generación aumentada mediante recuperación (RAG) funciona correctamente. Puede fallar al analizar documentos, dividirlos en chunks, recuperar o rerankear evidencias, generar una respuesta, adjuntar citas o aplicar filtros. Mide cada fase por separado para que una regresión apunte a una parte concreta del pipeline.
Empieza con métricas de retrieval sobre un dataset pequeño y etiquetado. Añade Ragas para las métricas estándar de RAG, DeepEval para las comprobaciones de CI y TruLens cuando necesites feedback asociado a ejecuciones individuales. Usa LangSmith si tus trazas y datasets ya están allí. Escribe métricas personalizadas para los fallos específicos de tu producto.
Última revisión: 2026-08-10. La clasificación prioriza la cobertura de fases, las comprobaciones deterministas, la calibración del juez, la integración con CI, la compatibilidad con trazas y el coste de mantener los datos de evaluación.
Tabla de decisión
| Necesidad | Mejor punto de partida | Motivo |
|---|---|---|
| Comprobaciones de regresión de retrieval de bajo coste | Métricas locales | Recall@k, MRR, nDCG, exclusión incorrecta por filtros y soporte de citas pueden ser deterministas. |
| Métricas de calidad de RAG sin referencia | Ragas | Proporciona métricas de precisión de contexto, recall de contexto, relevancia de la respuesta, faithfulness y otras relacionadas. |
| Gates de CI para aplicaciones con LLM | DeepEval | Su interfaz basada en casos de prueba funciona bien cuando las evaluaciones deben hacer fallar un PR o un despliegue. |
| Feedback explicable sobre la aplicación | TruLens | El trío de RAG separa la relevancia del contexto, la groundedness y la relevancia de la respuesta. |
| Evaluaciones de producto centradas en trazas | LangSmith | Datasets, evaluadores, anotaciones, trazas y flujos de regresión conviven en el mismo entorno. |
| Calidad específica del dominio | Evaluaciones personalizadas | Las métricas genéricas rara vez conocen tu ontología, filtros, política de citas, restricciones del parser o reglas de rechazo. |
Métricas por fase del pipeline
| Fase | Primeras métricas que añadir | Motivo |
|---|---|---|
| Parsing | completitud de extracción, conservación de tablas, cobertura de páginas | Una mala ingesta hace que todas las métricas posteriores resulten engañosas. |
| Chunking | capacidad del chunk para responder, pérdida en los límites, tasa de duplicados | El retriever no puede recuperar hechos divididos por límites incorrectos. |
| Retrieval | Recall@k, MRR, nDCG@k, precisión de contexto, recall de contexto | Detecta la falta de evidencias antes de que el generador oculte el problema. |
| Reranking | Precision@1, variación de nDCG, mejora del reranker, variación de latencia | Los rerankers deben mejorar suficientemente el orden como para justificar la latencia. |
| Generation | faithfulness, groundedness, relevancia de la respuesta | Miden si la respuesta ha utilizado el contexto recuperado. |
| Citations | cobertura de claims, soporte de citas, tasa de claims no respaldados | Una respuesta grounded sin citas útiles también puede hacer fallar el producto. |
| Production | tasa de fallback, tasa de corrección, latencia p95, coste por respuesta | La calidad offline no está completa sin telemetría operativa. |
Notas sobre las herramientas
Ragas es la forma más sencilla de adoptar un vocabulario común para la evaluación de RAG. Resulta útil cuando un equipo necesita rápidamente métricas de precisión de contexto, recall de contexto, faithfulness y relevancia de la respuesta. La principal cautela es la calibración: las métricas basadas en LLM-judge pueden parecer precisas mientras ocultan los prompts del juez, los ejemplos, la elección del modelo y el coste.
DeepEval encaja en flujos de ingeniería donde la evaluación debe comportarse como una batería de tests. Es útil para las comprobaciones de regresión en CI, especialmente en torno a casos de fallo conocidos. La cautela es que las evaluaciones con estilo de test solo son tan buenas como los casos que mantengas.
TruLens funciona bien cuando quieres funciones de feedback asociadas a los registros de la aplicación. El trío de RAG resulta útil porque mantiene separadas la relevancia del contexto, la groundedness y la relevancia de la respuesta, en lugar de comprimirlas en un único número opaco.
LangSmith es práctico cuando tus trazas, ejecuciones, datasets y flujo de revisión ya están en el ecosistema de LangChain/LangGraph. Resulta menos atractivo si quieres un harness de evaluación local y agnóstico respecto al framework.
Las evaluaciones personalizadas no son opcionales en producción. Si tu sistema de RAG filtra documentos por permisos, jurisdicción, fecha, línea de producto u ontología, mide directamente las exclusiones incorrectas y los errores de política.
Una primera stack razonable
- Crea un golden set que cubra los slices de consulta importantes y los IDs de fuente esperados. Unas pocas decenas de casos pueden revelar regresiones tempranas; amplíalo hasta que los intervalos de confianza y la cobertura de fallos respalden la decisión de release.
- Registra localmente las métricas deterministas de retrieval antes de añadir jueces basados en LLM.
- Añade una métrica de groundedness o faithfulness de Ragas o TruLens.
- Añade comprobaciones de DeepEval para los casos de fallo que nunca deben sufrir regresiones.
- Almacena las trazas y la revisión humana muestreada en LangSmith, OpenTelemetry o tus propias tablas.
- Añade métricas personalizadas para filtros, citas, calidad del parser y comportamiento de rechazo.
Un error habitual
Muchos equipos miden la faithfulness y se detienen ahí. La faithfulness plantea una pregunta concreta: ¿la respuesta coincide con el contexto recuperado? No puede decirte si el retriever encontró la fuente correcta. Tampoco detecta tablas perdidas, filtros de permisos incorrectos ni citas que apuntan al pasaje equivocado.
Lecturas recomendadas
- Métricas de evaluación de RAG presenta el marco completo, fase por fase.
- Stack de ranking de búsqueda cubre el diseño de retrieval y reranking.
- Context Engineering para AI Agents explica por qué el ensamblado del contexto forma parte del sistema y no es simple decoración del prompt.