LLM Observability con Langfuse
Trazabilidad, evaluación y control de costos para agentes y pipelines RAG en producción
Observabilidad de Agentes y Pipelines RAG
Un agente en producción falla de formas que los logs no explican: la respuesta llega tarde y no se sabe si fue la recuperación o la generación; el costo sube y no se sabe qué cliente o qué prompt lo movió; alguien reporta una alucinación y no queda registro del contexto que el modelo tenía delante. Este proyecto instrumenta esa capa con Langfuse, dejando cada conversación reconstruible paso a paso.
Cada petición se emite como una traza con spans anidados —recuperación, llamadas a herramientas, generación— con su latencia, sus tokens y su costo. Sobre esa base se montan evaluaciones automáticas con LLM-as-a-judge y colas de anotación humana, además de datasets de regresión que se ejecutan antes de cada cambio de prompt o de modelo, de modo que una mejora aparente se mide en lugar de suponerse.
Tracing End-to-End
Cada conversación se descompone en spans anidados: recuperación, reranking, tool calls y generación. Cuando algo tarda, la traza señala qué paso lo causó en lugar de dejar el tiempo total sin desglosar.
Costo y Latencia por Dimensión
Tokens y gasto atribuidos por cliente, funcionalidad, modelo y versión de prompt. Permite responder cuánto cuesta realmente una conversación y detectar la regresión de costo el mismo día en que aparece.
Gestión y Versionado de Prompts
Los prompts se editan y despliegan sin releases de código, con versionado, etiquetas de entorno y A/B testing entre variantes; el rendimiento de cada versión queda medido contra las mismas métricas.
Evaluaciones Automáticas
LLM-as-a-judge sobre el tráfico real, más datasets de regresión que se corren antes de cada cambio. Una modificación que mejora un caso y rompe otros tres se detecta antes de llegar a producción.
Calidad de RAG
Métricas específicas de recuperación —groundedness, relevancia del contexto, cobertura de la respuesta— que distinguen el fallo del recuperador del fallo del modelo, dos problemas con soluciones distintas.
Anotación Humana
Colas de revisión donde el equipo de negocio califica conversaciones reales. Esas etiquetas alimentan los datasets de evaluación y calibran a los jueces automáticos contra criterio humano.
Self-hosting y Gobierno de Datos
Despliegue autoalojado con Postgres y ClickHouse, con enmascarado de PII antes de la ingesta, para que la telemetría de conversaciones cumpla los requisitos de residencia y privacidad del cliente.
Alertas y Dashboards
Umbrales sobre latencia p95, tasa de error, costo diario y puntuaciones de calidad, integrados con el stack de monitoreo existente para que la degradación se notifique sola.
¿Hablamos?
Abierto a roles de AI Engineer, liderazgo de Data & IA y consultoría. La vía más rápida es LinkedIn.
