Julian Augusto Cortes Gomez

Julian Augusto Cortes Gomez

AI Engineer · Data Scientist · Data Engineer

Msc. Visual Analytics & Big Data | Esp. Inteligencia Artificial

Llevo agentes de IA y pipelines de datos a producción. 8+ años construyendo sistemas RAG, agentes de voz y texto, y la infraestructura que los sostiene — hoy como AI Team Lead en InsightPlay.ai.

LLM Observability con Langfuse

Trazabilidad, evaluación y control de costos para agentes y pipelines RAG en producción

Observabilidad de Agentes y Pipelines RAG

Un agente en producción falla de formas que los logs no explican: la respuesta llega tarde y no se sabe si fue la recuperación o la generación; el costo sube y no se sabe qué cliente o qué prompt lo movió; alguien reporta una alucinación y no queda registro del contexto que el modelo tenía delante. Este proyecto instrumenta esa capa con Langfuse, dejando cada conversación reconstruible paso a paso.

Cada petición se emite como una traza con spans anidados —recuperación, llamadas a herramientas, generación— con su latencia, sus tokens y su costo. Sobre esa base se montan evaluaciones automáticas con LLM-as-a-judge y colas de anotación humana, además de datasets de regresión que se ejecutan antes de cada cambio de prompt o de modelo, de modo que una mejora aparente se mide en lugar de suponerse.

Tracing End-to-End

Cada conversación se descompone en spans anidados: recuperación, reranking, tool calls y generación. Cuando algo tarda, la traza señala qué paso lo causó en lugar de dejar el tiempo total sin desglosar.

Costo y Latencia por Dimensión

Tokens y gasto atribuidos por cliente, funcionalidad, modelo y versión de prompt. Permite responder cuánto cuesta realmente una conversación y detectar la regresión de costo el mismo día en que aparece.

Gestión y Versionado de Prompts

Los prompts se editan y despliegan sin releases de código, con versionado, etiquetas de entorno y A/B testing entre variantes; el rendimiento de cada versión queda medido contra las mismas métricas.

Evaluaciones Automáticas

LLM-as-a-judge sobre el tráfico real, más datasets de regresión que se corren antes de cada cambio. Una modificación que mejora un caso y rompe otros tres se detecta antes de llegar a producción.

Calidad de RAG

Métricas específicas de recuperación —groundedness, relevancia del contexto, cobertura de la respuesta— que distinguen el fallo del recuperador del fallo del modelo, dos problemas con soluciones distintas.

Anotación Humana

Colas de revisión donde el equipo de negocio califica conversaciones reales. Esas etiquetas alimentan los datasets de evaluación y calibran a los jueces automáticos contra criterio humano.

Self-hosting y Gobierno de Datos

Despliegue autoalojado con Postgres y ClickHouse, con enmascarado de PII antes de la ingesta, para que la telemetría de conversaciones cumpla los requisitos de residencia y privacidad del cliente.

Alertas y Dashboards

Umbrales sobre latencia p95, tasa de error, costo diario y puntuaciones de calidad, integrados con el stack de monitoreo existente para que la degradación se notifique sola.

Langfuse OpenTelemetry Python FastAPI PostgreSQL ClickHouse LLM-as-a-Judge Prompt Versioning Grafana Docker

¿Hablamos?

Abierto a roles de AI Engineer, liderazgo de Data & IA y consultoría. La vía más rápida es LinkedIn.