Data & Machine Learning
El lift mide cuánto más probable es un resultado cuando una señal está activa, comparado con su probabilidad base. Es una medida de asociación —nacida en la minería de reglas— que responde: ¿esta condición concentra aciertos más que el azar? En el pipeline es el punto de partida de la selección, pero nunca el único juez.
El lift viene de la minería de reglas de asociación (el clásico "quién compra pan también compra manteca"). Mide cuánto cambia la probabilidad de un evento al condicionar por otro.
Si conocer que X ocurre no cambia la probabilidad de Y, el lift es 1: X e Y son independientes.
Y es más probable cuando X está presente. Un lift de 1.5 significa que Y ocurre 1.5 veces más seguido bajo X que en general.
Y es menos probable cuando X está presente — información igual de útil (dice cuándo NO esperar el evento).
Para dos eventos X e Y:
El numerador es la probabilidad de Y dado X; el denominador, la probabilidad de Y a secas. Su cociente dice cuántas veces se concentra Y bajo X respecto de la tasa base. La forma de la derecha muestra la simetría con la independencia: si P(X,Y) = P(X)·P(Y), el lift es exactamente 1.
En el pipeline, X es "¿la regla está activa?" e Y es el target "¿el trade tocó TP antes que SL?".
Un lift de 1.5 dice que, cuando la regla se activa, la operación llega a take-profit un 50% más seguido que la línea base. Es una lectura relativa y limpia — pero por sí sola no dice si esa ventaja es real o casualidad.
Un lift alto sobre pocas señales puede ser ruido. Por eso el lift se acompaña siempre de la ventaja absoluta y de su significancia estadística.
El edge es la ventaja en puntos de probabilidad; el z-score la mide en errores estándar y escala con √n — una ventaja fina sobre muchas señales pesa más que una grande sobre pocas. El lift da la magnitud; la significancia (z, p-valor binomial y la corrección FDR) dice si es difícil de explicar por azar; la información mutua, si hay dependencia real. Tres preguntas distintas.
En vez de "aceptar si lift > 1.3" (un corte arbitrario), se trabaja con la banda de confianza del lift y un umbral económico.
L_breakeven es el lift mínimo para que la ventaja cubra los costos (spread, comisión, slippage). Exigir que el extremo inferior del intervalo lo supere es más honesto que comparar el punto estimado contra un número. Además, no hay umbrales duros de lift: el tipo de la regla —ALPHA (lift > 1) o FILTER (lift < 1)— lo decide el FDR sobre la significancia, no el valor del lift.
El score final no rankea por lift a secas: combina la significancia (z, que ya incorpora la magnitud del edge y el tamaño de muestra) con la dependencia (información mutua). El lift queda como la lectura interpretable de "cuánto" y "en qué dirección", mientras el ranking se apoya en cuán difícil es que esa ventaja sea casualidad.
Guía técnica · Paso 6 Lift y Significancia El paso completo: lift, edge, z-score, p-valor binomial, FDR, información mutua y el criterio económico de Katz, con las fórmulas verificadas contra el código.