Golden Sky Golden Sky Data & Machine Learning

Data & Machine Learning

Cuántas veces mejor que el azar.

El lift mide cuánto más probable es un resultado cuando una señal está activa, comparado con su probabilidad base. Es una medida de asociación —nacida en la minería de reglas— que responde: ¿esta condición concentra aciertos más que el azar? En el pipeline es el punto de partida de la selección, pero nunca el único juez.

El concepto

Una medida de asociación

El lift viene de la minería de reglas de asociación (el clásico "quién compra pan también compra manteca"). Mide cuánto cambia la probabilidad de un evento al condicionar por otro.

lift = 1 → sin relación

Si conocer que X ocurre no cambia la probabilidad de Y, el lift es 1: X e Y son independientes.

lift > 1 → asociación positiva

Y es más probable cuando X está presente. Un lift de 1.5 significa que Y ocurre 1.5 veces más seguido bajo X que en general.

lift < 1 → asociación negativa

Y es menos probable cuando X está presente — información igual de útil (dice cuándo NO esperar el evento).

La fórmula

Probabilidad condicional sobre la base

Para dos eventos X e Y:

lift(X → Y) = P(Y | X)P(Y) = P(X, Y)P(X) · P(Y)

El numerador es la probabilidad de Y dado X; el denominador, la probabilidad de Y a secas. Su cociente dice cuántas veces se concentra Y bajo X respecto de la tasa base. La forma de la derecha muestra la simetría con la independencia: si P(X,Y) = P(X)·P(Y), el lift es exactamente 1.

Cómo lo calculamos

Lift de una regla sobre su objetivo

En el pipeline, X es "¿la regla está activa?" e Y es el target "¿el trade tocó TP antes que SL?".

pactive = P(TP | regla) = mean( target[ regla = 1 ] )
pglobal = P(TP)  // tasa base del target
lift = pactivepglobal  // ej. 60% / 40% = 1.5

Un lift de 1.5 dice que, cuando la regla se activa, la operación llega a take-profit un 50% más seguido que la línea base. Es una lectura relativa y limpia — pero por sí sola no dice si esa ventaja es real o casualidad.

Por qué no alcanza

Relativo, absoluto y significativo son cosas distintas

Un lift alto sobre pocas señales puede ser ruido. Por eso el lift se acompaña siempre de la ventaja absoluta y de su significancia estadística.

edge = pactive − pglobal  // ventaja absoluta, en puntos
SE = pglobal(1 − pglobal)n  ·  z = edgeSE

El edge es la ventaja en puntos de probabilidad; el z-score la mide en errores estándar y escala con √n — una ventaja fina sobre muchas señales pesa más que una grande sobre pocas. El lift da la magnitud; la significancia (z, p-valor binomial y la corrección FDR) dice si es difícil de explicar por azar; la información mutua, si hay dependencia real. Tres preguntas distintas.

Intervalo y economía

No un umbral a dedo, sino confianza y breakeven

En vez de "aceptar si lift > 1.3" (un corte arbitrario), se trabaja con la banda de confianza del lift y un umbral económico.

IC del lift  // log-normal, método de Katz
criterio económico:   IClower(lift) > Lbreakeven  // informativo, no filtro

L_breakeven es el lift mínimo para que la ventaja cubra los costos (spread, comisión, slippage). Exigir que el extremo inferior del intervalo lo supere es más honesto que comparar el punto estimado contra un número. Además, no hay umbrales duros de lift: el tipo de la regla —ALPHA (lift > 1) o FILTER (lift < 1)— lo decide el FDR sobre la significancia, no el valor del lift.

En el ranking

La magnitud, combinada con la evidencia

composite = 0.55 · znorm  +  0.45 · minorm

El score final no rankea por lift a secas: combina la significancia (z, que ya incorpora la magnitud del edge y el tamaño de muestra) con la dependencia (información mutua). El lift queda como la lectura interpretable de "cuánto" y "en qué dirección", mientras el ranking se apoya en cuán difícil es que esa ventaja sea casualidad.

Guía técnica · Paso 6 Lift y Significancia El paso completo: lift, edge, z-score, p-valor binomial, FDR, información mutua y el criterio económico de Katz, con las fórmulas verificadas contra el código.