Golden Sky Golden Sky Data & Machine Learning

Data & Machine Learning

Probar miles de reglas garantiza falsos hallazgos.

Cuando se evalúan miles de hipótesis, algunas "ganan" por puro azar. La corrección de tasa de falso descubrimiento (FDR) sube el listón según cuántas se probaron — es lo que separa un descubrimiento real de una coincidencia, y una de las guardas centrales de todo el pipeline.

El problema

Buscar mucho encuentra ganadores por azar

Un test estadístico a nivel α = 0.05 acepta, por definición, un 5% de hipótesis nulas por casualidad. El volumen convierte ese porcentaje en un problema serio.

# 10.000 reglas SIN ventaja real, testeadas a α = 0.05 falsos "ganadores" esperados ≈ 10.000 × 0.05 = 500

Un backtest ganador, por sí solo, no distingue señal de suerte si detrás hubo una búsqueda masiva. Es el antipatrón de data snooping: sin corregir el umbral por cuántas hipótesis se probaron, siempre aparecen "estrategias" que solo matchearon el ruido.

Dos formas de corregir

Bonferroni controla lo imposible; FDR, lo útil

CriterioQué controlaEfecto
Bonferroni (FWER)La probabilidad de al menos un falso positivo (α / m).Muy estricto: mata también reglas verdaderas → poco poder cuando hay miles de tests.
FDR (Benjamini-Hochberg)La proporción esperada de falsos entre los aceptados: E[V/R] ≤ q.Más poder: tolera algunos falsos a cambio de no descartar los verdaderos. Apropiado cuando esperás varios hallazgos reales.

La pregunta cambia de "¿puedo garantizar cero errores?" (imposible sin quedarme sin nada) a "¿qué fracción de lo que acepto estoy dispuesto a que sea ruido?". Ese q es el FDR tolerado (por ejemplo 0.10 = hasta 10% de falsos entre los aceptados).

El procedimiento

Benjamini-Hochberg, paso a paso

Con m hipótesis testeadas y sus p-values:

1 · ordenar   p(1) ≤ p(2) ≤ … ≤ p(m)
2 · k* = max { k : p(k)km · q }
3 · rechazar H0 (aceptar la regla)  ∀ i ≤ k*

El listón no es fijo: escala con la posición k/m. La p-value más pequeña se compara contra q/m (casi tan estricto como Bonferroni), pero las siguientes tienen umbrales progresivamente más laxos — así el método conserva poder sin perder el control global de la tasa de falsos.

Cómo lo aplicamos

La corrección va sobre TODO lo evaluado

m = el universo completo, no los sobrevivientes

El m de la fórmula es el total de reglas/combos evaluados, no solo los que pasaron filtros previos. Corregir sobre las sobrevivientes rompería la garantía: el control real del FDR exige contar todas las hipótesis que se probaron.

El tipo de regla lo decide el FDR, no un umbral a dedo

Sin umbrales duros de lift: ALPHA = lift > 1 cuyo p-value (aciertos por encima de la base) sobrevive BH; FILTER = lift < 1 cuyo p-value (aciertos por debajo) sobrevive. La significancia corregida es el juez.

En cada etapa

Misma corrección, distintas familias

EtapaFDR sobre…
Reglas (lift)Los p-values binomiales de cada regla; m = reglas evaluadas.
Combinacionesm = combos evaluados (crece con N²/N³, así el listón se auto-ajusta al subir el pool).
Walk-forwardLos p-values del test de permutación (Monte Carlo) del top-N, con piso Phipson-Smyth 1/(n+1) para que ningún p sea 0 exacto.

Cada familia de hipótesis recibe su propia corrección. Limitación honesta del walk-forward: la familia FDR es el top-N que recibió Monte Carlo (screening por costo), no el set completo — documentado, no escondido.

Por qué así

El rigor no se afloja subiendo el N

La ventaja estructural: la corrección se auto-ajusta al número de hipótesis. Buscar más reglas no relaja el criterio — m crece y el listón sube solo. Por eso el FDR es la defensa central contra el data snooping: no depende de que alguien "elija bien" un umbral, sino de contar honestamente cuánto se buscó. Zona ciega conocida: reintentar corridas con distintos N hasta que pase un combo es p-hacking cross-run — el FDR intra-run no lo cubre.

Guía técnica · Paso 6 Lift y Significancia Dónde vive el FDR en la selección: lift, p-valor binomial, la corrección BH y el filtro de información mutua, con las fórmulas verificadas contra el código.