Data & Machine Learning
Cuando se evalúan miles de hipótesis, algunas "ganan" por puro azar. La corrección de tasa de falso descubrimiento (FDR) sube el listón según cuántas se probaron — es lo que separa un descubrimiento real de una coincidencia, y una de las guardas centrales de todo el pipeline.
Un test estadístico a nivel α = 0.05 acepta, por definición, un 5% de hipótesis nulas por casualidad. El volumen convierte ese porcentaje en un problema serio.
Un backtest ganador, por sí solo, no distingue señal de suerte si detrás hubo una búsqueda masiva. Es el antipatrón de data snooping: sin corregir el umbral por cuántas hipótesis se probaron, siempre aparecen "estrategias" que solo matchearon el ruido.
| Criterio | Qué controla | Efecto |
|---|---|---|
| Bonferroni (FWER) | La probabilidad de al menos un falso positivo (α / m). | Muy estricto: mata también reglas verdaderas → poco poder cuando hay miles de tests. |
| FDR (Benjamini-Hochberg) | La proporción esperada de falsos entre los aceptados: E[V/R] ≤ q. | Más poder: tolera algunos falsos a cambio de no descartar los verdaderos. Apropiado cuando esperás varios hallazgos reales. |
La pregunta cambia de "¿puedo garantizar cero errores?" (imposible sin quedarme sin nada) a "¿qué fracción de lo que acepto estoy dispuesto a que sea ruido?". Ese q es el FDR tolerado (por ejemplo 0.10 = hasta 10% de falsos entre los aceptados).
Con m hipótesis testeadas y sus p-values:
El listón no es fijo: escala con la posición k/m. La p-value más pequeña se compara contra q/m (casi tan estricto como Bonferroni), pero las siguientes tienen umbrales progresivamente más laxos — así el método conserva poder sin perder el control global de la tasa de falsos.
El m de la fórmula es el total de reglas/combos evaluados, no solo los que pasaron filtros previos. Corregir sobre las sobrevivientes rompería la garantía: el control real del FDR exige contar todas las hipótesis que se probaron.
Sin umbrales duros de lift: ALPHA = lift > 1 cuyo p-value (aciertos por encima de la base) sobrevive BH; FILTER = lift < 1 cuyo p-value (aciertos por debajo) sobrevive. La significancia corregida es el juez.
| Etapa | FDR sobre… |
|---|---|
| Reglas (lift) | Los p-values binomiales de cada regla; m = reglas evaluadas. |
| Combinaciones | m = combos evaluados (crece con N²/N³, así el listón se auto-ajusta al subir el pool). |
| Walk-forward | Los p-values del test de permutación (Monte Carlo) del top-N, con piso Phipson-Smyth 1/(n+1) para que ningún p sea 0 exacto. |
Cada familia de hipótesis recibe su propia corrección. Limitación honesta del walk-forward: la familia FDR es el top-N que recibió Monte Carlo (screening por costo), no el set completo — documentado, no escondido.
La ventaja estructural: la corrección se auto-ajusta al número de hipótesis. Buscar más reglas no relaja el criterio — m crece y el listón sube solo. Por eso el FDR es la defensa central contra el data snooping: no depende de que alguien "elija bien" un umbral, sino de contar honestamente cuánto se buscó. Zona ciega conocida: reintentar corridas con distintos N hasta que pase un combo es p-hacking cross-run — el FDR intra-run no lo cubre.