7 días de Pro+ gratis · sin tarjetaEmpieza mi prueba gratuita

Valida una estrategia sin sesgo retrospectivo · 4 / 5

Conserva los ensayos perdedores de una búsqueda de parámetros

El mejor resultado de una búsqueda no equivale a una regla fijada antes de observar los datos. Un registro honesto incluye también las alternativas que perdieron.

Athenum7 minActualizado:

Cuenta las decisiones, no solo la estrategia final

Cinco ventanas retrospectivas, cuatro umbrales de entrada y tres salidas producen sesenta configuraciones sobre el mismo historial. Supón un mejor total neto de +18R y una mediana de −2R. El cálculo ganador puede ser correcto y aun así ofrecer evidencia débil de una ventaja persistente: el proceso estaba diseñado para seleccionar un resultado extremo.

Guarda parámetros, versión de datos, intervalo, costes, exclusiones, criterio de selección y resultados de cada ensayo. Cambiar de activo, eliminar un mes malo, probar otra temporalidad o usar una métrica distinta también modifica la búsqueda. Un script final rara vez conserva esas decisiones descartadas; mantén un registro de experimentos separado.

No inventes independencia entre ensayos

Solo como ilustración matemática, sesenta pruebas independientes bajo la hipótesis nula, cada una con un 5 % de falsos positivos, tienen una probabilidad de al menos uno de 1 − 0,95^60 ≈ 95,39 %. Esto no mide la probabilidad de que la estrategia elegida sea falsa. Compartir observaciones hace dependientes los ensayos de parámetros, y el ejemplo de +18R no definió una prueba de hipótesis.

Inspecciona los valores vecinos y las operaciones especialmente influyentes. Un pico aislado merece investigación, pero no demuestra por sí solo un error. Una zona amplia de estabilidad aporta información sobre sensibilidad, no sustituye la evaluación con observaciones que no influyeron en la búsqueda.

Un parámetro atractivo rodeado de pérdidas

Tres ventanas vecinas producen −3R, +18R y −2R bajo los mismos supuestos hipotéticos restantes. Conserva los tres resultados. Antes de proponer una explicación causal, comprueba si unas pocas ejecuciones, una convención en los límites o una anomalía de datos explican el pico.

La cuadrícula inicial tiene 5 × 4 × 3 = 60 configuraciones. Registrar dos escenarios de costes definidos previamente genera 120 filas de configuración y escenario. No son 120 pruebas independientes. Elegir el modelo de costes más barato porque favorece al ganador es otra decisión de investigación que debe declararse.

Comprobación hipotética de parámetros vecinos
Ventana retrospectivaTotal neto
18−3R
20+18R
22−2R
Ventana 18
-3 R
Ventana 20
18 R
Ventana 22
-2 R
Un pico aislado invita a investigar, no permite diagnosticar automáticamente un error ni afirmar rentabilidad.

Cambiar el nombre de una prueba no borra la selección

Llamar prueba de robustez a una segunda evaluación no la hace independiente si su resultado determina qué regla publicas. Define de antemano la función de cada escenario y conserva los ensayos fallidos, en lugar de retirarlos silenciosamente del recuento total.

Antes de actuar

  • Conserva todas las configuraciones y resultados.
  • Registra cambios fuera de la cuadrícula de parámetros.
  • Separa escenarios de estrés y criterios de selección.
  • Inspecciona valores vecinos y operaciones influyentes.
  • Reserva datos no examinados antes de buscar.

Comprueba lo aprendido

Duplicas las cinco ventanas iniciales hasta diez y mantienes cuatro umbrales, tres salidas y dos escenarios de costes. ¿Cuántas filas registras? ¿Son independientes?

Ver la respuesta explicada

Hay 10 × 4 × 3 × 2 = 240 filas de configuración y escenario. No son automáticamente independientes: comparten observaciones de mercado y muchos componentes de las reglas. El número de filas documenta la búsqueda, pero no establece el tamaño efectivo de una muestra independiente.

Fuentes y lecturas adicionales

Profundiza con Athenum