Advertencia de riesgo. Los productos de divisas con apalancamiento conllevan un riesgo sustancial para tu capital. Superar cualquier prueba de robustez no indica resultados futuros, y cada cifra analizada a continuación proviene de una simulación histórica.
La respuesta directa
La simulación de Monte Carlo no demuestra que tu estrategia de trading vaya a ganar dinero. Vale la pena aclararlo primero, porque la versión de 2019 de este artículo sugería lo contrario y prefiero corregirlo claramente en lugar de hacerlo discretamente.
Lo que hace el método es medir qué tan sensible es un resultado histórico a cambios específicos: diferentes configuraciones de indicadores, un punto de inicio distinto, spreads más amplios, secuencias de precios alteradas, ejecuciones omitidas. Una estrategia que sobrevive a esas perturbaciones es menos frágil bajo los supuestos que elegiste para probar. Su rendimiento en cuenta real aún puede decepcionar, y puede seguir sufriendo de overfitting, depender de un régimen específico o no ser adecuada para capital real.
Esa brecha entre “menos frágil bajo los supuestos probados” y “robusto” es el tema central de esta página.
Lo que la simulación de Monte Carlo mide realmente
Cada variante de Monte Carlo funciona de la misma manera internamente. Toma la prueba histórica original, cambia una cosa al azar, ejecútala de nuevo, repite muchas veces y luego observa la distribución de los resultados en lugar de un solo número.

La idea es genuina. Una ejecución histórica produce una única curva de equidad, y parece precisa de una manera que no se ha ganado, ya que una fecha de inicio ligeramente diferente o un spread dos puntos más amplio habrían producido algo completamente distinto. Generar cientos de simulaciones de Monte Carlo reemplaza la falsa precisión con una dispersión de posibles resultados, lo cual es más honesto.
Lo que no puede hacer es generar información que no estaba en tus datos desde el principio. Aleatorizar una secuencia histórica produce variaciones de esa secuencia, no de condiciones que el mercado aún no ha inventado.
Lo que demuestra y lo que no demuestra
| Resultado | Lectura razonable | Lo que no establece |
| Pequeños cambios de parámetros mantienen la rentabilidad | La estrategia no está en el límite de la fragilidad cerca de esos ajustes | Que los ajustes sean óptimos o que exista una ventaja (*edge*) |
| Diferentes fechas de inicio mantienen la rentabilidad | Los resultados no dependen enteramente de un único punto de entrada histórico | Rentabilidad futura |
| Spreads más amplios siguen siendo aceptables | Los costes dentro del rango probado son tolerables | Que la ejecución en cuenta real coincida con el modelo |
| Las posiciones omitidas no destruyen los resultados | Menor dependencia de capturar cada señal | Que el riesgo de ejecución del bróker está gestionado |
| La mayoría de las ejecuciones se mantienen positivas | El resultado histórico es bastante estable bajo esas perturbaciones | Significancia estadística o ausencia de overfitting |
| El drawdown se mantiene dentro de los límites | El riesgo puede ser tolerable en los escenarios simulados | Que se conoce la pérdida en el peor de los casos |
Imprime esa tabla y pégala en algún lugar. Casi todas las afirmaciones excesivas en este campo, incluidas las mías anteriores, provienen de leer una celda en la columna central como si perteneciera a la derecha.
Lo que no puede demostrar
Explícitamente, debido a que la auditoría de esta página identificó correctamente esta como la sección faltante:
- Una ventaja causal: Nada aquí explica por qué la estrategia debería funcionar.
- Representatividad de la muestra: Tus datos cubren lo que sucedió, no lo que podría haber sucedido.
- Supervivencia de régimen: Las condiciones que nunca aparecieron en tu historial no pueden ser sometidas a pruebas de estrés.
- Libertad de la manipulación de datos (data snooping): Si generaste quinientos candidatos y te quedaste con tres, ese proceso de selección es invisible para cualquier prueba de robustez.
- Modelado de costes correcto: La aleatorización del spread prueba un rango que tú elegiste. Los costes reales podrían estar fuera de él.
- Calidad de ejecución en cuenta real: Las ejecuciones simuladas son supuestos.
- Drawdown futuro limitado: El peor resultado simulado no es necesariamente el peor posible.
- Preparación para el despliegue: Superar la prueba es un dato entre varios, nunca un veredicto.
Este punto sobre la búsqueda repetida merece énfasis. Generar cientos de candidatos y conservar solo aquellos que cumplen tus criterios es un proceso de selección, y la selección produce ganadores por puro azar cuando el grupo es lo suficientemente grande. Las ejecuciones de Monte Carlo actúan sobre el superviviente y no te dicen nada sobre cuántos cadáveres pisó en el camino.
Los seis tipos de prueba no son intercambiables
Agrupar estas simulaciones de Monte Carlo como una sola propiedad llamada robustez es un error que cometí repetidamente, y las pruebas responden a preguntas genuinamente diferentes.
| Prueba | Qué examina | Categoría |
| Parámetros de indicadores aleatorios | Sensibilidad a ajustes cercanos | Variación de la estrategia |
| Barra de inicio aleatoria | Dependencia de la ventana histórica elegida | Variación de la estrategia |
| Spread aleatorio | Sensibilidad a cambios en los costes de transacción | Variación de mercado |
| Historial de precios aleatorio | Sensibilidad a supuestos de perturbación de datos | Variación de mercado |
| Posiciones omitidas aleatoriamente | Dependencia de recibir cada ejecución esperada | Problema de ejecución |
| Posiciones cerradas aleatoriamente | Sensibilidad a salidas prematuras o interrupciones | Problema de ejecución |
Una estrategia puede superar una aleatorización de parámetros y colapsar ante un ensanchamiento del spread. Esos resultados te dicen cosas distintas y sugieren remedios diferentes, por lo que reportar un único aprobado o reprobado para los seis procesos hace que se pierda la mayor parte de la información.
Parámetros aleatorios
En esta variante de Monte Carlo, el software desplaza repetidamente los valores de los indicadores en pequeñas cantidades y luego vuelve a ejecutar la prueba, imitando manualmente lo que harías al ajustar manualmente el periodo de una media móvil y volver a probarlo.
Aprobar sugiere que el resultado no depende de una combinación precisa. Sinceramente, fallar es más informativo que aprobar: una estrategia que solo funciona con un periodo de 14 y se desmorona con 13 y 15 casi con seguridad ha encontrado ruido.
Lo que no puedes concluir es que tus valores elegidos sean correctos o que la lógica subyacente capture algo real. Es totalmente posible que configuraciones cercanas fallen juntas cuando todas comparten la misma premisa errónea.
Barra de inicio aleatoria
Aquí, las simulaciones de Monte Carlo comienzan desde varios puntos dispersos en el conjunto de datos, en lugar de hacerlo siempre desde la misma fecha.
Mi redacción original afirmaba que esto demuestra que una estrategia no está sobreoptimizada para el periodo, y que un resultado de aprobación significa que no importa cuándo la conectes a un gráfico. Ambas afirmaciones eran demasiado contundentes.
Aquí presento la versión más cuidadosa. Aprobar sugiere que el resultado no depende totalmente de una fecha de inicio específica dentro del historial probado. Eso es útil, y detecta algunos casos en los que un generador ajustó los parámetros a una ventana específica. Lo que no puede descartar: el sobreajuste de parámetros de forma más amplia, el sesgo de selección de indicadores, el sesgo de selección de símbolo y temporalidad, o la posibilidad de que todo el conjunto de datos represente un único régimen favorable.
Diferentes puntos de inicio dentro de los mismos tres años de datos de precios siguen siendo los mismos tres años. Si las condiciones a lo largo de todo ese periodo se adaptaron a la lógica, cada fecha de inicio parecerá correcta y no habrás aprendido nada sobre los siguientes tres años.
Aleatorización de spread y datos
La variación del spread en Monte Carlo es crucial para cualquiera cuyo bróker cotice costes flotantes que se ensanchan bruscamente durante las noticias o el rollover. Ejecutar la prueba con spreads aleatorios muestra si el resultado histórico sobrevive cuando los costes se mueven dentro de la banda que especificaste.
Nota el matiz. Tú especificaste la banda. Una estrategia que tolera spreads de entre uno y tres puntos no dice nada sobre su comportamiento ante un spread de ocho durante un pico de volatilidad.
La aleatorización del historial de precios perturba la secuencia subyacente. Es útil cuando la calidad de tus datos es cuestionable o tu feed tiene lagunas, aunque plantea una cuestión metodológica que el artículo original nunca abordó: ¿la aleatorización preserva la agrupación de volatilidad y la correlación serial? Los mercados de divisas reales presentan ambas. Un método de perturbación que las desordena prueba un mundo que no existe.
Las pruebas de ejecución merecen más respeto
Las posiciones saltadas y las cerradas prematuramente fueron las dos simulaciones de Monte Carlo que utilicé para descartar, bajo el razonamiento de que los sistemas totalmente automatizados no deberían experimentar interferencias, y que cualquiera que sufra problemas de ejecución debería cambiar de bróker.
Ese consejo fue demasiado superficial y ahora lo revisaría.
Las posiciones realmente se pierden por razones que no tienen nada que ver con un mal bróker: caídas de conexión, reinicios de la plataforma, el reinicio de un servidor virtual para actualizaciones, recotizaciones durante movimientos rápidos, falta de margen o simplemente el cierre de la terminal. Una estrategia cuyo resultado completo depende de capturar dos entradas específicas de cuatrocientas es frágil, y es algo que conviene saber; la prueba de posiciones saltadas revela precisamente eso.
Cambiar de bróker también resuelve menos de lo que implicaba. El slippage durante los anuncios es una propiedad del mercado, no de una firma en particular.
Así que realiza esas pruebas. Te costarán minutos, y una estrategia que se desmorona cuando el cinco por ciento de las entradas desaparecen te está diciendo algo sobre el riesgo de concentración.
La regla del 80 por ciento, analizada con honestidad
Mi regla de trabajo ha sido que al menos el 80 por ciento de las ejecuciones de Monte Carlo deben mantenerse positivas, lo que con veinte ejecuciones significa dieciséis.
Dos ejemplos de la grabación original: un candidato devolvió quince de veinte y fue rechazado; otro devolvió diecisiete y aprobó.
Ahora permíteme desmenuzar esa regla, ya que merece un escrutinio.
Veinte es muy poco. Con veinte extracciones, la diferencia entre quince y dieciséis está dentro del ruido de muestreo. Vuelve a ejecutar la misma estrategia con una semilla aleatoria diferente y las quince podrían convertirse en diecisiete. Cientos o miles de ejecuciones cuestan más tiempo pero producen una distribución que realmente puedes leer.
Ser rentable es un estándar bajo. Una ejecución que termina un dólar arriba cuenta exactamente igual que una que termina cinco mil arriba. Contar resultados positivos descarta por completo la magnitud.
¿De dónde salió el 80? De la experiencia y el instinto, no de la validación. Nunca he probado si las estrategias que superan ese umbral superan posteriormente a las que quedan justo por debajo, y hasta que alguien lo haga, el número es una convención más que un hallazgo.
Mejores medidas para observar en un gran conjunto de ejecuciones:
| Métrica | Lo que te indica |
| Resultado de la mediana | El resultado típico, menos distorsionado que un promedio |
| Percentil cinco | Un caso malo razonable |
| Peor resultado | La cola que realmente tendrías que sobrevivir |
| Distribución de drawdown máximo | No es una sola cifra, sino un conjunto de ellas |
| Probabilidad de terminar en negativo | Más informativo que un recuento de aprobados |
| Probabilidad de ruina | Probabilidad de alcanzar un nivel que termine con la cuenta |
| Racha de pérdidas más larga | Lo que tendrías que soportar |
| Factor de recuperación | Resultado relativo a la peor caída |
Informar sobre una mediana y un percentil cinco es mejor que informar sobre dieciséis de veinte. Las distribuciones de probabilidad aportan información; una sola ratio descarta la mayor parte.
Configuraciones que deberías publicar
Cualquier resultado de Monte Carlo no significa nada sin su diseño de simulación, y esta es la información que la página original carecía por completo:
- Cuántas ejecuciones
- Política de semilla aleatoria y si los resultados se replican
- Distribución utilizada para los cambios de parámetros y la desviación permitida
- Distribución de spread y límites
- Método de aleatorización de precios
- Si el orden de las posiciones se altera
- Si los resultados se seleccionan con reemplazo
- Si la correlación serial y la agrupación de volatilidad sobreviven
- Si los costes varían según la sesión
- Qué métricas definen un aprobado
Mantengo los valores predeterminados del software, que son lo suficientemente sensatos como para no haber sentido nunca la necesidad de cambiarlos. Es una posición razonable, aunque también significa que no puedo decirte con precisión a qué desviación se aplican esos valores, y tampoco podría un lector que intente reproducir mis resultados. Publica los tuyos.
Los criterios de aceptación son lo primero
Antes de que comience cualquier trabajo de Monte Carlo, los candidatos tienen que superar umbrales de calidad básicos. Los míos, del generador:
| Criterio | Valor | Razón |
| Calidad mínima de la prueba | 98 | Protege contra problemas de barras ambiguas |
| Posiciones mínimas | 350 | Las muestras pequeñas no prueban nada |
| Factor de beneficio mínimo | 1,2 | Ganancias brutas un veinte por ciento por encima de las pérdidas brutas |
| R-cuadrado mínimo | 60 | Prefiere curvas de equidad más estables |
Dos correcciones sobre cómo describí esto en 2019.
El factor de beneficio es el beneficio bruto dividido por la pérdida bruta, utilizando el valor absoluto de la cifra de la pérdida. Mi descripción anterior lo llamaba beneficio neto frente a pérdida neta, lo cual no es el mismo cálculo y produciría un número diferente.
El R-cuadrado mide qué tan fielmente la curva resultante sigue una línea recta. Las lecturas más altas significan menos desviaciones salvajes de esa línea. Lo que no mide es la dirección, el resultado neto o la significancia: una curva que declina constantemente se ajusta perfectamente a una línea y obtiene una buena puntuación. Léelo junto con la pendiente, el drawdown, el recuento de posiciones y los costes, nunca solo.
Barras ambiguas, precisamente
Vale la pena hacer esto bien, porque la explicación original implicaba que una plataforma produce la respuesta correcta.

Las barras de precios estándar registran cuatro valores: apertura, máximo, mínimo y cierre. Lo que ocurrió entre ellos no queda registrado. Cuando la salida de protección de una estrategia y su objetivo se encuentran dentro de una misma barra, la secuencia es realmente desconocida.
Diferentes plataformas resuelven eso de forma distinta. MetaTrader asume que el objetivo llegó primero. El generador que utilizo asume que la salida de protección fue la primera.
Prefiero la segunda opción, ya que un sistema cuya historia está llena de barras ambiguas resueltas de forma optimista parecerá considerablemente mejor de lo que merece. Pero la elección pesimista es un supuesto conservador, no una reconstrucción de lo que realmente ocurrió. Nadie sabe qué pasó. Los datos de mayor resolución reducen la frecuencia con la que surge la ambigüedad sin eliminar por completo las limitaciones del modelo.
Por eso el umbral de calidad se sitúa en 98. Por debajo de eso, demasiados resultados dependen de un supuesto en lugar de evidencia.
Dónde se sitúa Monte Carlo entre otras comprobaciones
Las pruebas de Monte Carlo son una capa. No son la última palabra, ni un sustitio de las capas que las rodean.
| Etapa | Propósito |
| Definición de reglas | Hacer que la lógica sea objetiva y reproducible |
| Revisión de la calidad de los datos | Comprobar marcas de tiempo, huecos, precios, costes |
| Construcción in-sample | Construir e inspeccionar |
| Comprobación out-of-sample | Evaluar con datos que nunca se usaron para el desarrollo |
| Pruebas de estrés de Monte Carlo | Medir la sensibilidad a las perturbaciones elegidas |
| Análisis walk-forward | Probar la adaptación repetida a través del tiempo |
| Pruebas de forward testing en demo | Observar la ejecución bajo las condiciones actuales |
| Despliegue real pequeño | Medir ejecuciones reales y comportamiento operativo |
| Monitorización continua | Detectar el deterioro y el cambio de régimen |
La distinción que la gente más suele perder de vista: las pruebas out-of-sample utilizan datos que el proceso de construcción nunca vio, mientras que las simulaciones de Monte Carlo reutilizan los mismos datos con modificaciones. Son preguntas totalmente distintas. Aprobar una dice poco de la otra, y una estrategia que supera cada comprobación de perturbación en un conjunto de datos al que fue ajustada sigue estando ajustada a ese conjunto de datos.
El walk-forward se sitúa en un punto intermedio, reoptimizando repetidamente en una ventana móvil y probando hacia adelante, lo que al menos se aproxima a cómo operarías realmente.
Interpretación de resultados de aprobado y suspendido
Suspender es inequívoco y útil. Algo en tu lógica depende de una condición que la prueba eliminó, y esa dependencia vale la pena encontrar antes de que el capital lo haga por ti.
Aprobar es donde la interpretación suele fallar. Significa que el resultado histórico se mantuvo bajo los cambios específicos que aplicaste, usando la configuración que elegiste, con los datos que tenías. La gente razonable dice entonces “la estrategia es robusta”, lo que comprime todas esas salvedades en una sola palabra que suena a veredicto.
Una mejor forma de redactarlo para tus propias notas: superó las pruebas de parámetros aleatorios y de inicio aleatorio con la desviación predeterminada en 20 ejecuciones, resultado de la mediana X, percentil cinco Y. Más largo, menos satisfactorio, pero considerablemente más honesto.
Errores comunes
- Tratar un aprobado de Monte Carlo como una validación: Es un diagnóstico entre varios.
- Ejecutar demasiadas pocas iteraciones: Veinte ofrecen una imagen aproximada, y las pequeñas diferencias no significan nada.
- Contar solo las ejecuciones positivas: La magnitud y el drawdown aportan más información.
- Aplicarlo antes de las pruebas fuera de la muestra (out-of-sample): El orden importa; los datos no vistos van primero.
- Ignorar el proceso de selección: Filtrar cientos de candidatos hasta quedarse con unos pocos es, en sí mismo, una fuente de falsos positivos.
- Saltarse las pruebas de ejecución: El error que yo cometí durante años.
- Nunca publicar la configuración: Nadie, incluyéndote a ti mismo en el futuro, puede interpretar los resultados sin ellos.
Preguntas frecuentes
¿Cuántas iteraciones debería ejecutar?
Cientos como mínimo, y miles si tu software lo permite, porque la distribución solo se estabiliza con el tamaño de la muestra. Veinte ejecuciones dan una estimación aproximada donde las pequeñas diferencias caen dentro de la variación aleatoria, por lo que un resultado de quince frente a dieciséis puede reflejar simplemente la semilla que el software utilizó. Los conjuntos más grandes tardan más, pero producen percentiles y cifras de probabilidad sobre las que realmente puedes razonar, en lugar de un simple ratio de aprobación que descarta la mayor parte de la información.
¿Funciona Monte Carlo para estrategias de trading manual?
Parcialmente. Los métodos de perturbación que remuestrean secuencias de resultados se aplican a cualquier conjunto de resultados registrados, ya sean manuales o automatizados, y muestran de forma útil cómo los mismos resultados podrían haberse desarrollado de forma distinta. La aleatorización de parámetros no se transfiere, ya que un enfoque discrecional no tiene valores fijos que variar. El problema mayor es que los registros manuales rara vez contienen suficientes posiciones para un análisis significativo, y la propia toma de decisiones humana introduce una variación que ninguna simulación puede modelar.
¿Qué es la probabilidad de ruina?
Una estimación de la posibilidad de que tu cuenta caiga por debajo de un nivel que hayas definido como irrecuperable, calculada a través de muchos caminos simulados en lugar de una sola secuencia histórica. El tamaño de la posición, la tasa de acierto y el ratio de recompensa alimentan esa estimación financiera. La cifra importa más que el retorno esperado para cualquiera que decida qué tamaño de operación utilizar, ya que un sistema con resultados promedio atractivos y una probabilidad de ruina significativa acabará encontrando ese resultado si tiene suficiente tiempo.
¿Puede aplicarse a un portafolio en lugar de a una sola estrategia?
Sí, y hacerlo es más informativo que probar los sistemas individualmente, porque la correlación entre ellos determina el riesgo combinado. Ejecutar perturbaciones en todo el conjunto revela si varias estrategias fallan juntas bajo las mismas condiciones, algo que el análisis individual no puede mostrar. Los resultados a nivel de portafolio son frecuentemente peores de lo que sugieren las cifras individuales, ya que los sistemas construidos sobre una lógica similar tienden a encontrar sus periodos malos simultáneamente en lugar de turnarse cortésmente.
¿Deberían los resultados cambiar la forma en que determino el tamaño de mis posiciones?
¿Una estrategia que aprueba cada prueba está lista para capital real?
No. Aprobar significa que sobrevivió a las perturbaciones específicas que aplicaste a los datos sobre los que se desarrolló. Los resultados fuera de la muestra, las pruebas forward en una cuenta demo bajo las condiciones actuales y un periodo de despliegue real pequeño siguen siendo necesarios, y cada uno de ellos saca a la luz problemas que los otros no pueden. Trata la comprobación de robustez como un filtro que elimina candidatos frágiles en lugar de un certificado que califica a los supervivientes. Muchos sistemas superan todos los obstáculos simulados y decepcionan inmediatamente en la práctica.
¿Los tests distinguen la suerte de la habilidad?
Do the tests distinguish luck from skill?
No directamente, y esta limitación es fundamental. Los métodos de perturbación miden la sensibilidad, no la causalidad, por lo que una estrategia que se topó con un patrón histórico coincidente puede superar la prueba sin problemas, siempre que el patrón sea estable ante las modificaciones aplicadas. Distinguir una ventaja real de una coincidencia requiere razonar por qué la lógica debería funcionar, confirmación fuera de la muestra y, finalmente, evidencia de rendimiento en cuenta real. Las comprobaciones estadísticas reducen el campo de opciones, pero nunca resuelven la cuestión por sí solas.
¿Qué software ejecuta estas pruebas?
Expert Advisor Studio incluye el módulo descrito a lo largo de esta página, ofreciendo las seis variantes mencionadas anteriormente con ajustes de desviación configurables. Existen alternativas en la mayoría de las plataformas serias de creación de estrategias, y algunos traders escriben sus propias rutinas de remuestreo en Python, lo que ofrece un control total sobre el diseño de la perturbación a cambio de construirlo tú mismo. Sea cual sea la herramienta que elijas, publicar sus ajustes junto con tus resultados es más importante que la herramienta en sí.
Aviso legal: El autor tiene una relación comercial con Expert Advisor Studio y vende cursos que cubren el flujo de trabajo descrito aquí. El contenido es educativo y no constituye una recomendación para operar. Los resultados históricos y simulados describen únicamente condiciones pasadas.

Petko Aleksandrov


