blog-image

Simulación de Monte Carlo para estrategias de forex: lo que demuestra y lo que no puede demostrar

Advertencia de riesgo. Los productos de divisas con apalancamiento conllevan un riesgo sustancial para tu capital. Superar cualquier prueba de robustez no indica resultados futuros, y cada cifra analizada a continuación proviene de una simulación histórica.

La respuesta directa

La simulación de Monte Carlo no demuestra que tu estrategia de trading vaya a ganar dinero. Vale la pena aclararlo primero, porque la versión de 2019 de este artículo sugería lo contrario y prefiero corregirlo claramente en lugar de hacerlo discretamente.

Lo que hace el método es medir qué tan sensible es un resultado histórico a cambios específicos: diferentes configuraciones de indicadores, un punto de inicio distinto, spreads más amplios, secuencias de precios alteradas, ejecuciones omitidas. Una estrategia que sobrevive a esas perturbaciones es menos frágil bajo los supuestos que elegiste para probar. Su rendimiento en cuenta real aún puede decepcionar, y puede seguir sufriendo de overfitting, depender de un régimen específico o no ser adecuada para capital real.

Esa brecha entre “menos frágil bajo los supuestos probados” y “robusto” es el tema central de esta página.

Lo que la simulación de Monte Carlo mide realmente

Cada variante de Monte Carlo funciona de la misma manera internamente. Toma la prueba histórica original, cambia una cosa al azar, ejecútala de nuevo, repite muchas veces y luego observa la distribución de los resultados en lugar de un solo número.

La idea es genuina. Una ejecución histórica produce una única curva de equidad, y parece precisa de una manera que no se ha ganado, ya que una fecha de inicio ligeramente diferente o un spread dos puntos más amplio habrían producido algo completamente distinto. Generar cientos de simulaciones de Monte Carlo reemplaza la falsa precisión con una dispersión de posibles resultados, lo cual es más honesto.

Lo que no puede hacer es generar información que no estaba en tus datos desde el principio. Aleatorizar una secuencia histórica produce variaciones de esa secuencia, no de condiciones que el mercado aún no ha inventado.

Lo que demuestra y lo que no demuestra

ResultadoLectura razonableLo que no establece
Pequeños cambios de parámetros mantienen la rentabilidadLa estrategia no está en el límite de la fragilidad cerca de esos ajustesQue los ajustes sean óptimos o que exista una ventaja (*edge*)
Diferentes fechas de inicio mantienen la rentabilidadLos resultados no dependen enteramente de un único punto de entrada históricoRentabilidad futura
Spreads más amplios siguen siendo aceptablesLos costes dentro del rango probado son tolerablesQue la ejecución en cuenta real coincida con el modelo
Las posiciones omitidas no destruyen los resultadosMenor dependencia de capturar cada señalQue el riesgo de ejecución del bróker está gestionado
La mayoría de las ejecuciones se mantienen positivasEl resultado histórico es bastante estable bajo esas perturbacionesSignificancia estadística o ausencia de overfitting
El drawdown se mantiene dentro de los límitesEl riesgo puede ser tolerable en los escenarios simuladosQue se conoce la pérdida en el peor de los casos

Imprime esa tabla y pégala en algún lugar. Casi todas las afirmaciones excesivas en este campo, incluidas las mías anteriores, provienen de leer una celda en la columna central como si perteneciera a la derecha.

Lo que no puede demostrar

Explícitamente, debido a que la auditoría de esta página identificó correctamente esta como la sección faltante:

  • Una ventaja causal: Nada aquí explica por qué la estrategia debería funcionar.
  • Representatividad de la muestra: Tus datos cubren lo que sucedió, no lo que podría haber sucedido.
  • Supervivencia de régimen: Las condiciones que nunca aparecieron en tu historial no pueden ser sometidas a pruebas de estrés.
  • Libertad de la manipulación de datos (data snooping): Si generaste quinientos candidatos y te quedaste con tres, ese proceso de selección es invisible para cualquier prueba de robustez.
  • Modelado de costes correcto: La aleatorización del spread prueba un rango que tú elegiste. Los costes reales podrían estar fuera de él.
  • Calidad de ejecución en cuenta real: Las ejecuciones simuladas son supuestos.
  • Drawdown futuro limitado: El peor resultado simulado no es necesariamente el peor posible.
  • Preparación para el despliegue: Superar la prueba es un dato entre varios, nunca un veredicto.

Este punto sobre la búsqueda repetida merece énfasis. Generar cientos de candidatos y conservar solo aquellos que cumplen tus criterios es un proceso de selección, y la selección produce ganadores por puro azar cuando el grupo es lo suficientemente grande. Las ejecuciones de Monte Carlo actúan sobre el superviviente y no te dicen nada sobre cuántos cadáveres pisó en el camino.

Los seis tipos de prueba no son intercambiables

Agrupar estas simulaciones de Monte Carlo como una sola propiedad llamada robustez es un error que cometí repetidamente, y las pruebas responden a preguntas genuinamente diferentes.

PruebaQué examinaCategoría
Parámetros de indicadores aleatoriosSensibilidad a ajustes cercanosVariación de la estrategia
Barra de inicio aleatoriaDependencia de la ventana histórica elegidaVariación de la estrategia
Spread aleatorioSensibilidad a cambios en los costes de transacciónVariación de mercado
Historial de precios aleatorioSensibilidad a supuestos de perturbación de datosVariación de mercado
Posiciones omitidas aleatoriamenteDependencia de recibir cada ejecución esperadaProblema de ejecución
Posiciones cerradas aleatoriamenteSensibilidad a salidas prematuras o interrupcionesProblema de ejecución

Una estrategia puede superar una aleatorización de parámetros y colapsar ante un ensanchamiento del spread. Esos resultados te dicen cosas distintas y sugieren remedios diferentes, por lo que reportar un único aprobado o reprobado para los seis procesos hace que se pierda la mayor parte de la información.

Parámetros aleatorios

En esta variante de Monte Carlo, el software desplaza repetidamente los valores de los indicadores en pequeñas cantidades y luego vuelve a ejecutar la prueba, imitando manualmente lo que harías al ajustar manualmente el periodo de una media móvil y volver a probarlo.

Aprobar sugiere que el resultado no depende de una combinación precisa. Sinceramente, fallar es más informativo que aprobar: una estrategia que solo funciona con un periodo de 14 y se desmorona con 13 y 15 casi con seguridad ha encontrado ruido.

Lo que no puedes concluir es que tus valores elegidos sean correctos o que la lógica subyacente capture algo real. Es totalmente posible que configuraciones cercanas fallen juntas cuando todas comparten la misma premisa errónea.

Barra de inicio aleatoria

Aquí, las simulaciones de Monte Carlo comienzan desde varios puntos dispersos en el conjunto de datos, en lugar de hacerlo siempre desde la misma fecha.

Mi redacción original afirmaba que esto demuestra que una estrategia no está sobreoptimizada para el periodo, y que un resultado de aprobación significa que no importa cuándo la conectes a un gráfico. Ambas afirmaciones eran demasiado contundentes.

Aquí presento la versión más cuidadosa. Aprobar sugiere que el resultado no depende totalmente de una fecha de inicio específica dentro del historial probado. Eso es útil, y detecta algunos casos en los que un generador ajustó los parámetros a una ventana específica. Lo que no puede descartar: el sobreajuste de parámetros de forma más amplia, el sesgo de selección de indicadores, el sesgo de selección de símbolo y temporalidad, o la posibilidad de que todo el conjunto de datos represente un único régimen favorable.

Diferentes puntos de inicio dentro de los mismos tres años de datos de precios siguen siendo los mismos tres años. Si las condiciones a lo largo de todo ese periodo se adaptaron a la lógica, cada fecha de inicio parecerá correcta y no habrás aprendido nada sobre los siguientes tres años.

Aleatorización de spread y datos

La variación del spread en Monte Carlo es crucial para cualquiera cuyo bróker cotice costes flotantes que se ensanchan bruscamente durante las noticias o el rollover. Ejecutar la prueba con spreads aleatorios muestra si el resultado histórico sobrevive cuando los costes se mueven dentro de la banda que especificaste.

Nota el matiz. Tú especificaste la banda. Una estrategia que tolera spreads de entre uno y tres puntos no dice nada sobre su comportamiento ante un spread de ocho durante un pico de volatilidad.

La aleatorización del historial de precios perturba la secuencia subyacente. Es útil cuando la calidad de tus datos es cuestionable o tu feed tiene lagunas, aunque plantea una cuestión metodológica que el artículo original nunca abordó: ¿la aleatorización preserva la agrupación de volatilidad y la correlación serial? Los mercados de divisas reales presentan ambas. Un método de perturbación que las desordena prueba un mundo que no existe.

Las pruebas de ejecución merecen más respeto

Las posiciones saltadas y las cerradas prematuramente fueron las dos simulaciones de Monte Carlo que utilicé para descartar, bajo el razonamiento de que los sistemas totalmente automatizados no deberían experimentar interferencias, y que cualquiera que sufra problemas de ejecución debería cambiar de bróker.

Ese consejo fue demasiado superficial y ahora lo revisaría.

Las posiciones realmente se pierden por razones que no tienen nada que ver con un mal bróker: caídas de conexión, reinicios de la plataforma, el reinicio de un servidor virtual para actualizaciones, recotizaciones durante movimientos rápidos, falta de margen o simplemente el cierre de la terminal. Una estrategia cuyo resultado completo depende de capturar dos entradas específicas de cuatrocientas es frágil, y es algo que conviene saber; la prueba de posiciones saltadas revela precisamente eso.

Cambiar de bróker también resuelve menos de lo que implicaba. El slippage durante los anuncios es una propiedad del mercado, no de una firma en particular.

Así que realiza esas pruebas. Te costarán minutos, y una estrategia que se desmorona cuando el cinco por ciento de las entradas desaparecen te está diciendo algo sobre el riesgo de concentración.

La regla del 80 por ciento, analizada con honestidad

Mi regla de trabajo ha sido que al menos el 80 por ciento de las ejecuciones de Monte Carlo deben mantenerse positivas, lo que con veinte ejecuciones significa dieciséis.

Dos ejemplos de la grabación original: un candidato devolvió quince de veinte y fue rechazado; otro devolvió diecisiete y aprobó.

Ahora permíteme desmenuzar esa regla, ya que merece un escrutinio.

Veinte es muy poco. Con veinte extracciones, la diferencia entre quince y dieciséis está dentro del ruido de muestreo. Vuelve a ejecutar la misma estrategia con una semilla aleatoria diferente y las quince podrían convertirse en diecisiete. Cientos o miles de ejecuciones cuestan más tiempo pero producen una distribución que realmente puedes leer.

Ser rentable es un estándar bajo. Una ejecución que termina un dólar arriba cuenta exactamente igual que una que termina cinco mil arriba. Contar resultados positivos descarta por completo la magnitud.

¿De dónde salió el 80? De la experiencia y el instinto, no de la validación. Nunca he probado si las estrategias que superan ese umbral superan posteriormente a las que quedan justo por debajo, y hasta que alguien lo haga, el número es una convención más que un hallazgo.

Mejores medidas para observar en un gran conjunto de ejecuciones:

MétricaLo que te indica
Resultado de la medianaEl resultado típico, menos distorsionado que un promedio
Percentil cincoUn caso malo razonable
Peor resultadoLa cola que realmente tendrías que sobrevivir
Distribución de drawdown máximoNo es una sola cifra, sino un conjunto de ellas
Probabilidad de terminar en negativoMás informativo que un recuento de aprobados
Probabilidad de ruinaProbabilidad de alcanzar un nivel que termine con la cuenta
Racha de pérdidas más largaLo que tendrías que soportar
Factor de recuperaciónResultado relativo a la peor caída

Informar sobre una mediana y un percentil cinco es mejor que informar sobre dieciséis de veinte. Las distribuciones de probabilidad aportan información; una sola ratio descarta la mayor parte.

Configuraciones que deberías publicar

Cualquier resultado de Monte Carlo no significa nada sin su diseño de simulación, y esta es la información que la página original carecía por completo:

  • Cuántas ejecuciones
  • Política de semilla aleatoria y si los resultados se replican
  • Distribución utilizada para los cambios de parámetros y la desviación permitida
  • Distribución de spread y límites
  • Método de aleatorización de precios
  • Si el orden de las posiciones se altera
  • Si los resultados se seleccionan con reemplazo
  • Si la correlación serial y la agrupación de volatilidad sobreviven
  • Si los costes varían según la sesión
  • Qué métricas definen un aprobado

Mantengo los valores predeterminados del software, que son lo suficientemente sensatos como para no haber sentido nunca la necesidad de cambiarlos. Es una posición razonable, aunque también significa que no puedo decirte con precisión a qué desviación se aplican esos valores, y tampoco podría un lector que intente reproducir mis resultados. Publica los tuyos.

Los criterios de aceptación son lo primero

Antes de que comience cualquier trabajo de Monte Carlo, los candidatos tienen que superar umbrales de calidad básicos. Los míos, del generador:

CriterioValorRazón
Calidad mínima de la prueba98Protege contra problemas de barras ambiguas
Posiciones mínimas350Las muestras pequeñas no prueban nada
Factor de beneficio mínimo1,2Ganancias brutas un veinte por ciento por encima de las pérdidas brutas
R-cuadrado mínimo60Prefiere curvas de equidad más estables

Dos correcciones sobre cómo describí esto en 2019.

El factor de beneficio es el beneficio bruto dividido por la pérdida bruta, utilizando el valor absoluto de la cifra de la pérdida. Mi descripción anterior lo llamaba beneficio neto frente a pérdida neta, lo cual no es el mismo cálculo y produciría un número diferente.

El R-cuadrado mide qué tan fielmente la curva resultante sigue una línea recta. Las lecturas más altas significan menos desviaciones salvajes de esa línea. Lo que no mide es la dirección, el resultado neto o la significancia: una curva que declina constantemente se ajusta perfectamente a una línea y obtiene una buena puntuación. Léelo junto con la pendiente, el drawdown, el recuento de posiciones y los costes, nunca solo.

Barras ambiguas, precisamente

Vale la pena hacer esto bien, porque la explicación original implicaba que una plataforma produce la respuesta correcta.

Las barras de precios estándar registran cuatro valores: apertura, máximo, mínimo y cierre. Lo que ocurrió entre ellos no queda registrado. Cuando la salida de protección de una estrategia y su objetivo se encuentran dentro de una misma barra, la secuencia es realmente desconocida.

Diferentes plataformas resuelven eso de forma distinta. MetaTrader asume que el objetivo llegó primero. El generador que utilizo asume que la salida de protección fue la primera.

Prefiero la segunda opción, ya que un sistema cuya historia está llena de barras ambiguas resueltas de forma optimista parecerá considerablemente mejor de lo que merece. Pero la elección pesimista es un supuesto conservador, no una reconstrucción de lo que realmente ocurrió. Nadie sabe qué pasó. Los datos de mayor resolución reducen la frecuencia con la que surge la ambigüedad sin eliminar por completo las limitaciones del modelo.

Por eso el umbral de calidad se sitúa en 98. Por debajo de eso, demasiados resultados dependen de un supuesto en lugar de evidencia.

Dónde se sitúa Monte Carlo entre otras comprobaciones

Las pruebas de Monte Carlo son una capa. No son la última palabra, ni un sustitio de las capas que las rodean.

EtapaPropósito
Definición de reglasHacer que la lógica sea objetiva y reproducible
Revisión de la calidad de los datosComprobar marcas de tiempo, huecos, precios, costes
Construcción in-sampleConstruir e inspeccionar
Comprobación out-of-sampleEvaluar con datos que nunca se usaron para el desarrollo
Pruebas de estrés de Monte CarloMedir la sensibilidad a las perturbaciones elegidas
Análisis walk-forwardProbar la adaptación repetida a través del tiempo
Pruebas de forward testing en demoObservar la ejecución bajo las condiciones actuales
Despliegue real pequeñoMedir ejecuciones reales y comportamiento operativo
Monitorización continuaDetectar el deterioro y el cambio de régimen

La distinción que la gente más suele perder de vista: las pruebas out-of-sample utilizan datos que el proceso de construcción nunca vio, mientras que las simulaciones de Monte Carlo reutilizan los mismos datos con modificaciones. Son preguntas totalmente distintas. Aprobar una dice poco de la otra, y una estrategia que supera cada comprobación de perturbación en un conjunto de datos al que fue ajustada sigue estando ajustada a ese conjunto de datos.

El walk-forward se sitúa en un punto intermedio, reoptimizando repetidamente en una ventana móvil y probando hacia adelante, lo que al menos se aproxima a cómo operarías realmente.

Interpretación de resultados de aprobado y suspendido

Suspender es inequívoco y útil. Algo en tu lógica depende de una condición que la prueba eliminó, y esa dependencia vale la pena encontrar antes de que el capital lo haga por ti.

Aprobar es donde la interpretación suele fallar. Significa que el resultado histórico se mantuvo bajo los cambios específicos que aplicaste, usando la configuración que elegiste, con los datos que tenías. La gente razonable dice entonces “la estrategia es robusta”, lo que comprime todas esas salvedades en una sola palabra que suena a veredicto.

Una mejor forma de redactarlo para tus propias notas: superó las pruebas de parámetros aleatorios y de inicio aleatorio con la desviación predeterminada en 20 ejecuciones, resultado de la mediana X, percentil cinco Y. Más largo, menos satisfactorio, pero considerablemente más honesto.

Errores comunes

  • Tratar un aprobado de Monte Carlo como una validación: Es un diagnóstico entre varios.
  • Ejecutar demasiadas pocas iteraciones: Veinte ofrecen una imagen aproximada, y las pequeñas diferencias no significan nada.
  • Contar solo las ejecuciones positivas: La magnitud y el drawdown aportan más información.
  • Aplicarlo antes de las pruebas fuera de la muestra (out-of-sample): El orden importa; los datos no vistos van primero.
  • Ignorar el proceso de selección: Filtrar cientos de candidatos hasta quedarse con unos pocos es, en sí mismo, una fuente de falsos positivos.
  • Saltarse las pruebas de ejecución: El error que yo cometí durante años.
  • Nunca publicar la configuración: Nadie, incluyéndote a ti mismo en el futuro, puede interpretar los resultados sin ellos.

Preguntas frecuentes

¿Cuántas iteraciones debería ejecutar? 

Cientos como mínimo, y miles si tu software lo permite, porque la distribución solo se estabiliza con el tamaño de la muestra. Veinte ejecuciones dan una estimación aproximada donde las pequeñas diferencias caen dentro de la variación aleatoria, por lo que un resultado de quince frente a dieciséis puede reflejar simplemente la semilla que el software utilizó. Los conjuntos más grandes tardan más, pero producen percentiles y cifras de probabilidad sobre las que realmente puedes razonar, en lugar de un simple ratio de aprobación que descarta la mayor parte de la información.

¿Funciona Monte Carlo para estrategias de trading manual? 

Parcialmente. Los métodos de perturbación que remuestrean secuencias de resultados se aplican a cualquier conjunto de resultados registrados, ya sean manuales o automatizados, y muestran de forma útil cómo los mismos resultados podrían haberse desarrollado de forma distinta. La aleatorización de parámetros no se transfiere, ya que un enfoque discrecional no tiene valores fijos que variar. El problema mayor es que los registros manuales rara vez contienen suficientes posiciones para un análisis significativo, y la propia toma de decisiones humana introduce una variación que ninguna simulación puede modelar.

¿Qué es la probabilidad de ruina? 

Una estimación de la posibilidad de que tu cuenta caiga por debajo de un nivel que hayas definido como irrecuperable, calculada a través de muchos caminos simulados en lugar de una sola secuencia histórica. El tamaño de la posición, la tasa de acierto y el ratio de recompensa alimentan esa estimación financiera. La cifra importa más que el retorno esperado para cualquiera que decida qué tamaño de operación utilizar, ya que un sistema con resultados promedio atractivos y una probabilidad de ruina significativa acabará encontrando ese resultado si tiene suficiente tiempo.

¿Puede aplicarse a un portafolio en lugar de a una sola estrategia? 

Sí, y hacerlo es más informativo que probar los sistemas individualmente, porque la correlación entre ellos determina el riesgo combinado. Ejecutar perturbaciones en todo el conjunto revela si varias estrategias fallan juntas bajo las mismas condiciones, algo que el análisis individual no puede mostrar. Los resultados a nivel de portafolio son frecuentemente peores de lo que sugieren las cifras individuales, ya que los sistemas construidos sobre una lógica similar tienden a encontrar sus periodos malos simultáneamente en lugar de turnarse cortésmente.

¿Deberían los resultados cambiar la forma en que determino el tamaño de mis posiciones? 

¿Una estrategia que aprueba cada prueba está lista para capital real? 

No. Aprobar significa que sobrevivió a las perturbaciones específicas que aplicaste a los datos sobre los que se desarrolló. Los resultados fuera de la muestra, las pruebas forward en una cuenta demo bajo las condiciones actuales y un periodo de despliegue real pequeño siguen siendo necesarios, y cada uno de ellos saca a la luz problemas que los otros no pueden. Trata la comprobación de robustez como un filtro que elimina candidatos frágiles en lugar de un certificado que califica a los supervivientes. Muchos sistemas superan todos los obstáculos simulados y decepcionan inmediatamente en la práctica.

¿Los tests distinguen la suerte de la habilidad? 

Do the tests distinguish luck from skill? 

No directamente, y esta limitación es fundamental. Los métodos de perturbación miden la sensibilidad, no la causalidad, por lo que una estrategia que se topó con un patrón histórico coincidente puede superar la prueba sin problemas, siempre que el patrón sea estable ante las modificaciones aplicadas. Distinguir una ventaja real de una coincidencia requiere razonar por qué la lógica debería funcionar, confirmación fuera de la muestra y, finalmente, evidencia de rendimiento en cuenta real. Las comprobaciones estadísticas reducen el campo de opciones, pero nunca resuelven la cuestión por sí solas.

¿Qué software ejecuta estas pruebas?

 Expert Advisor Studio incluye el módulo descrito a lo largo de esta página, ofreciendo las seis variantes mencionadas anteriormente con ajustes de desviación configurables. Existen alternativas en la mayoría de las plataformas serias de creación de estrategias, y algunos traders escriben sus propias rutinas de remuestreo en Python, lo que ofrece un control total sobre el diseño de la perturbación a cambio de construirlo tú mismo. Sea cual sea la herramienta que elijas, publicar sus ajustes junto con tus resultados es más importante que la herramienta en sí.

Aviso legal: El autor tiene una relación comercial con Expert Advisor Studio y vende cursos que cubren el flujo de trabajo descrito aquí. El contenido es educativo y no constituye una recomendación para operar. Los resultados históricos y simulados describen únicamente condiciones pasadas.

About the Author

Petko Aleksandrov

Chief Mentor & Founder

Founder of EA Academy and Algo Trading Space with over 100,000 students educated globally. Petko combines practical trading experience with rigorous testing methodology, setting new standards for transparency in the algorithmic trading industry.

View Profile

Related Posts

Estrategia de scalping de EURUSD: configuración de 7 velas en M1, reglas del EA, resultados del backtesting y controles de riesgo
Estrategia de scalping de EURUSD: configuración de 7 velas en M1, reglas del EA, resultados del backtesting y controles de riesgo

El scalping de EUR/USD es popular por una razón: es el par de divisas más líquido del mercado de forex, los spreads suelen ser ajustados durante las s...

9/7/2026
EA de trading de oro avanzado: vea cada regla, configuración y riesgo

Advertencia de riesgo: Los productos con apalancamiento conllevan un riesgo sustancial para su capital. La simulación histórica describe lo que ya suc...

8/28/2026
EA de trading de oro avanzado: vea cada regla, configuración y riesgo
  • Share

Comment

No comments yet. Be the first to comment!

Leave a Comment

Your email address will not be published. Required fields are marked with *