Partes de datos: ¿qué son y cómo pueden utilizarse?

El nuevo SQ build 125 introduce múltiples partes de rango de datos. Hasta ahora, sólo se podían dividir los datos históricos en dos partes:

  • En la muestra - Aquí es donde las estrategias evolucionan mediante evolución genética. Esto significa que la estrategia se evalúa en esta parte de los datos, y su puntuación de rendimiento (aptitud) se calcula a partir de métricas en esta parte de los datos. Esta aptitud determina entonces qué estrategias de la población se seleccionan para ser cruzadas y mutadas para crear una nueva generación. Las mejores estrategias tienen más probabilidades de ser elegidas y, gracias a ello, la población en su conjunto debería mejorar con cada generación.
  • Fuera de muestra - se trata de una parte "desconocida" de los datos que no formaba parte de la evolución. Se utiliza para verificar que las estrategias funcionan también con datos "desconocidos".
    La evolución genética no ve esta parte de los datos.

 

La nueva construcción 125 añade dos tipos posibles más, lo que hace un total de 4:

  • Formación en muestras (IST) - esto es lo mismo que In Sample que teníamos hasta ahora. La evolución genética utiliza esta parte para determinar la aptitud y clasificar las estrategias en la población.
  • Validación de muestras (ISV) - una nueva parte en SQ X que se utiliza para determinar si el rendimiento de la estrategia en la parte IST se mantiene también en la parte ISV.
    En el aprendizaje automático, se utiliza para determinar si los modelos entrenados en el conjunto de entrenamiento (IST) son válidos también en el conjunto de validación.
    En SQ X puede utilizarse para reiniciar la evolución genética cuando la aptitud se estanca en esta parte.
  • Fuera de la muestra - esto es igual que antes, representa una parte "desconocida" de datos que no formaba parte de la evolución
  • No Comercio parte especial que significa que la estrategia no operará en esta parte. Se puede utilizar, por ejemplo, para omitir una parte en medio de los datos que tiene baja volatilidad.

 

La recomendación general en el aprendizaje automático es dividir los datos históricos en 3 partes iguales: IST, ISV y OOS.


Otra posible división podría ser 60/20/20, o mover el periodo Fuera de Muestra al frente.

 

Múltiples secciones de datos

Otra novedad de SQ X B 125 es que puede definir varios Validación en la muestra o fuera de la muestra piezasno sólo uno, y en el orden que quieras.

En la imagen de arriba, las partes blancas son todos los entrenamientos de la muestra: son los datos sobre los que evolucionan las estrategias.

Las partes azules (ISV) son datos sobre los que se verifican las estrategias, y la evolución puede reiniciarse cuando está estancada.

La parte gris (no trade) es la que queda fuera - la estrategia no se negocia aquí.

Las partes verdes son partes OOS - no forman parte de la evolución genética y las estrategias se evalúan sobre datos desconocidos.

 

Condiciones y filtrado por cada sección

Todas las métricas son ahora calculado también independientemente para cada una de estas partesy puedes utilizarlos en tus condiciones.

Por ejemplo, puede filtrar las estrategias en las que: Beneficio neto (OOS1) es peor que 80% de Beneficio neto (OOS2).

Esto le permite utilizar un filtrado "más estricto" cuando la estrategia tiene que funcionar bien en varias partes de los datos.

12 Comentarios
Más antiguo
Más reciente Más votados
Emmanuel
12. 4. 2022 9:14 am

Gracias

murty
17. 6. 2023 10:57 pm

Aquí, para el beneficio neto (IS) , IS incluye IST e ISV1 e ISV2. ¿Estoy en lo cierto?

David
Responder a  murty
14. 1. 2024 16:26

Buena pregunta. ¿Alguien del equipo SQ que quiera responder?

tomas262
Admin
Responder a  murty
16. 1. 2024 10:29 pm

Sí, correcto.

Joshua Murlin
4. 12. 2023 21:44

me siento muy tonto tratando de entender lo que esto significa.

tomas262
Admin
Responder a  Joshua Murlin
5. 12. 2023 19:53

si tiene alguna pregunta concreta, no dude en formularla

Juan Pérez
6. 4. 2024 5:41 am

¿Puedes explicar con más detalles cuál es la diferencia entre ISV y OOS? Tal vez es algo relacionado con el aprendizaje automático, pero no lo entiendo

tomas262
Admin
Responder a  Juan Pérez
12. 4. 2024 20:20

Se trata de una parte de datos en SQ X que se utiliza para determinar si el rendimiento de la estrategia en IST (parte de entrenamiento) se mantiene también en la parte ISV. En SQ X se puede utilizar para reiniciar la evolución genética cuando la aptitud se estanca en esta parte. Así que es una especie de semi-OOS que se utiliza para verificar el rendimiento antes de que se verifique en el OOS.

Luesak Luesukprasert
19. 6. 2024 16:46

Pregunta rápida... si aplicamos filtros de clasificación a "Completo", ¿se aplicarán también estos factores a la parte ISV? ¿O deben establecerse en ISV? Y también hay una opción para "IS", ¿cuál es la diferencia entre "IS" e "IST" en SQX 139?

Gracias

Kim

tomas262
Admin
Responder a  Luesak Luesukprasert
20. 6. 2024 21:30

Sí, completo significa que todos los datos están+oos partes incluidos

Luesak Luesukprasert
Responder a  tomas262
21. 6. 2024 14:00

Permítanme confirmar así que si separé mis datos en cuatro segmentos de la siguiente manera....
OOS1, OOS2, ISV, IST
Y en el filtro de rango sólo puse Profi Factor (Full) > 1.3

Eso equivale a decir
1TP9Factor de ajuste (OOS1) > 1,3
1TP9Factor de ajuste (OOS2) > 1,3
1TP9Factor de ajuste (ISV) > 1,3
1TP9Factor de ajuste (IST) > 1,3

Porque esto es muy diferente de
Todos los datos 1TP9Factor de ajuste (OOS1) > 1,3

Martin Zinck
Martin Zinck
17. 9. 2024 6:49 am

Hola, muchas gracias por este útil artículo.

¿Qué configuración debo utilizar para maximizar el aprendizaje automático de la mejor manera?

  1. ¿Mis criterios de clasificación para IST?
  2. ¿Mis criterios de clasificación para IST+ISV=IS?
  3. ¿Alguna otra combinación?

Muchas gracias,
Martin

Seguir leyendo