К основному содержанию
ForexNews24
Data mining bias: как обмануть себя перебором — Бэктесты и статистика, ForexNews24

Data mining bias: как обмануть себя перебором

Редакция ForexNews24Аналитический отдел ForexNews24
Опубликовано

Если проверить достаточно много вариантов, лучший из них будет выглядеть отлично — даже когда преимущества нет ни у одного. Это не редкая аномалия, а неизбежное свойство перебора, и именно на нём построена большая часть впечатляющих результатов, которые вам показывают.

Data mining bias: механика на нашем примере

Мы прогнали десять классических правил на двенадцати парах. Лучший результат — у правила «откатОткат — Что это за возврат цены против движения, чем отличается от разворота и почему откаты дают удобные точки входа по тренду. Подробнее → к 38/61% диапазона 20 баров по тренду»: медианная доходность 2.44% при 8 прибыльных парах из 12. Выглядит как находка. Но мы получили эту цифру, выбрав лучшее из десяти, и вот что это значит: даже если бы ни у одного из десяти правил не было преимущества, одно из них всё равно оказалось бы лучшим, и его результат отличался бы от нуля просто в силу разброса.

Именно поэтому в статье об этом правиле мы написали, что записывать результат в подтверждение метода не стоит. Число проверенных вариантов — часть результата, и умалчивать о ней нельзя.

Сколько вариантов на самом деле перебирается

Обычно гораздо больше, чем кажется. Десять правил — это верхняя, видимая часть. Под ней варианты параметров: изменение периода средней с 20 на 21 — уже другая проверка. Выбор инструмента, выбор таймфрейма, выбор периода истории. Тот, кто перебрал сто комбинаций и показал лучшую, формально не соврал ни в одной цифре — он просто не сообщил знаменатель.

Чем это отличается от переоптимизации

Переоптимизация — это подгонка параметров одной системы под историю. Data mining bias шире: он возникает и при переборе разных систем, разных инструментов, разных периодов. Можно не оптимизировать ни один параметр и всё равно обмануть себя, просто проверив достаточно много идей и рассказав про удачную.

Что с этим делать

Первое и главное — считать и сообщать число проверенных вариантов. Второе — требовать от результата тем большего запаса, чем больше вариантов проверено. Третье — оставлять часть данных нетронутой до самого конца и проверять на ней только финального кандидата, один раз: разделение выборки помогает только при однократном использовании отложенной части. И четвёртое — относиться к чужим результатам с вопросом «сколько вариантов было проверено до этого», потому что без ответа на него цифра доходности не интерпретируется.

Материал носит образовательный характер и не является индивидуальной инвестиционной рекомендацией. Результаты тестирования на исторических данных не гарантируют аналогичных результатов в будущем. Торговля на форексе сопряжена с риском потери капитала.

Частые вопросы

Что такое data mining bias?

Систематическое завышение результата из-за перебора вариантов. Лучший из множества проверенных выглядит убедительно даже тогда, когда преимущества нет ни у одного — разброс результатов существует и при полном отсутствии края.

Чем это отличается от переоптимизации?

Переоптимизация — подгонка параметров одной системы под историю. Data mining bias шире и возникает при переборе разных систем, инструментов и периодов, даже без оптимизации параметров.

Как защититься от этой ошибки?

Считать и сообщать число проверенных вариантов, требовать большего запаса при большем переборе и держать часть данных нетронутой до финальной однократной проверки.

Поделиться:TelegramВКонтакте
Дайджест

Новые разборы бэктестов — на почту

Когда выходит новое воспроизводимое исследование или обновляются данные — присылаем короткое письмо. Без спама, без «сигналов» и продажи вашей почты.

Оставляя почту, вы соглашаетесь получать редкие письма портала. Отписка — в один клик из любого письма.

От исследования — к применению

В продукте Allocation мы реализовали эти алгоритмы с учётом всех нюансов, разобранных на портале.

Узнать про Allocation