- Бейли, Борвейн, Лопес де Прадо и Чжу (2014) показывают: подогнать стратегию так, чтобы она хорошо выглядела на обучающих данных, относительно просто; бэктест реалистичен, только если результаты на обучающих и отложенных данных согласуются.
- Ошибка отбора усугубляет дело: исследователи склонны сообщать только об успехах, а игнорирование числа попыток ведёт к завышенным ожиданиям.
- Deflated Sharpe Ratio (Бейли и Лопес де Прадо, 2014) поправляет коэффициент Шарпа на число перепробованных стратегий и на ненормальность доходностей.
- Харви, Лю и Чжу (2016) предлагают требовать от нового фактора t-статистику около 3.0 вместо 2.0 и делают вывод, что большинство заявленных открытий в финансовой экономике, вероятно, ложны.
Бэктест — самый убедительный объект в трейдинге: ровная кривая доходности, высокий коэффициент Шарпа, таблица месячных результатов. И, судя по большому корпусу исследований, одна из самых лёгких для невольной подделки вещей в финансах. В этой статье — три работы, которые стоит знать каждому, кто разрабатывает стратегии, и практический чек-лист на их основе.
1. Подгонка: бэктест выучивает шум
Бейли, Борвейн, Лопес де Прадо и Чжу определяют бэктест как историческую симуляцию алгоритмической стратегии и различают два взгляда на её результат: in-sample (IS) — на данных, по которым стратегию придумывали, и out-of-sample (OOS) — на данных, которых при разработке не видели. Их критерий короток:
«A backtest is realistic when the IS performance is consistent with the OOS performance.» — бэктест реалистичен, когда результат на обучающих данных согласуется с результатом на отложенных.
— Bailey, Borwein, López de Prado, Zhu, Notices of the AMS, 20141
Беда в том, как легко эту согласованность сломать. Авторы пишут, что для любого финансового ряда «it is relatively simple to overfit an investment strategy so that it performs well IS» — относительно просто подогнать стратегию так, чтобы она хорошо выглядела на обучающих данных.1 Подгонка (overfitting), термин из машинного обучения, описывает модель, которая «targets particular observations rather than a general structure» — нацелена на конкретные наблюдения, а не на общую закономерность. Типичный путь — то, что авторы называют data snooping: подстройка параметров, чтобы убрать конкретные убыточные сделки, о которых вы уже знаете. Через несколько итераций «оптимальные параметры» зарабатывают на особенностях именно этой выборки, которые «may well be rare in the population» — в генеральной совокупности вполне могут встречаться редко.1
Статья открывается эпиграфом Ричарда Фейнмана, который хорошо описывает опасность: «with a little skill any experimental result can be made to look like the expected consequences» — при некоторой ловкости любой результат эксперимента можно выдать за ожидаемый.1
2. Ошибка отбора: вы видите только победителей
Подгонка происходит внутри одного исследования. Ошибка отбора — между многими. В работе о Deflated Sharpe Ratio Бейли и Лопес де Прадо отмечают, что с большими данными и дешёвыми вычислениями аналитики «can backtest millions (if not billions) of alternative investment strategies» — могут прогнать миллионы, если не миллиарды, альтернативных стратегий.2 Затем люди добавляют второй фильтр:
«researchers and investment managers tend to report only positive outcomes, a phenomenon known as selection bias.» — исследователи и управляющие склонны сообщать только об успехах; это называется ошибкой отбора.
— Bailey, López de Prado, Journal of Portfolio Management, 20142
Последствие сформулировано там же прямо: если не учитывать число попыток, стоящих за открытием, это «leads to over-optimistic performance expectations» — ведёт к завышенным ожиданиям.2 Проверьте сотню случайных правил — несколько из них будут выглядеть отлично просто случайно. Если показать только их, читатель увидит выдающуюся стратегию там, где есть только шум.
3. Планка выше: Deflated Sharpe Ratio и t > 3
Рецепт авторов — Deflated Sharpe Ratio (DSR), «дефлированный» коэффициент Шарпа. Он поправляет наблюдаемый Шарп на два источника завышения: ошибку отбора при множественных проверках и доходности, распределённые не нормально (толстые хвосты и асимметрия, обычные в трейдинге). Тем самым, как сказано в аннотации, DSR «helps separate legitimate empirical findings from statistical flukes» — помогает отделить настоящие эмпирические открытия от статистических случайностей.2 Практический смысл: коэффициент Шарпа мало что значит, пока вы не знаете, сколько стратегий перебрали, чтобы его найти.
Харви, Лю и Чжу пришли к похожему выводу с другой стороны. Разобрав сотни опубликованных факторов, которые претендуют на объяснение доходности акций, они построили схему множественных проверок и заключили, что новый фактор должен преодолевать t-статистику около 3.0, а не привычные 2.0.3 Их вердикт о целой области был резким: «most claimed research findings in financial economics are likely false» — большинство заявленных открытий в финансовой экономике, вероятно, ложны.3
У рецензируемых исследований хотя бы есть рецензенты и повторные проверки. У частного бэктеста, собранного за выходные, нет ни того, ни другого, поэтому скепсиса он заслуживает не меньше.
Что это значит для трейдера
Выводы этих работ превращаются в правила, которые ничего не стоят, кроме дисциплины:
- Запишите правила до запуска теста. Каждое изменение после просмотра результатов — ещё одна попытка.
- Ведите журнал попыток. Считайте каждый вариант, включая отброшенные в уме. Без этого числа Шарп победителя не интерпретируется.
- Делите по времени. Придумывайте на ранней части данных, судите по поздней. Случайное деление пропускает будущее в прошлое.
- Требуйте согласованности. Если на отложенных данных результат сильно хуже, чем на обучающих, стратегия подогнана, что бы ни говорила статистика на обучающих.
- Поднимите планку. Результат, который один раз проходит t > 2, после пятидесяти попыток может быть случайностью. Используйте поправки вроде Deflated Sharpe Ratio или требуйте примерно t > 3.
- Предпочитайте простые правила с экономическим смыслом. Меньше параметров — меньше способов подогнаться под шум.
- Проверяйте вперёд, прежде чем рисковать деньгами. Данные, которых не было, когда правило писалось, — единственная выборка, под которую нельзя оптимизироваться.
О чужих бэктестах
Та же логика работает, когда вы оцениваете сервис сигналов, курс или опубликованную стратегию. Спросите, сколько вариантов перебрали, какой был период на отложенных данных, учтены ли комиссии и проскальзывание и показаны ли проигравшие конфигурации. Продавец, который не может ответить, в лучшем случае показал вам победителя отбора, которого вы не видите.
Footnotes
-
Bailey, D. H., Borwein, J. M., López de Prado, M., Zhu, Q. J. (2014). «Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance». Notices of the American Mathematical Society 61(5), 458–471. DOI 10.1090/noti1105. Цитата Фейнмана — эпиграф статьи (Feynman, 1964). ↩ ↩2 ↩3 ↩4
-
Bailey, D. H., López de Prado, M. (2014). «The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting and Non-Normality». Journal of Portfolio Management. SSRN 2460551. ↩ ↩2 ↩3 ↩4
-
Harvey, C. R., Liu, Y., Zhu, H. (2016). «…and the Cross-Section of Expected Returns». Review of Financial Studies 29(1), 5–68. NBER Working Paper 20592. ↩ ↩2
Источники
- Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance. David H. Bailey, Jonathan M. Borwein, Marcos López de Prado, Qiji Jim Zhu. Notices of the AMS 61(5), 458–471, 2014
- The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting and Non-Normality. David H. Bailey, Marcos López de Prado. Journal of Portfolio Management, 2014
- …and the Cross-Section of Expected Returns. Campbell R. Harvey, Yan Liu, Heqing Zhu. Review of Financial Studies 29(1), 5–68, 2016
Статья — исследование, а не инвестиционная рекомендация. Результаты на истории не гарантируют результатов в будущем.