第13章 机器学习在量化中的正确用法与巨大陷阱

126页 · 预计10

机器学习这几年在量化领域很火,到处都是“AI预测股价”“机器学习跑赢大盘”的宣传。但实际实盘能用的机器学习策略非常少,绝大多数都是回测好看实盘失效。

核心问题不是模型不行,是大多数人用错了:用处理图片分类的思路做时间序列,随机打乱数据集、未来函数泄露、过度拟合,最后出来的都是伪策略。

13.1 机器学习做量化的边界:能做什么,不能做什么

机器学习能做的事

  • 因子挖掘:海量数据里找有效因子、非线性关系;
  • 模式识别:识别趋势、震荡、顶底形态;
  • 信号融合:多因子非线性组合,比简单加权效果好;
  • 文本分析:研报、新闻、财报、舆情的情感分析、事件提取;
  • 异常检测:异常交易、价格异动、风险识别。

机器学习不能做的事

  • 精准预测价格:别指望LSTM、Transformer准确预测明天股价,不可能。
  • 替代策略逻辑:纯黑箱模型,不知道为什么赚钱,实盘大概率失效。
  • 高频全自动化交易:Level2、逐笔高频策略,机器学习很容易过拟合。
    正确定位:机器学习是工具,用来辅助因子挖掘、信号处理,不是替代策略逻辑的圣杯。

13.2 数据集划分:时间序列切分,禁止随机打乱

机器学习量化最大、最常见的错误:随机打乱训练集测试集。 时间序列数据,先后顺序是核心信息。随机打乱之后,未来数据泄露到训练集,回测结果全是假的。

正确切分方式

  • 时间切分:前面时间段做训练集,后面时间段做验证集,最后面做样本外集。 比如2010-2020训练,2020-2022验证,2022-2023样本外。
  • 滚动训练:滚动时间窗口,定期重新训练,不断用新数据。 比如每半年重新训练一次,或者每年重训。
  • 禁止任何形式的未来泄露:训练数据绝对不能包含未来信息。
    只要看到“准确率90%”“年化50%”的机器学习策略,先看数据集怎么切的。随机打乱的直接作废。

13.3 特征工程:因子作为特征

机器学习不是数据越多越好,特征工程比模型重要。

特征来源

  • 量价因子:动量、反转、波动率、量价类,传统因子;
  • 基本面因子:盈利、质量、估值;
  • 宏观因子:利率、汇率、流动性;
  • 事件因子:财报、事件、情绪。

特征处理

  • 去极值、标准化,截面处理;
  • 特征正交化,去除多重共线性;
  • 特征选择,不要几百个特征堆进去,容易过拟合。

标签选择

不要预测“明日涨跌幅”这种连续值,回归问题噪音大。 改成分类标签:上涨/下跌、趋势/震荡,二分类问题效果好很多。 或者排序问题,预测相对强弱,做横截面选股。

13.4 常见模型:逻辑回归、XGBoost、LightGBM

不是模型越复杂越好。简单模型反而鲁棒性好。

逻辑回归

最基础的线性分类模型。 优点:简单、可解释性强、不容易过拟合。 缺点:不能拟合非线性关系。 作为基准模型首选。

树模型(XGBoost、LightGBM)

梯度提升树,非线性拟合能力强。 优点:能抓非线性关系、特征交互,效果通常比线性好。 缺点:容易过拟合,参数多,需要调参,需要样本量大。 是最常用的机器学习量化模型,效果稳定。

深度学习(LSTM、Transformer)

时序模型,理论上适合时间序列。 但实盘非常容易过拟合,回测好看实盘很差。 数据量不够、特征不够的情况下,不如树模型。

模型选择原则:先简单后复杂。能简单模型解决的,就不用复杂模型。越复杂越容易过拟合。

13.5 严重过拟合的典型信号

机器学习量化90%的问题都是过拟合。识别过拟合非常重要。

过拟合典型信号

  • 训练集完美,验证集崩了:训练集夏普2.0+,验证集直接不到1.0,样本外变负。
  • 参数稍微改动,结果剧变:参数微小调整,绩效大幅变化。
  • 特征重要性离奇:核心因子是非常偏门的指标,或者逻辑说不通。
  • 样本外持续失效:实盘连续跑输回测,不是市场变了,是过拟合。

避免过拟合的方法

  • 简化模型:能线性不用树,能树不用深度学习;
  • 减少特征:少而精的特征,不要几百个特征暴力筛;
  • 正则化:L1/L2正则,限制模型复杂度;
  • 交叉验证:滚动时间序列交叉验证,不是K折随机交叉;
  • 增加样本量,延长时间区间。

13.6 避免未来信息泄露(前视偏差)

除了随机打乱,未来信息泄露是另一大杀手,而且更隐蔽。

常见未来泄露场景

  • 用未来修正数据:财报、基本面数据后续会修正,回测用修正后的数据,当时是得不到的;
  • 期末调仓用期末价格:比如每月最后一天调仓,用当天收盘价,当天盘中是不知道的;
  • 指数成分股用未来名单:用现在的指数成分股,回测过去。很多年前的成分股和现在不一样。
  • 参数遍历全样本:用全部历史数据调最优参数,再回测全段。
    未来泄露非常隐蔽,很多人过了很久都没发现,只觉得策略失效了。

13.7 机器学习策略的实盘改造

机器学习策略想要实盘落地,必须经过改造。

  • 逻辑可解释:必须能解释模型靠什么赚钱,核心因子是什么,逻辑说不通的直接放弃。
  • 长样本外测试:至少留出1-2年完全不参与训练的数据,检验效果。
  • 滚动训练:定期重新训练,比如每半年一次,用最新数据。
  • 保守仓位:初始上线用正常策略的一半仓位,观察至少半年。
  • 漂移监控:实时监控样本外绩效、特征重要性变化,出现漂移及时调整。
    机器学习量化不是“黑箱策略”。实盘必须可解释、可监控、可验证。

本章实战笔记

  • 机器学习是工具不是圣杯。90%的吹上天的AI量化策略,都是过拟合或者未来泄露。
  • 时间序列绝对不能随机打乱数据集。看到随机打乱的直接pass。
  • 特征工程比模型重要。好的特征+简单模型,远好于烂特征+复杂模型。
  • 实盘上线先减半仓。机器学习策略回测再好,实盘也要小仓位试跑。

本章核心公式卡

时间序列切分原则:训练集 → 验证集 → 样本外集,严格按时间先后,禁止随机打乱 过拟合识别:训练集完美 + 样本外崩塌 + 参数敏感

模型选择原则:先简单后复杂,优先可解释性强的模型

本章实战清单

机器学习策略开发清单

  • 明确应用场景:因子挖掘/模式识别/信号融合/文本分析 - 严格时间切分数据集,禁止随机打乱 - 特征工程:去极值、截面标准化、正交化 - 从简单模型开始:逻辑回归→树模型→深度学习 - 滚动训练,定期重训

过拟合排查清单

  • 训练集、验证集、样本外集三段绩效对比 - 参数扰动测试,观察稳定性 - 特征重要性逻辑检查 - 排查未来信息泄露场景 - 实盘先减半仓,滚动观察

⚠️ 风险提示:本书内容仅为量化研究与知识分享,不构成任何投资建议。套利交易存在基差、费率、流动性、平台与极端行情等风险,历史表现不代表未来收益。投资有风险,入市需谨慎,请自主决策、量力而行。

💡 键盘 ←/→ 翻章 · T 键切换目录