← 返回博客

从订单簿到因子:微观结构研究笔记

面对毫秒级行情,如何把交易行为还原为可以验证、可以解释、可以复用的因子假设。

订单簿因子高频数据微观结构

高频数据的难点从来不只是数据量。字段定义、时间对齐、撮合规则和异常值处理中的一个小偏差,都可能制造漂亮但不可交易的信号。

我在订单簿相关研究里,越来越相信一句很朴素的话:

先解释,再组合。

字段要连回行为

我更愿意先把每个字段连接到一种可能的交易行为:

  • 主动买入是否持续
  • 盘口是否被快速消耗或补充
  • 订单撤销是否在某类价位集中出现
  • 短时流动性是在改善还是在撤离

只有当解释能够站住脚,才进入算子组合、遗传优化和更大规模的搜索。自动化因子挖掘提高了效率,但它不能替代对市场机制的理解。

一个可复用的研究分层

比较稳妥的结构通常是:

  1. 原始行情层:成交、委托、撤单与时间戳
  2. 微观结构字段层:把行为压缩成可计算特征
  3. 因子假设层:明确这个因子想捕捉什么
  4. 验证层:回测、稳健性、容量与成本

很多失败并不是模型不够复杂,而是第二层和第三层之间断了:字段存在,却说不清它为什么应该有预测力。

自动化之后,人还做什么

半自动搜索能快速给出候选,但样本外稳定性、换手、冲击成本和制度约束,仍然需要人工把关。我会把“能搜到”和“值得留下”分开看。

如果一个因子不能被讲成一种可理解的市场行为,哪怕回测曲线很好看,我也倾向先降权。因为无法解释的东西,通常也更难维护、更难迁移、更难在环境变化后及时发现失效。