← 返回博客

FOMC 会议纪要、FinBERT 与标普 500

一次金融文本研究的完整路径:采集、清洗、情绪量化、相关性分析,以及为什么相关不等于交易信号。

FinBERTFOMCNLP宏观文本

宏观文本并不直接等于交易信号。但会议纪要、讲话和声明里,确实沉淀着政策态度、风险偏好与市场叙事的变化。这次研究想回答的问题很具体:

如果把 FOMC 会议纪要转成可计算的情绪特征,它与标普 500 的季度表现之间,会出现怎样的统计联系?

研究路径

完整流程大致分成四步:

  1. 采集:用 Scrapy 构建分布式采集流程,沉淀会议纪要文本。
  2. 清洗:结合 NLTK 做标准化处理,减少格式噪声、重复段落和无关符号。
  3. 表征:使用 FinBERT 提取金融文本情绪特征。
  4. 对照:将情绪特征与标普 500 的季度表现进行相关性分析。

这条路径的价值,不只是得到一个情绪分数,而是打通“非结构化宏观文本 → 可分析特征”的研究链路。

相关不等于因果

会议纪要往往是对已发生经济环境的滞后描述,市场也可能提前定价。因此,即使统计上出现相关,也更适合帮助解释市场状态,而不是单独驱动交易。

我会特别警惕几类误读:

  • 把同期相关直接写成预测能力
  • 忽略文本发布时点与行情时点的错位
  • 在小样本季度数据上讲过强故事
  • 不讨论制度变化、风险事件与样本外稳定性

严谨的时间切分、滞后结构与稳健性检验,是这类研究可信度的核心。

我学到的方法原则

金融 NLP 最容易让人兴奋的地方,是模型终于“读懂”了文本;最需要克制的地方,也恰恰在这里。文本特征可以成为研究的一部分,但通常要与宏观状态、市场制度和价格行为放在同一张桌子上讨论。

如果以后继续做这类题目,我会更强调三件事:

  • 文本时间戳与可交易时点的对齐
  • 情绪特征的可解释拆解,而不是只看综合分数
  • 把“不能做什么”和“能做什么”写得一样清楚