← 返回博客

把 RAG 放进量化研究工作流

从策略检索、复盘到反思:一个本地知识库如何成为研究员的第二大脑,以及最容易被忽略的约束。

RAGAgent量化研究知识库

量化团队积累的策略报告、回测记录和会议纪要通常散落在不同位置。RAG 的价值不只是“问文档”,而是把历史证据带回当前决策。

一个可用的最小闭环

我理解的最小可用闭环是:

  1. 统一文档结构:标题、时间、标的、结论、风险与版本
  2. 按研究问题检索:不是按文件名找,而是按问题找证据
  3. 要求模型标注来源:回答必须能回到材料
  4. 保留人工裁决:最终判断仍由研究者负责

多智能体架构可以分别承担检索、质疑和总结,但每个角色都必须共享可追溯的事实来源。否则“分工”只会放大流畅的幻觉。

本地部署为什么重要

在研究场景里,本地模型并不只是成本问题,更关系到:

  • 策略和研究资料的敏感性
  • 迭代实验时的可控性
  • 对提示词、切分和召回策略的细粒度调试

DeepSeek + LangChain 的组合,对我来说更像实验台,而不是一个封装好的黑盒产品。

最容易被忽略的部分

金融知识会快速过期。索引需要版本管理,回测结论也必须附带样本区间、交易成本和失效条件。没有这些约束,流畅的回答反而更危险。

我现在会默认检查:

  • 这条结论来自哪个时间段
  • 它是否已经在后续样本中失效
  • 检索到的材料是否被断章取义
  • 模型是否在补全“听起来合理”但并未被记录的细节

第二大脑的真正意义

如果 RAG 只是让人更快得到一段话,那它的价值有限;如果它能让研究团队更快回到证据、比较历史判断、发现前后矛盾,它才真正进入工作流。

研究 Agent 的目标不该是替代研究员,而是减少重复劳动,把注意力还给真正困难的问题:假设、边界与责任。