把 RAG 放进量化研究工作流
从策略检索、复盘到反思:一个本地知识库如何成为研究员的第二大脑,以及最容易被忽略的约束。
RAGAgent量化研究知识库
量化团队积累的策略报告、回测记录和会议纪要通常散落在不同位置。RAG 的价值不只是“问文档”,而是把历史证据带回当前决策。
一个可用的最小闭环
我理解的最小可用闭环是:
- 统一文档结构:标题、时间、标的、结论、风险与版本
- 按研究问题检索:不是按文件名找,而是按问题找证据
- 要求模型标注来源:回答必须能回到材料
- 保留人工裁决:最终判断仍由研究者负责
多智能体架构可以分别承担检索、质疑和总结,但每个角色都必须共享可追溯的事实来源。否则“分工”只会放大流畅的幻觉。
本地部署为什么重要
在研究场景里,本地模型并不只是成本问题,更关系到:
- 策略和研究资料的敏感性
- 迭代实验时的可控性
- 对提示词、切分和召回策略的细粒度调试
DeepSeek + LangChain 的组合,对我来说更像实验台,而不是一个封装好的黑盒产品。
最容易被忽略的部分
金融知识会快速过期。索引需要版本管理,回测结论也必须附带样本区间、交易成本和失效条件。没有这些约束,流畅的回答反而更危险。
我现在会默认检查:
- 这条结论来自哪个时间段
- 它是否已经在后续样本中失效
- 检索到的材料是否被断章取义
- 模型是否在补全“听起来合理”但并未被记录的细节
第二大脑的真正意义
如果 RAG 只是让人更快得到一段话,那它的价值有限;如果它能让研究团队更快回到证据、比较历史判断、发现前后矛盾,它才真正进入工作流。
研究 Agent 的目标不该是替代研究员,而是减少重复劳动,把注意力还给真正困难的问题:假设、边界与责任。