PROJECTS / LAB02
把想法变成
可以运行的实验。
这里收录研究项目、工程原型与仍在持续推进的长期问题。每个项目尽量保留问题、方法、技术栈与可复用产出。
6个代表项目
03段行业实践相关
Quant × AI主线方向
01行业实践 · 2026
Order Book Factor Lab
从毫秒级高频数据还原订单簿与交易行为,构建微观结构字段并自动搜索可解释因子。
问题
高频研究里最容易丢的不是算力,而是字段定义、时间对齐与“这个信号到底对应什么交易行为”的解释。
方法
先建立可复用的微观结构字段层,再进入算子组合与半自动搜索,最后用回测和人工审查共同把关。
- 构建数百个盘口、成交、撤单与短时流动性相关字段。
- 使用算子库和遗传优化进行因子组合,提高搜索效率。
- 建立从信号挖掘到历史回测的半自动流程,保留人工解释环节。
STACKPythonOrder BookGenetic AlgorithmBacktest
IMPACT把“原始行情 → 可解释字段 → 候选因子 → 回测验证”串成可重复的研究链路。
QuantOrder BookGenetic Algorithm
02行业实践 · 2025
Quant RAG Workbench
面向历史策略、回测记录和研究文档的本地知识库,让检索、复盘与反思进入同一研究闭环。
问题
策略报告、回测记录和会议纪要往往散落各处,研究员很难在当下决策中快速召回历史证据。
方法
本地部署大模型,用统一文档结构与多智能体角色完成检索、质疑和总结。
- 本地部署 DeepSeek 系列模型,降低研究资料外泄与调用成本。
- 基于 LangChain 设计多智能体协同架构,区分检索、质疑与汇总职责。
- 通过 RAG 为研究结论补充可追溯上下文,并强调时间与版本约束。
STACKDeepSeekLangChainRAGKnowledge Base
IMPACT让研究回答不只“流畅”,还尽量回到可核对的历史材料与结论边界。
DeepSeekLangChainRAG
03行业实践 · 2024
Multi-factor Alpha Research
围绕价差、买卖力量和市场情绪构建多因子模型,并系统评估信号有效性与风险边界。
问题
单因子故事很容易讲圆,但横截面有效性、相关性和衰减速度往往决定它是否值得进入组合。
方法
从因子设计、IC/IR 评估到组合与风险检查,形成可复盘的多因子研究框架。
- 设计多类价格、力量与情绪因子,明确每个因子试图捕捉的市场行为。
- 使用 IC / IR 完成横截面有效性评估,并观察稳定性与衰减。
- 研究动态因子权重与统计套利组合,补充基础风险讨论。
STACKFactor ResearchIC / IRPortfolioRisk
IMPACT把因子从“单个想法”推进为可比较、可组合、可复核的研究资产。
FactorIC / IRBacktest
04学术项目 · 2024
FOMC × FinBERT
采集 FOMC 会议纪要,使用金融语言模型量化文本情绪,研究其与标普 500 表现的联系。
问题
宏观文本包含丰富信息,但“情绪分数”若缺少时间切分与稳健性讨论,很容易被误读成交易信号。
方法
打通采集、清洗、情绪提取与相关性分析,并明确相关不等于因果。
- 使用 Scrapy 构建分布式采集流程,沉淀会议文本语料。
- 结合 NLTK 清洗和标准化金融文本,减少噪声与格式差异。
- 使用 FinBERT 提取情绪并进行季度相关性分析,强调解释边界。
STACKScrapyNLTKFinBERTS&P 500
IMPACT完成一次从非结构化宏观文本到可分析特征的完整研究路径。
ScrapyFinBERTS&P 500
05数据项目 · 2023
Steam Data Mining
构建游戏平台数据采集和分析流程,从玩家行为与产品数据中识别偏好和市场趋势。
问题
动态页面、大规模采集与多维行为数据,要求同时处理工程稳定性与分析可解释性。
方法
用 Selenium 与 Hadoop 支撑采集效率,再进入偏好、特征与趋势分析。
- 结合 Selenium 处理网页动态加载,提高采集覆盖面。
- 使用 Hadoop 提升分布式采集与处理效率。
- 分析玩家偏好、游戏特征与市场变化,输出结构化洞察。
STACKPythonSeleniumHadoopData Mining
IMPACT锻炼了从采集工程到分析表达的完整数据项目能力。
PythonSeleniumHadoop
06竞赛项目 · 2022
Standard Question Classifier
结合自然语言处理与文本相似度算法,将用户问题匹配到标准问并返回对应答案。
问题
真实用户提问表达多样,关键是把自由文本稳定映射到标准问与答案库。
方法
完成清洗、表示、相似度匹配与答案返回,并在任务中验证准确率。
- 完成语料清洗、文本表示与相似度匹配。
- 构建标准问预测和答案返回流程。
- 在任务中取得约 90% 准确率,并获得 Kaggle 任务第三名。
STACKNLPSimilarityText Matching
IMPACT验证了自己在短周期内完成文本匹配任务建模与优化的能力。
NLPSimilarityKaggle
OPEN PROCESS项目会继续变厚。
后续仍会补充更多背景、失败案例、指标讨论与复盘。公开内容会优先保留可迁移的方法,而不是无法核验的夸张结论。
COLLABORATE对某个方向感兴趣?
欢迎交流研究问题、实习机会,或一起把原型推进成更完整的工作流。