高频时序预测研究 Idea 周报 2026-W34
周报归档周期 2026-08-17 至 2026-08-23;本次 demo 允许近三年研究启发,实际采集窗口为 2021-08-18 至 2026-08-23。页面按研究类别组织,使用 LLM 或人工 notes 提取文章自身的摘要、亮点、背景、逻辑、方法、数据和结果;没有依据的字段不展示。项目相关迁移只放在“研究启发/管线落点”里,并特别标注高频数据特征工程对 OB/SF/sidecar/MLP/LGB/Linear/LLM 因子管线的可能增益。
历史周报导览
当前已归档 9 期周报,可直接回看过去每周的研究想法、数据源和候选条目。
原文读取与摘要质量
- 摘要可能缺少结果或结论说明:1 条
本周去重审计
历史重复内容已从主榜移除 26 条,改由常青资料库承接。 弱相关或泛方法内容已降级到观察池 13 条,不占用主榜名额。 离题内容已过滤 1 条,明细保留在 ranked_items.json 便于审计。
本周精选阅读清单
为保证每周有足够可读内容,本区按“本周新增主榜、观察池精选、历史高价值复盘、常青资料轮播”补足;主榜仍只代表严格新增 idea。
FlowLOB: Efficient and Controllable Limit Order Book Generation with Flow Matching
Hybrid Neural-Classical Correction for Frozen Time Series Foundation Models: A Comprehensive Ablation Study on High-Frequency Stock Prediction
Supervised Mixed-Frequency Learning for Macro-Financial Forecasting When Factors are Weak
Ensemble deep learning models for stock price forecasting: evidence from the Saudi markets
TradingMoE: Routing the Right Experts in Evolving Markets
Guosen Securities high-frequency order factor improvement via active buy-sell features
Chain-of-Alpha: LLM-based framework for automated formulaic alpha mining
FactorMAD: A Multi-Agent Debate Framework Based on Large Language Models for Interpretable Alpha Factor Mining
LLM-Driven Automated Robust Feature Engineering
AlphaAgent: LLM-Driven Alpha Mining with Regularized Exploration
Evolutionary Alpha Factor Discovery with Large Language Models for Sparse Portfolio Optimization
Automate Strategy Finding with LLM in Quant Investment
Comparative Analysis of LSTM, GRU, and Transformer Models for Stock Price Trend Prediction
LENS: Large Pre-trained Transformer for Exploring Financial Time Series
观察池
以下内容有一定金融/交易语境,但缺少订单簿、收益预测、因子、回测或市场微观结构等量化硬锚点;本期不进入主榜。完整观察池保留在 JSON 审计文件中。
| 分数 | 标题 | 降级原因 |
|---|---|---|
| 21 | STSGAT: a Spatio-Temporal Sentiment Graph Attention Network for stock volatility forecasting OpenAlex 金融时序模型专题 | 弱金融锚点,缺少订单簿/收益/因子等硬锚点 |
| 12 | Supervised Mixed-Frequency Learning for Macro-Financial Forecasting When Factors are Weak arXiv 高频时序预测 | 弱金融锚点,缺少订单簿/收益/因子等硬锚点 |
| 9 | Ensemble deep learning models for stock price forecasting: evidence from the Saudi markets OpenAlex 金融时序模型专题 | 弱金融锚点,缺少订单簿/收益/因子等硬锚点 |
| 9 | TradingMoE: Routing the Right Experts in Evolving Markets OpenAlex 金融时序模型专题 | 方法或泛金融相关,但缺少量化硬锚点 |
| 5 | Causal-Structure-Based Cryptocurrency Price Direction Prediction Model OpenAlex 金融时序模型专题 | 方法或泛金融相关,但缺少量化硬锚点 |
| 5 | BitMood: AI analysis of Bitcoin trends via Facebook emotions OpenAlex 金融时序模型专题 | 方法或泛金融相关,但缺少量化硬锚点 |
常青资料库
已在历史周报覆盖、但仍有长期参考价值的经典高频、LOB、模型和 LLM 因子资料。它们不再占用本周新增 idea 名额。
AI 辅助因子生成
AlphaAgent:带正则化探索的 LLM Alpha 挖掘以对抗 Alpha 衰减
Chain-of-Alpha:基于 LLM 的自动公式化 Alpha 挖掘框架
FactorMAD:基于 LLM 多智能体辩论的可解释 Alpha 因子挖掘
LLM 驱动的自动稳健特征工程
量化投资中的 LLM 自动策略发现
面向稀疏投资组合优化的 LLM 进化式 Alpha 因子发现
AlphaEval:面向公式型Alpha挖掘的全面高效评估框架
MAPLE:面向投资组合构建的高效多样化多Alpha生成框架
XALPHA:从假设到代码进行 Alpha 发现的记忆驱动型 AI 量化研究员
时序预测模型与 LOB
Deep Limit Order Book Forecasting:深度限价订单簿预测与 LOBFrame 基准
LENS:用于探索金融时序规律的大规模预训练 Transformer
LSTM、GRU 与 Transformer 在股票价格趋势预测中的比较分析
LiT:限价订单簿Transformer
TLOB:基于限价订单簿数据的双注意力 Transformer 股价趋势预测模型
基于 CNN 与 Transformer 的金融时间序列预测
订单簿表示与逐笔数据
基于注意力机制的限价订单簿阅读、突出与全簿预测
评估审计与风险控制
金融科技系统中的自适应风险评估:基于强化学习的连续策略优化
金融时序预测模型
从预测准确率到交易盈利能力:股票价格预测序列模型的评估
通过人工智能驱动的市场数据与情绪分析融合增强股票价格预测
高频数据特征工程
中信建投:市场微观结构系列研究,从分钟频到 Level2 的探索与发现
国信证券:高频订单成交数据蕴含的 Alpha 信息
国信金工:基于主动买卖特征的高频订单因子改进
开源证券:市场微观结构观察与2023年以来的高频因子回顾
挂单方向长期记忆性的讨论与应用
基于 TransXFormer 的出版传媒股票预测
高频订单流与微观结构
用于金融时间序列预测的分解增强网络 DENet
本周汇总导航
重点亮点
- 交易制度与市场结构:公开交易者身份:逆向选择与收益可预测性利用持久钱包地址直接度量交易者层面的逆向选择
- 交易制度与市场结构:FlowLOB:基于流匹配的高效可控限价订单簿生成在统一实验条件下直接比较流匹配与扩散的质量成本前沿
- 金融时序预测模型:冻结时序基础模型的神经—经典混合校正:高频股票预测的全面消融研究完全冻结 TimesFM,以黑盒式外部校正降低适配成本和过拟合风险
交易制度与市场结构
2 条 · 平均分 23.5公开交易者身份:逆向选择与收益可预测性
- 利用持久钱包地址直接度量交易者层面的逆向选择
- 基于170.1亿条消息重建全深度订单簿并覆盖843亿美元主动成交
- 以活动匹配的200组安慰剂群体区分身份信息与交易频率效应
- 发现身份信息在实际成交时点具有更强的增量预测力
本文研究一个反常于传统市场微观结构假设的制度环境:知情交易者通常依赖匿名性,将自己的交易隐藏在大量非知情订单之中,但某去中心化交易所会公开每笔委托的交易对手身份,并为委托提交、撤单、拒单和成交记录附加持久的匿名钱包地址。作者利用这一身份可追踪性,考察交易者历史上的价格影响是否具有稳定性,以及公开身份信息能否提供匿名订单簿之外的短周期价格信息。研究从170.1亿条消息重建全深度限价订单簿,识别147,113个钱包发起的1,430万笔主动订单,主动成交名义金额合计843亿美元。作者以主动订单发生后的价格变动衡量钱包的信息含量,并在相邻十日窗口中对钱包进行排序。结果显示,信息含量是较持久的钱包属性:相邻窗口的钱包排名相关系数达到0.52。进一步地,作者把实时最活跃、历史排名最高的钱包活动加入由价格、报价和订单流构成的标准匿名基准模型,一秒收益率的样本外R²提高至12.31%,相对增幅为13.2%,对应t值9.2;该提升还是200组活动强度匹配安慰剂钱包群体中最大提升的1.6倍,说明预测力并非仅由这些钱包交易更频繁造成。若将评估时点从规则采样的所有时刻改为实际成交时刻,身份信息带来的R²增量由1.43个百分点扩大至2.47个百分点。文章据此认为,持续钱包身份把交易者过去的价格影响与当前活动连接起来,揭示了匿名订单簿无法直接度量的逆向选择和短期价格信息。其证据边界在于结果来自公开持久身份的去中心化交易环境,能否推广到身份不可见、账户可频繁更换或交易制度不同的市场,仍需额外检验。
- 定位
- 评估审计 / 可比性候选
- 背景
- 传统理论认为知情交易者需要匿名性以隐藏其信息优势;公开且持久的钱包标识则提供了直接追踪交易者历史信息含量的独特市场环境。
- 逻辑
- 如果主动交易后的价格移动能够刻画交易者的信息含量,而且这种属性跨时间持续,那么历史高信息钱包的实时活动应当在匿名价格、报价与订单流之外提高短周期收益预测能力。活动匹配的安慰剂群体用于排除交易频率本身造成的伪预测力。
- 方法
- 从逐笔委托、撤单、拒单和成交消息重建全深度订单簿;按主动订单后的价格变化为钱包排序,检验相邻十日窗口的排名持续性;在匿名市场状态基准上加入高排名钱包的实时活动,比较一秒收益率样本外R²,并以200组活动匹配钱包群体实施安慰剂检验;同时比较规则采样时点与实际成交时点的增量预测力。
- 数据
- 某去中心化交易所的170.1亿条订单簿消息、1,430万笔主动订单、147,113个持久匿名钱包地址以及843亿美元主动成交名义金额。
- 结果
- 钱包信息含量在相邻十日窗口的排名相关系数为0.52。加入最高排名钱包的实时活动后,一秒收益率样本外R²达到12.31%,相对基准提高13.2%,t值为9.2,提升幅度为200组活动匹配安慰剂中最大值的1.6倍。在实际成交时点衡量时,R²增量由1.43个百分点扩大到2.47个百分点。
- 特征工程
- 可将持久交易者身份与主动买卖方向、成交后价格移动、历史信息含量排名、排名窗口稳定性及实时钱包活跃度组合为身份条件化订单流特征;成交时点上的信号增量更大,也提示应区分规则时间与事件时间。
- 研究启发
- 在具备稳定主体标识的数据中,可构造交易者身份 sidecar:保存滚动窗口内的主动买卖、成交后价格影响、信息含量分位数和实时活跃度,再与OB/SF状态按严格时间因果关系连接。MLP、LGB与Linear可分别检验非线性交互、排序阈值效应和线性增量解释力;LLM因子管线可围绕“高信息主体活动×订单不平衡×成交事件时间”生成候选表达式。身份缺失或可轻易轮换时应设置覆盖率、稳定性和伪身份安慰剂审计,避免把交易频率误判为信息优势。
- 管线落点
- 优先进入审计/评估方法库,服务 baseline 可比性和 SFT/BT 可信度;候选 routes: backtest_audit, data_processing_sidecar, llm_factor_pipeline。
- 可能增益
- 潜在增益在于减少不可比实验、泄露和过拟合带来的误判,让 SFT/BT 结论更可信。
FlowLOB:基于流匹配的高效可控限价订单簿生成
- 在统一实验条件下直接比较流匹配与扩散的质量成本前沿
- 通过tick相对表示和多标的联合训练实现留出股票零样本生成
- 将情景可控性定义为可检验的分布移动而非仅提供条件接口
- 仅用10次Euler步取得有竞争力的盘口生成质量
本文提出FlowLOB,目标是同时改善限价订单簿模拟器的真实性、采样效率、情景可控性和跨标的泛化能力。现有智能体模拟器较易解释和操控,却通常只能复现部分市场风格事实;GAN、自回归事件模型和扩散模型提高了真实性,但扩散采样需要反复调用网络,且许多模型按单一标的训练,对条件是否真正改变生成分布也缺少直接检验。FlowLOB采用条件流匹配生成订单簿轨迹,以约1亿参数的adaLN-Zero Transformer处理包含未来32个时点、买卖双方各十档价格和数量的窗口,并以近期盘口、日内时间、趋势、波动率、流动性和订单簿不平衡作为条件。价格不使用绝对货币单位,而被表示为相邻状态的中间价变动及档位间距,全部以tick计量;数量逐档作log(x+1)变换,以削弱不同价格水平、最小变动单位和规模造成的标的差异。模型在8只港交所股票上联合训练,分别处理0.1秒、1秒和10秒频率,并将9999.HK完全留出用于零样本测试。训练、验证和测试期依次为2025年9月1日至11月15日、11月16日至30日和12月。为公平比较流匹配与扩散,作者固定数据、网络、训练预算及ODE求解框架,并比较Euler、Heun和RK4在不同函数评估次数下的质量。FlowLOB在仅10次Euler步时达到最佳质量成本平衡;在六个价格或数量边际设置中的五个,其距离指标较匹配扩散采样器低4至120倍,扩散即使增加到200次函数评估通常仍不能追平。此后作者将该配置与两个学习式和两个智能体式基线比较,在较细的0.1秒和1秒频率上,多数分布指标更真实。对于趋势、波动率、流动性和盘口不平衡条件,论文用分布检验判断改变条件后生成统计量是否向真实尾部状态移动,FlowLOB在多数设置中通过,并在留出标的上保持真实性和控制效应。论文的边界是实验集中于港交所九只股票、固定十档盘口及三种规则采样频率,跨市场、事件级订单流和更广泛标的上的表现尚未由材料证明。
- 定位
- 数据坐标 / sidecar 候选
- 背景
- 历史市场对每个标的和交易日只提供一条实现路径,无法直接观察高波动、低流动性等反事实情景;回测、执行压力测试和强化学习因此需要兼具真实性、效率、可控性与跨标的泛化能力的订单簿模拟器。
- 逻辑
- 流匹配学习从简单分布到真实盘口轨迹的确定性传输,可用少量ODE步完成生成;tick相对价格和对数数量表示减少标的尺度差异,支持多标的共享训练;显式情景条件及尾部分布检验则使“可控”成为可测量属性,而不只是模型接口上的条件输入。
- 方法
- 使用约1亿参数的adaLN-Zero Transformer进行条件流匹配,生成32步、20档、价格与数量双通道的盘口窗口。条件包括历史盘口、日内时间、趋势、波动率、流动性和订单簿不平衡,并采用classifier-free guidance训练。作者在相同数据、架构、预算和固定步ODE求解器下对照扩散模型,扫描Euler、Heun、RK4及不同函数评估次数,随后与零智能体、复合Hawkes及两个学习式生成基线比较,并进行架构和学习率消融。
- 数据
- 港交所Level-2十档订单簿数据。训练标的为5、700、981、1024、1211、1299、1810和9618.HK,覆盖科技、金融、汽车和半导体行业;9999.HK完全留作零样本评估。采用0.1秒、1秒和10秒网格,完整保留09:30—12:00及13:00—16:00连续交易时段。训练期为2025-09-01至2025-11-15,验证期为11月16日至30日,测试使用2025年12月。
- 结果
- 流匹配在10次Euler函数评估时达到最佳质量成本前沿。相对同架构扩散模型,其价格和数量边际距离在六种设置中的五种低4至120倍;扩散增加到200次函数评估仍通常无法追平。FlowLOB在0.1秒和1秒频率的大多数分布指标上优于两个学习式和两个智能体式基线,在多数反事实条件检验中能使生成统计量向相应真实尾部状态移动,并将真实性和控制效应零样本迁移至9999.HK。
- 特征工程
- 文章的关键盘口表示包括tick尺度的中间价变化、相邻档位价差、逐档log(x+1)数量、十档深度轮廓、日内时间、趋势、波动率、流动性与订单簿不平衡。它强调以局部盘口几何和相对尺度替代绝对价格、数量,有助于跨标的共享表示;但材料未涉及逐笔主动买卖、队列位置或成交时长。
- 研究启发
- 可把FlowLOB的相对tick价格、档位间距、对数深度、流动性和订单不平衡表示作为OB/SF或盘口形态sidecar的标准化候选,并分别检验0.1秒、1秒和10秒坐标下的稳定性。生成数据若用于MLP、LGB、Linear或LLM因子筛选,应与真实数据严格分层,先审计边际分布、条件尾部响应和留出标的零样本表现,再评估下游增益;不能仅因生成器接受条件就认定反事实有效。模型比较应固定数据、架构、训练预算和函数评估次数,以避免把更大推理成本误当作方法优势。
- 管线落点
- 优先判断是否能成为 OB 1s exact-axis sidecar;候选 routes: llm_factor_pipeline。
- 可能增益
- 潜在增益在于提供 baseline 186 因子没有表达的状态变量,帮助筛出在特定微观结构状态下更可靠的短周期预测信号。
金融时序预测模型
1 条 · 平均分 20.0冻结时序基础模型的神经—经典混合校正:高频股票预测的全面消融研究
- 完全冻结 TimesFM,以黑盒式外部校正降低适配成本和过拟合风险
- 通过12种模型与消融变体分离注意力、门控、双线性投影和随机森林的贡献
- 随机森林残差学习贡献可匹配或超过神经校正,显示经典模型的重要互补作用
- GatedLinear+RF 以约九分之一的神经参数量取得最佳总体表现
时序基础模型虽然具备较强的零样本泛化能力,但在高频金融等统计特征特殊、噪声较强的领域中可能表现不佳。本文研究如何在完全冻结拥有约2亿参数的 TimesFM 的前提下,以轻量级外部模块校正其预测,用盘前信息预测开盘后一小时(9:30—10:30)的60个一分钟收益。研究动机是:开盘阶段集中消化隔夜信息、波动显著,而直接微调大型基础模型成本高,也容易在有限领域数据上过拟合;因此作者把 TimesFM 视为黑盒,在其输出上叠加神经校正和经典残差学习。神经部分比较两种设计:约47.1万参数的 AttnCorrect 使用两层、四头自注意力处理300分钟盘前序列,再融合 TimesFM 预测和多尺度统计特征;约4.9万参数的 GatedLinear 以低秩双线性投影压缩时间与特征维度,并通过逐预测步门控控制校正幅度。神经输出之后,使用包含250棵树、最大深度12的随机森林继续拟合剩余误差,形成神经—经典两阶段校正。输入包括标准化 OHLC、对数成交量、逐柱动量和柱内波动率,并构造5、15、30、60分钟尺度的收益、波动率、成交量及隔夜跳空等21维摘要特征。实验覆盖 NVDA、MSFT、AAPL、GOOG、GOOGL、AMZN、META、AVGO、TSLA 和 NFLX,自2024年12月至2026年1月约200万个一分钟数据点;大多数股票约有266个交易日,NFLX因数据可得性仅149日。作者设置历史均值、MLP、LSTM、BiLSTM 和冻结 TimesFM 等基线,并围绕随机森林、门控、双线性投影和自注意力设计12种模型与消融变体。评估同时报告日内相关系数的跨日均值、跨日累计相关和全样本池化相关,并辅以 MAE、RMSE,以避免单一汇总口径掩盖表现差异。完整混合方法相对冻结 TimesFM 将平均逐日相关提高6.4倍,池化相关达到0.597;随机森林残差学习是贡献最大的单一组件,其作用可匹配或超过神经校正。移除随机森林后,较简单的神经结构反而优于复杂结构,而自注意力是神经模块中贡献最大的部分。GatedLinear+RF 获得最佳总体表现,同时神经参数量约为 AttnCorrect+RF 的九分之一。结论强调,高频金融领域的基础模型适配并非结构越复杂越好,参数高效的神经校正与经典残差模型之间的互补更为关键。结果边界在于实验仅覆盖十只大型科技股、特定时期及开盘一小时,并以预测误差和相关性而非交易成本后的收益评价。
- 定位
- 模型训练 / 融合候选
- 背景
- 通用时序基础模型在标准预测任务中具有较好的零样本泛化能力,但高频金融序列具有噪声强、分布变化快和开盘阶段波动集中的特点。直接微调大型基础模型计算成本较高,也可能因领域样本有限而过拟合,因此本文考察冻结基础模型后的外部校正策略。
- 逻辑
- 先由冻结 TimesFM 给出60分钟基础预测,再利用盘前300分钟序列、多尺度统计量及基础预测生成神经校正,最后由随机森林拟合神经校正后仍未解释的残差。通过逐项移除随机森林、注意力、门控和双线性投影,识别总体提升究竟来自复杂神经结构还是经典残差学习。
- 方法
- AttnCorrect 将7维盘前特征映射至128维,经过两层四头自注意力和前馈网络,池化后与单独编码的 TimesFM 预测、21维多尺度特征融合,输出60步校正。GatedLinear 使用时间投影矩阵和特征投影矩阵把300×7输入压缩为8×4表示,再经两层 MLP 和逐步门控产生校正。训练采用含 MSE、方向项和累计项的组合损失、AdamW、早停、梯度裁剪和固定随机种子;随后以250棵树、最大深度12、叶节点最少3个样本的随机森林学习剩余误差。
- 数据
- 使用2024年12月至2026年1月的十只大型科技股一分钟数据,共约200万个数据点。每个样本包含盘前4:30—9:29的300根一分钟柱,并预测9:30—10:30的60步收益。原始特征为标准化 OHLC、对数成交量、逐柱动量和柱内波动率;另有基于5、15、30、60分钟窗口的收益、波动率、成交量及隔夜跳空等21维摘要特征。大多数股票约266个交易日,NFLX为149日。
- 结果
- 冻结 TimesFM 的平均逐日相关约为0.059。完整神经—经典混合方案取得0.597的池化相关,平均逐日相关相对基础模型提高6.4倍。随机森林残差学习是最大的单组件贡献来源,可匹配或超过神经校正;移除随机森林时,简单神经结构优于复杂结构。自注意力提供最大的纯神经贡献。GatedLinear+RF 获得最佳总体表现,其神经参数约4.9万,仅为约47.1万参数 AttnCorrect+RF 的九分之一。
- 特征工程
- 文章的特征工程重点不是完整盘口队列,而是从一分钟盘前序列中提取价格、成交量和波动状态:标准化 OHLC 保留相对价格形态,对数成交量缓解重尾,逐柱动量表达短期方向,柱内波动率刻画局部振幅;5、15、30、60分钟多尺度收益、波动率与成交量结合隔夜跳空,用于同时描述近期冲击和较长盘前状态。其启发是将高频原始序列与多尺度摘要并行编码,并以严格训练期统计量完成归一化;订单不平衡、主动买卖、微价格、队列状态和价格层记忆并非本文实际使用的特征。
- 研究启发
- 可在 OB/SF 或 sidecar 数据层分别构造订单不平衡、主动买卖、微价格、队列状态、价格层记忆及事件时间的原始序列与多尺度摘要,再把现有 MLP、LGB、Linear 或 LLM 因子模型的输出视为冻结基线,检验轻量神经校正与树模型残差校正的增量贡献。实验上应保留 Linear/Ridge 与单独 LGB/RF 残差模型,逐项消融注意力、门控、序列压缩和经典校正,并同时报告逐日、跨日累计及池化相关,避免只凭单一相关口径判断改进。本文证据仅支持“外部混合校正可能有效”,不能直接证明其在盘口级输入、其他股票池或交易成本后的收益上仍然成立。
- 管线落点
- 优先作为 MLP/LGB/Linear 的训练或融合实验,不直接改变因子数据;候选 routes: mlp_codeX, linear_codeX。
- 可能增益
- 潜在增益在于提升多 horizon 序列预测稳定性,或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。
高分来源条目
| # | 分数 | 标题 | 日期 | 研究轴 | 管线落点 |
|---|---|---|---|---|---|
| 1 | 25 | 公开交易者身份:逆向选择与收益可预测性 OpenAlex LOB and Market Microstructure | 2026-08-05 | 数据坐标 / 高频状态, 评估审计 / 可比性 | 回测与可比性审计, 数据 sidecar / 高频衍生数据, LLM 因子生成 |
| 2 | 22 | FlowLOB:基于流匹配的高效可控限价订单簿生成 arXiv HFT Time-Series Forecasting | 2026-08-13 | 数据坐标 / 高频状态, 评估审计 / 可比性, 因子生成 / 表示学习 | LLM 因子生成 |
| 3 | 20 | 冻结时序基础模型的神经—经典混合校正:高频股票预测的全面消融研究 OpenAlex Financial Time-Series Models | 2026-08-09 | 模型训练 / 序列预测, 评估审计 / 可比性 | MLP 时序预测, Linear/Ridge baseline |
本次采集状态
| 数据源 | 状态 | 条目 | 说明 |
|---|---|---|---|
china_broker_microstructure_curated | ok | 5 | |
model_timeseries_curated | ok | 7 | |
ai_factor_method_curated | ok | 6 | |
arxiv_hft_timeseries | ok | 4 | https://export.arxiv.org/api/query |
openalex_hft_semantic | ok | 0 | https://api.openalex.org/works |
openalex_lob_microstructure | ok | 1 | https://api.openalex.org/works |
openalex_financial_timeseries_models | ok | 12 | https://api.openalex.org/works |
openalex_ai_factor_generation | ok | 8 | https://api.openalex.org/works |
semantic_scholar_hft | ok | 0 | https://api.semanticscholar.org/graph/v1/paper/search |
数据源清单
| 数据源 | 状态 | 抓取方式 | 优先级 | 主题 |
|---|---|---|---|---|
china_broker_microstructure_curated中文券商高频与市场微观结构精选 | 启用 | curated_seed | high | china_a_share, market_microstructure, level2, order_flow, tick_data, high_frequency_feature_engineering, order_imbalance, microprice, active_buy_sell, broker_research |
model_timeseries_curated模型与金融时序预测精选 | 启用 | curated_seed | high | mlp, gru, lstm, transformer, cnn, tcn, limit_order_book, financial_time_series, high_frequency_feature_engineering, multi_horizon_forecasting |
ai_factor_method_curatedAI 辅助因子生成与回测方法精选 | 启用 | curated_seed | high | llm_factor_generation, alpha_mining, feature_engineering, multi_agent, backtest_feedback, factor_evolution |
arxiv_hft_timeseriesarXiv 高频时序预测 | 启用 | arxiv_api | high | time_series_prediction, market_microstructure, limit_order_book, deep_learning, gru, mlp, transformer, llm_factor_generation |
openalex_hft_semanticOpenAlex 语义论文检索 | 启用 | openalex_api | high | semantic_search, market_microstructure, time_series_prediction, model_training, high_frequency_feature_engineering, alpha_factor_generation |
openalex_lob_microstructureOpenAlex 订单簿与微观结构专题 | 启用 | openalex_api | high | limit_order_book, market_microstructure, order_flow, tick_data, queue_imbalance, microprice, high_frequency_feature_engineering |
openalex_financial_timeseries_modelsOpenAlex 金融时序模型专题 | 启用 | openalex_api | high | financial_time_series, mlp, gru, lstm, transformer, tcn, multi_horizon_forecasting |
openalex_ai_factor_generationOpenAlex AI 因子生成专题 | 启用 | openalex_api | high | llm_factor_generation, alpha_mining, automated_feature_engineering, backtest_feedback, agentic_research |
semantic_scholar_hftSemantic Scholar 相关论文 | 启用 | semantic_scholar_api | medium | citation_graph, related_papers, impact |
crossref_finance_metadataCrossref 金融论文元数据补全 | 观察 | crossref_api | medium | doi_metadata, dedupe, publication_metadata |
nber_working_papersNBER Working Papers | 观察 | rss | low | market_structure, macro_context, empirical_finance |
hkex_market_rss港交所市场沟通 RSS | 观察 | rss | low | exchange_rules, market_structure, trading_mechanism |
kysec_jianrong_quant_manual开源证券/建榕量化研究人工检索 | 观察 | manual_web_search | high | market_microstructure, order_flow, tick_data, china_a_share |
guosen_financial_engineering_manual国信证券金融工程人工检索 | 观察 | manual_web_search | high | tick_data, order_trade, active_buy_sell, broker_research |
csc_microstructure_wechat_manual中信建投市场微观结构人工检索 | 观察 | manual_web_search | high | level2, minute_frequency, market_microstructure, factor_mining |
citics_research_portal_manual中信证券研究门户人工检索 | 观察 | manual_web_search | medium | financial_engineering, market_structure, china_a_share |
gf_financial_engineering_official_manual广发证券金融工程人工检索 | 观察 | manual_web_search | medium | algorithmic_trading, quant_factor, event_driven, market_structure |
qiml_wechat_manual量化投资与机器学习公众号人工检索 | 观察 | manual_web_search | medium | quant_media, machine_learning, industry_context |
quantsplaybook_replication_github券商金工研报复现代码库 | 观察 | manual_web_search | medium | broker_research_replication, factor_research, code_review |
sse_official_page上交所官方页面 watcher | 观察 | official_page | medium | exchange_rules, market_structure, china_a_share |
szse_cninfo_api_manual深交所/巨潮数据服务人工源 | 观察 | manual_web_search | medium | china_a_share, exchange_disclosure, official_data_api |
ssrn_manual_searchSSRN 人工检索 | 观察 | manual_web_search | medium | working_papers, market_microstructure, empirical_finance |