# 高频时序预测研究 Idea 周报 2026-W34

- 周期: `2026-08-17` 至 `2026-08-23`
- 生成时间: `2026-08-18T10:52:28+00:00`
- source registry version: `2026-08-05.v7`
- 来源条目: `43`
- 候选想法: `10`

## 本周结论

本周候选只代表研究启发，不代表可直接上线。每篇文章由 LLM 或人工 notes 尽量总结文章自身的背景、逻辑、方法、数据和结果；没有依据的字段留空，不再硬写固定模板。项目相关迁移只放在“研究启发/管线落点”里，不混入文章摘要。本轮特别关注高频数据特征工程，优先识别能转化为订单流、盘口形态、价格层记忆、事件时间、主动买卖和 sidecar 字段的想法。

## 本周汇总导航

本周共 `10` 条候选 idea，分布在 `5` 个板块。
证据分布: 已读来源摘要 10。
摘要质量: {'medium': 10}；摘要长度中位数 `394.5` 字；有提示的条目 `0` 条。

### 本周去重审计

- 高分候选: `35`
- 主榜新增: `10`
- 补充池入选: `0`
- 观察池补正文: `6`
- 观察池候选: `7`
- 历史重复过滤: `25`
- 同周重复过滤: `0`
- 离题过滤: `1`
- 精选阅读: `15` / `15`
- 上周重合: `0`

- **AI 辅助因子生成**：1 条
  - TradingMoE：在演化市场中路由合适的交易专家：启发重点是把外部研究机制转成 LLM factor prompt、静态分析规则或 idea taxonomy。
- **交易制度与市场结构**：2 条
  - 公开交易者身份：逆向选择与收益可预测性：启发重点是补强 baseline regime、OOS、交易成本、样本选择和风险事件识别，降低研究结论被实验口径污染的概率。
  - FlowLOB：基于流匹配的高效可控限价订单簿生成：启发重点是把原始 OB/SF 重新组织成新的状态坐标，例如订单流方向、价格层记忆、成交路径或市场拥挤度，而不是只增加普通 rolling 统计。
- **其他研究背景**：1 条
  - 弱因子条件下的监督式混频宏观金融预测：启发重点是把外部研究机制转成 LLM factor prompt、静态分析规则或 idea taxonomy。
- **时序模型训练与融合**：1 条
  - 深度学习集成用于股票价格预测：来自沙特市场的证据：启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。
- **金融时序预测模型**：5 条
  - STSGAT：用于股票波动率预测的时空情绪图注意力网络：启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。
  - 冻结时序基础模型的神经—经典混合校正：高频股票预测的全面消融研究：启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。
  - 金融时序 LSTM 的横截面异质性建模：启发重点是把原始 OB/SF 重新组织成新的状态坐标，例如订单流方向、价格层记忆、成交路径或市场拥挤度，而不是只增加普通 rolling 统计。

### 重点亮点

- **交易制度与市场结构** / 公开交易者身份：逆向选择与收益可预测性：启发重点是补强 baseline regime、OOS、交易成本、样本选择和风险事件识别，降低研究结论被实验口径污染的概率。
- **交易制度与市场结构** / FlowLOB：基于流匹配的高效可控限价订单簿生成：启发重点是把原始 OB/SF 重新组织成新的状态坐标，例如订单流方向、价格层记忆、成交路径或市场拥挤度，而不是只增加普通 rolling 统计。
- **金融时序预测模型** / STSGAT：用于股票波动率预测的时空情绪图注意力网络：启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。
- **金融时序预测模型** / 冻结时序基础模型的神经—经典混合校正：高频股票预测的全面消融研究：启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。
- **其他研究背景** / 弱因子条件下的监督式混频宏观金融预测：启发重点是把外部研究机制转成 LLM factor prompt、静态分析规则或 idea taxonomy。

## 本周精选阅读清单

为保证每周有足够可读内容，本区按“本周新增主榜、观察池精选、历史高价值复盘、常青资料轮播”补足；主榜仍只代表严格新增 idea。

1. **本周新增主榜** `25` [Public Trader Identity: Adverse Selection and Return Predictability](https://openalex.org/W7202006892)；本周新增且通过强量化相关性门槛
2. **本周新增主榜** `22` [FlowLOB: Efficient and Controllable Limit Order Book Generation with Flow Matching](http://arxiv.org/abs/2608.13096v1)；本周新增且通过强量化相关性门槛
3. **本周新增主榜** `20` [Hybrid Neural-Classical Correction for Frozen Time Series Foundation Models: A Comprehensive Ablation Study on High-Frequency Stock Prediction](https://doi.org/10.48550/arxiv.2608.08825)；本周新增且通过强量化相关性门槛
4. **本周新增主榜** `9` [Cross-Sectional Heterogeneity in LSTM Networks for Financial Time Series](https://openalex.org/W7202005981)；本周新增且通过强量化相关性门槛
5. **本周新增主榜** `21` [STSGAT: a Spatio-Temporal Sentiment Graph Attention Network for stock volatility forecasting](https://doi.org/10.54254/2977-3903/2026.35794)；主榜不足 10 篇，从观察池补充：弱金融锚点，缺少订单簿/收益/因子等硬锚点
6. **本周新增主榜** `12` [Supervised Mixed-Frequency Learning for Macro-Financial Forecasting When Factors are Weak](http://arxiv.org/abs/2608.12589v1)；主榜不足 10 篇，从观察池补充：弱金融锚点，缺少订单簿/收益/因子等硬锚点
7. **本周新增主榜** `9` [Ensemble deep learning models for stock price forecasting: evidence from the Saudi markets](https://doi.org/10.7717/peerj-cs.4064)；主榜不足 10 篇，从观察池补充：弱金融锚点，缺少订单簿/收益/因子等硬锚点
8. **本周新增主榜** `9` [TradingMoE: Routing the Right Experts in Evolving Markets](https://doi.org/10.48550/arxiv.2608.11785)；主榜不足 10 篇，从观察池补充：方法或泛金融相关，但缺少量化硬锚点
9. **本周新增主榜** `5` [BitMood: AI analysis of Bitcoin trends via Facebook emotions](https://doi.org/10.1007/s42521-026-00205-3)；主榜不足 10 篇，从观察池补充：方法或泛金融相关，但缺少量化硬锚点
10. **本周新增主榜** `5` [Causal-Structure-Based Cryptocurrency Price Direction Prediction Model](https://doi.org/10.3390/forecast8040058)；主榜不足 10 篇，从观察池补充：方法或泛金融相关，但缺少量化硬锚点
11. **历史高价值复盘** `27` [Guosen Securities high-frequency order factor improvement via active buy-sell features](https://finance.sina.com.cn/roll/2024-08-20/doc-inckfzcs5651129.shtml)；历史周报已收录，移入常青资料
12. **历史高价值复盘** `21` [Chain-of-Alpha: LLM-based framework for automated formulaic alpha mining](https://www.researchgate.net/publication/394426875_Chain-of-Alpha_Unleashing_the_Power_of_Large_Language_Models_for_Alpha_Mining_in_Quantitative_Trading)；历史周报已收录，移入常青资料
13. **历史高价值复盘** `20` [FactorMAD: A Multi-Agent Debate Framework Based on Large Language Models for Interpretable Alpha Factor Mining](https://dl.acm.org/doi/10.1145/3768292.3770377)；历史周报已收录，移入常青资料
14. **历史高价值复盘** `20` [LLM-Driven Automated Robust Feature Engineering](https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5124841)；历史周报已收录，移入常青资料
15. **历史高价值复盘** `19` [AlphaAgent: LLM-Driven Alpha Mining with Regularized Exploration](https://arxiv.org/abs/2502.16789)；历史周报已收录，移入常青资料

## 按类别整理的候选想法

## AI 辅助因子生成

### IDEA-2026-W34-19244954 — TradingMoE：在演化市场中路由合适的交易专家

- 优先级: `medium`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.48550/arxiv.2608.11785
- 原题: TradingMoE: Routing the Right Experts in Evolving Markets
- 研究轴: 因子生成 / 表示学习
- 管线落点: Linear/Ridge baseline, LLM 因子生成
- 角色: `因子生成 / prompt 候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `398` 字

文章摘要: 本文研究大语言模型参与金融分析和交易决策时，如何在市场状态变化下选择更合适的专家。作者指出，现有LLM交易系统要么协调人工预设的外部专家，要么采用普通Mixture-of-Experts路由器；后者的路由分数未必反映某个专家对实际交易决策的边际贡献，也缺少信号提示未被激活的专家何时变得更有用。方法上，TradingMoE把专家选择与决策贡献联系起来，依据不同资产、任务字段和市场环境对专家进行动态路由，并针对市场演化设计使路由器能重新评估专家有效性的机制。数据和实验围绕金融分析或交易任务，比较该路由方式与固定专家组合及传统内部MoE路由。结果表明，原生路由分数与专家带来的交易改善并不总是一致，而贡献感知的动态选择在变化市场中能够提高决策质量和适应性。文章亮点是把“选哪个专家”从表示空间中的概率问题转为与下游交易贡献相关的评价问题；边界是专家质量、任务标签和交易回测设定会决定结论能否成立。

研究启发: 启发重点是把外部研究机制转成 LLM factor prompt、静态分析规则或 idea taxonomy。

管线落点: 可作为 LLM prompt、taxonomy 或人工研究背景；候选 routes: linear_codeX, llm_factor_pipeline。

可能增益: 潜在增益待人工确认，当前不建议直接进入训练或回测。

## 交易制度与市场结构

### IDEA-2026-W34-cb27c5a5 — 公开交易者身份：逆向选择与收益可预测性

- 优先级: `high`
- 状态: `candidate`
- 来源: OpenAlex LOB and Market Microstructure
- 链接: https://openalex.org/W7202006892
- 原题: Public Trader Identity: Adverse Selection and Return Predictability
- 研究轴: 数据坐标 / 高频状态, 评估审计 / 可比性
- 管线落点: 回测与可比性审计, 数据 sidecar / 高频衍生数据, LLM 因子生成
- 角色: `评估审计 / 可比性候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `426` 字

文章摘要: 本文研究一个公开持久匿名身份的去中心化交易环境，检验交易者历史上的价格影响是否能够预测其后续交易的信息含量。研究动机是传统微观结构理论通常假定知情交易者依赖匿名性，而链上式钱包标识使研究者可以把同一主体过去的主动交易与当前活动连接起来。方法上，作者由170.1亿条委托、撤单、拒单和成交消息重建全深度订单簿，识别147,113个钱包发起的1,430万笔主动订单，并按成交后的价格移动对钱包排序；再把历史高信息钱包的实时活动加入价格、报价和订单流基准模型，并用200组交易活跃度匹配的钱包作安慰剂检验。数据覆盖843亿美元主动成交名义金额。结果显示，相邻十日窗口的钱包信息含量排序相关系数为0.52；加入高排名钱包活动后，一秒收益率样本外R²达到12.31%，相对基准提高13.2%，在实际成交时点的增量又由1.43个百分点扩大至2.47个百分点。文章的亮点是直接观察交易者层面的逆向选择，而边界是公开且稳定的钱包身份并不等同于一般证券市场的账户可见性。

研究启发: 启发重点是补强 baseline regime、OOS、交易成本、样本选择和风险事件识别，降低研究结论被实验口径污染的概率。

管线落点: 优先进入审计/评估方法库，服务 baseline 可比性和 SFT/BT 可信度；候选 routes: backtest_audit, data_processing_sidecar, llm_factor_pipeline。

可能增益: 潜在增益在于减少不可比实验、泄露和过拟合带来的误判，让 SFT/BT 结论更可信。

### IDEA-2026-W34-129a79ca — FlowLOB：基于流匹配的高效可控限价订单簿生成

- 优先级: `high`
- 状态: `candidate`
- 来源: arXiv HFT Time-Series Forecasting
- 链接: http://arxiv.org/abs/2608.13096v1
- 原题: FlowLOB: Efficient and Controllable Limit Order Book Generation with Flow Matching
- 研究轴: 数据坐标 / 高频状态, 评估审计 / 可比性, 因子生成 / 表示学习
- 管线落点: LLM 因子生成
- 角色: `数据坐标 / sidecar 候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `452` 字

文章摘要: 本文提出条件流匹配模型 FlowLOB，用于同时提高限价订单簿轨迹生成的真实性、采样效率、情景可控性和跨标的泛化能力。研究针对智能体模拟器只能复现部分市场事实、扩散模型采样成本高且常按单标的训练的问题。方法上，作者使用约一亿参数的 adaLN-Zero Transformer，生成32步、买卖双方各十档的价格和数量窗口；价格以中间价变化和档位间距的 tick 相对表示，数量作 log(x+1) 变换，并以盘口历史、日内时间、趋势、波动率、流动性和订单簿不平衡为条件。数据为港交所八只股票的Level-2十档盘口，覆盖0.1秒、1秒和10秒频率，另将9999.HK完全留出作零样本测试。结果显示，在固定数据、网络、训练预算和ODE求解器的公平比较下，流匹配只需10次Euler函数评估便达到最佳质量成本平衡；六个价格或数量边际设置中五个的距离指标较对应扩散采样器低4至120倍，扩散增加到200次评估通常仍未追平。文章还以分布移动检验情景条件是否真正改变生成结果，并在留出股票上验证了真实性和控制效果。

研究启发: 启发重点是把原始 OB/SF 重新组织成新的状态坐标，例如订单流方向、价格层记忆、成交路径或市场拥挤度，而不是只增加普通 rolling 统计。

管线落点: 优先判断是否能成为 OB 1s exact-axis sidecar；候选 routes: llm_factor_pipeline。

可能增益: 潜在增益在于提供 baseline 186 因子没有表达的状态变量，帮助筛出在特定微观结构状态下更可靠的短周期预测信号。

## 其他研究背景

### IDEA-2026-W34-8ea9e2e2 — 弱因子条件下的监督式混频宏观金融预测

- 优先级: `medium`
- 状态: `candidate`
- 来源: arXiv HFT Time-Series Forecasting
- 链接: http://arxiv.org/abs/2608.12589v1
- 原题: Supervised Mixed-Frequency Learning for Macro-Financial Forecasting When Factors are Weak
- 研究轴: 因子生成 / 表示学习, 模型训练 / 序列预测
- 管线落点: LLM 因子生成
- 角色: `因子生成 / prompt 候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `391` 字

文章摘要: 本文讨论在高频预测变量众多但共同因子较弱时，如何进行低频宏观金融目标预测。传统Factor-MIDAS通常先用PCA从高频变量面板提取共同因子，再用混频回归预测低频目标；其关键困难是PCA依赖因子具有广泛载荷，而弱因子场景下这一假设常不成立。作者提出 SsPCA-MIDAS，将监督式缩放PCA嵌入混频采样框架，使提取方向同时利用预测目标信息，并在弱因子条件下建立一致性和渐近正态性以支持推断。方法比较普通PCA、其他监督降维和混频预测基线；数据由大规模高频或高维预测变量与低频宏观金融目标组成，并通过模拟和实证预测检验。结果显示，当共同因子不够强时，SsPCA-MIDAS在预测表现上优于PCA型和若干监督型竞争方法，优势在弱载荷、信号分散的设定中更明显。文章亮点是把监督降维、混频对齐和统计推断结合，而边界是研究对象主要是宏观金融低频目标，不能据此直接推断其对秒级交易信号有效。

研究启发: 启发重点是把外部研究机制转成 LLM factor prompt、静态分析规则或 idea taxonomy。

管线落点: 可作为 LLM prompt、taxonomy 或人工研究背景；候选 routes: llm_factor_pipeline。

可能增益: 潜在增益待人工确认，当前不建议直接进入训练或回测。

## 时序模型训练与融合

### IDEA-2026-W34-50295561 — 深度学习集成用于股票价格预测：来自沙特市场的证据

- 优先级: `medium`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.7717/peerj-cs.4064
- 原题: Ensemble deep learning models for stock price forecasting: evidence from the Saudi markets
- 研究轴: 模型训练 / 序列预测
- 管线落点: MLP 时序预测
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `389` 字

文章摘要: 本文研究新兴市场短期股票价格预测中，深度学习集成是否优于单一网络。研究动机是股票序列具有非线性和高波动特征，而现有研究对先进集成策略在新兴市场的检验相对有限。方法上，作者以十家Tadawul All Share Index成分公司的多变量市场数据为输入，比较GRU、LSTM等单模型，并构造两种集成方案：对各网络预测直接平均，以及以基学习器输出为输入的stacking。实验使用统一的数据预处理和预测误差指标，考察不同模型在短期价格预测任务上的表现。结果显示，集成模型整体上比多数单一深度学习模型更稳定，其中stacking或平均策略能利用不同循环网络误差不完全相关的特点降低预测误差；具体最优组合会随股票而变。文章的亮点是把单模型比较扩展到显式的集成设计，并在沙特新兴市场给出实证证据。其边界是目标为价格水平预测，样本股票较少，结论未直接覆盖收益率、交易成本或高频订单簿场景。

研究启发: 启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: mlp_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

## 金融时序预测模型

### IDEA-2026-W34-1a14d956 — STSGAT：用于股票波动率预测的时空情绪图注意力网络

- 优先级: `high`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.54254/2977-3903/2026.35794
- 原题: STSGAT: a Spatio-Temporal Sentiment Graph Attention Network for stock volatility forecasting
- 研究轴: 模型训练 / 序列预测, 评估审计 / 可比性
- 管线落点: MLP 时序预测, Linear/Ridge baseline
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `381` 字

文章摘要: 本文提出时空情绪图注意力网络 STSGAT，用于股票波动率预测。研究背景是传统统计模型和仅使用历史价格的深度学习模型，难以同时表达非线性时间依赖、股票之间的关联以及新闻和投资者情绪带来的外部冲击。方法上，论文把市场价格序列、新闻情绪和股票关系图整合进统一网络：时序模块学习各股票自身的动态，图注意力模块根据股票间关联聚合横截面信息，情绪表示作为额外条件以刻画市场行为变化。数据包括股票市场历史数据、财经新闻文本及情绪特征；实验将 STSGAT 与传统时序模型和不含图结构或情绪信息的深度学习基线比较。结果表明，融合时空关系和情绪信息的模型在波动率预测指标上优于这些对照，说明外部信息和跨资产依赖可提供增量解释。文章亮点在于将文本情绪从孤立特征改为图时序预测的条件输入；边界是结论针对波动率而非短周期收益，情绪数据质量、新闻时效和股票关系构造都会显著影响可复现性。

研究启发: 启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: mlp_codeX, linear_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

### IDEA-2026-W34-f20e3b13 — 冻结时序基础模型的神经—经典混合校正：高频股票预测的全面消融研究

- 优先级: `high`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.48550/arxiv.2608.08825
- 原题: Hybrid Neural-Classical Correction for Frozen Time Series Foundation Models: A Comprehensive Ablation Study on High-Frequency Stock Prediction
- 研究轴: 模型训练 / 序列预测, 评估审计 / 可比性
- 管线落点: MLP 时序预测, Linear/Ridge baseline
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `442` 字

文章摘要: 本文考察在不微调 TimesFM 的条件下，如何用轻量神经模块和经典残差模型修正高频股票预测。动机是通用时序基础模型虽然具备零样本泛化能力，但高频金融序列噪声大、开盘阶段分布变化快，直接微调成本高且容易过拟合。方法上，作者把约2亿参数的 TimesFM 作为冻结基线，比较 AttnCorrect 与 GatedLinear 两类校正器：前者用两层四头注意力编码300分钟盘前序列，后者以低秩双线性投影和逐步门控压缩输入；两者之后均以随机森林拟合剩余误差。数据覆盖2024年12月至2026年1月十只美国大型科技股的约200万个一分钟样本，使用盘前OHLC、对数成交量、动量、柱内波动率以及5至60分钟多尺度统计量，预测开盘后一小时的60步收益。结果显示，完整混合模型的池化相关达到0.597，平均逐日相关较冻结 TimesFM 提高6.4倍；随机森林残差学习是最大单组件贡献，自注意力是神经部分最重要的贡献，而仅约4.9万神经参数的 GatedLinear+RF 取得最佳总体表现。

研究启发: 启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: mlp_codeX, linear_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

### IDEA-2026-W34-ee625690 — 金融时序 LSTM 的横截面异质性建模

- 优先级: `medium`
- 状态: `candidate`
- 来源: OpenAlex AI Factor Generation
- 链接: https://openalex.org/W7202005981
- 原题: Cross-Sectional Heterogeneity in LSTM Networks for Financial Time Series
- 研究轴: 因子生成 / 表示学习, 模型训练 / 序列预测, 数据坐标 / 高频状态
- 管线落点: MLP 时序预测, 数据 sidecar / 高频衍生数据, LLM 因子生成
- 角色: `数据坐标 / sidecar 候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `388` 字

文章摘要: 本文研究标准LSTM在金融收益预测中难以处理资产横截面异质性的问题。作者认为，金融市场的低信噪比和半强有效性使单一共享时序结构容易忽略行业、宏观环境和资产特有状态，从而同时损害预测精度与可解释性。方法上，论文在基础LSTM上加入宏观金融协变量以及可学习的行业嵌入：宏观变量提供共同经济环境，行业嵌入把横截面分组差异编码为可训练表示，再与每只资产的历史序列联合输入网络。数据为金融资产收益时间序列、相应的宏观金融指标和行业分类信息，实验把该扩展模型与不含横截面信息的LSTM及其他常见预测基线比较。结果表明，显式加入宏观和行业异质性能够改善收益预测表现，并使不同资产或行业的模型行为更容易解释。文章的贡献不在于提出完全新的循环单元，而在于把“资产并非同质样本”落实到网络输入和参数共享结构中；其边界是行业标签和宏观变量频率较低，真实增益依赖于样本划分、变量发布时间和横截面覆盖。

研究启发: 启发重点是把原始 OB/SF 重新组织成新的状态坐标，例如订单流方向、价格层记忆、成交路径或市场拥挤度，而不是只增加普通 rolling 统计。

管线落点: 优先判断是否能成为 OB 1s exact-axis sidecar；候选 routes: mlp_codeX, data_processing_sidecar, llm_factor_pipeline。

可能增益: 潜在增益在于提供 baseline 186 因子没有表达的状态变量，帮助筛出在特定微观结构状态下更可靠的短周期预测信号。

### IDEA-2026-W34-49a1b888 — 基于因果结构的加密货币价格方向预测模型

- 优先级: `low`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.3390/forecast8040058
- 原题: Causal-Structure-Based Cryptocurrency Price Direction Prediction Model
- 研究轴: 评估审计 / 可比性, 模型训练 / 序列预测
- 管线落点: MLP 时序预测, 回测与可比性审计
- 角色: `评估审计 / 可比性候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `372` 字

文章摘要: 本文针对加密货币市场高波动下相关性黑箱模型可解释性不足、跨状态稳定性较弱的问题，提出把因果发现得到的结构直接作为预测约束。方法上，作者使用 NOTEARS-Linear 因果发现识别变量间的有向关系，并据此构造NLBPM预测模型；与只最小化点预测误差的常规机器学习方法不同，模型同时强调收益方向和结构可解释性。数据为加密资产价格及相关市场变量的时间序列，实验将因果结构约束模型与无结构的机器学习或深度学习预测基线比较，并以方向预测和交易相关指标评估。结果显示，纳入发现的因果结构后，模型在若干加密货币方向预测设定中获得更有竞争力的表现，并能给出变量关系层面的解释。文章亮点是把因果发现从事后解释改为预测模型的显式结构约束；边界是观察数据上的NOTEARS结构依赖变量集合、滞后设定和无遗漏混杂等较强假设，不能把发现的图直接视为真实经济因果关系。

研究启发: 启发重点是补强 baseline regime、OOS、交易成本、样本选择和风险事件识别，降低研究结论被实验口径污染的概率。

管线落点: 优先进入审计/评估方法库，服务 baseline 可比性和 SFT/BT 可信度；候选 routes: mlp_codeX, backtest_audit。

可能增益: 潜在增益在于减少不可比实验、泄露和过拟合带来的误判，让 SFT/BT 结论更可信。

### IDEA-2026-W34-fd236f60 — BitMood：利用 Facebook 情绪分析比特币趋势

- 优先级: `low`
- 状态: `candidate`
- 来源: OpenAlex Financial Time-Series Models
- 链接: https://doi.org/10.1007/s42521-026-00205-3
- 原题: BitMood: AI analysis of Bitcoin trends via Facebook emotions
- 研究轴: 模型训练 / 序列预测
- 管线落点: Linear/Ridge baseline, MLP 时序预测
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读来源摘要`；摘要质量: `中`；摘要长度: `407` 字

文章摘要: 本文研究社交媒体情绪是否能够解释或预测比特币市场动态。研究动机是数字资产价格常受投资者情绪和注意力驱动，但简单的正负面词典难以利用社交平台的多种互动反应。方法上，作者收集约12万条Facebook帖子，并结合Blockchain Research Center的比特币市场数据，先用FinBERT进行金融情绪分类，再把文本情绪与点赞、愤怒等多反应互动信号组合为复合情绪分数；随后开展情绪描述、动态主题模型、基于情绪的交易策略和机器学习成交量预测四类分析。数据覆盖2015至2023年。结果显示，复合Facebook情绪与比特币市场变化存在显著关联，并在作者的策略和成交量预测实验中提供信息；不同反应类型和主题对应的市场含义并不相同。文章亮点是把平台互动行为纳入情绪量化，而不仅使用文本极性。其边界是Facebook用户并非全体交易者、社交数据存在平台和样本选择偏差，且研究结论不能替代严格的实时可交易性与成本检验。

研究启发: 启发重点是改进序列模型的信息组织、损失函数、样本权重、GRU/TCN/Transformer 结构或多 horizon 训练方式，适合作为 MLP/LGB/Linear 对照实验。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: linear_codeX, mlp_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

## 常青资料库

以下资料已在历史周报覆盖，但仍有长期参考价值；不再占用本周新增 idea 名额。

### AI 辅助因子生成

- [AlphaAgent：带正则化探索的 LLM Alpha 挖掘以对抗 Alpha 衰减](https://arxiv.org/abs/2502.16789)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [Chain-of-Alpha：基于 LLM 的自动公式化 Alpha 挖掘框架](https://www.researchgate.net/publication/394426875_Chain-of-Alpha_Unleashing_the_Power_of_Large_Language_Models_for_Alpha_Mining_in_Quantitative_Trading)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [FactorMAD：基于 LLM 多智能体辩论的可解释 Alpha 因子挖掘](https://dl.acm.org/doi/10.1145/3768292.3770377)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LLM 驱动的自动稳健特征工程](https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5124841)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [量化投资中的 LLM 自动策略发现](https://aclanthology.org/2025.findings-emnlp.1005/)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [面向稀疏投资组合优化的 LLM 进化式 Alpha 因子发现](https://openreview.net/forum?id=Zs3ZXwfaIu)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [AlphaEval：面向公式型Alpha挖掘的全面高效评估框架](https://doi.org/10.1145/3770855.3817727)；首次 `2026-W33`；最近 `2026-W33`；出现 `2` 次；本周重复，已移入常青资料
- [MAPLE：面向投资组合构建的高效多样化多Alpha生成框架](https://openalex.org/W7171749864)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料
- [XALPHA：从假设到代码进行 Alpha 发现的记忆驱动型 AI 量化研究员](https://openalex.org/W7168054205)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料

### 时序预测模型与 LOB

- [Deep Limit Order Book Forecasting：深度限价订单簿预测与 LOBFrame 基准](https://arxiv.org/abs/2403.09267)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LENS：用于探索金融时序规律的大规模预训练 Transformer](https://arxiv.org/abs/2408.10111)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LSTM、GRU 与 Transformer 在股票价格趋势预测中的比较分析](https://arxiv.org/abs/2411.05790)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LiT：限价订单簿Transformer](https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1616485/full)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [TLOB：基于限价订单簿数据的双注意力 Transformer 股价趋势预测模型](https://arxiv.org/abs/2502.15757)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [基于 CNN 与 Transformer 的金融时间序列预测](https://arxiv.org/abs/2304.04912)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料

### 订单簿表示与逐笔数据

- [基于注意力机制的限价订单簿阅读、突出与全簿预测](https://arxiv.org/abs/2409.02277)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料

### 评估审计与风险控制

- [金融科技系统中的自适应风险评估：基于强化学习的连续策略优化](https://doi.org/10.62762/jse.2026.605759)；首次 `2026-W25`；最近 `2026-W26`；出现 `2` 次；历史高频资料

### 金融时序预测模型

- [从预测准确率到交易盈利能力：股票价格预测序列模型的评估](https://doi.org/10.3390/a19070594)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料
- [通过人工智能驱动的市场数据与情绪分析融合增强股票价格预测](https://doi.org/10.14445/23939125/ijems-v13i6p102)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料

### 高频数据特征工程

- [中信建投：市场微观结构系列研究，从分钟频到 Level2 的探索与发现](https://view.inews.qq.com/a/20251217A01V3A00)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [国信证券：高频订单成交数据蕴含的 Alpha 信息](https://www.fxbaogao.com/detail/4095774)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [国信金工：基于主动买卖特征的高频订单因子改进](https://finance.sina.com.cn/roll/2024-08-20/doc-inckfzcs5651129.shtml)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [开源证券：市场微观结构观察与2023年以来的高频因子回顾](https://www.fxbaogao.com/detail/4984776)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [挂单方向长期记忆性的讨论与应用](https://www.fxbaogao.com/detail/4339762)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [基于 TransXFormer 的出版传媒股票预测](https://doi.org/10.1016/j.iref.2026.105681)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料

### 高频订单流与微观结构

- [用于金融时间序列预测的分解增强网络 DENet](https://doi.org/10.1038/s41598-026-63484-1)；首次 `2026-W32`；最近 `2026-W32`；出现 `2` 次；本周重复，已移入常青资料

## 本周高分来源

- `25` [公开交易者身份：逆向选择与收益可预测性](https://openalex.org/W7202006892) — OpenAlex 订单簿与微观结构专题; 数据坐标 / 高频状态, 评估审计 / 可比性; 回测与可比性审计, 数据 sidecar / 高频衍生数据, LLM 因子生成
- `22` [FlowLOB：基于流匹配的高效可控限价订单簿生成](http://arxiv.org/abs/2608.13096v1) — arXiv 高频时序预测; 数据坐标 / 高频状态, 评估审计 / 可比性, 因子生成 / 表示学习; LLM 因子生成
- `20` [冻结时序基础模型的神经—经典混合校正：高频股票预测的全面消融研究](https://doi.org/10.48550/arxiv.2608.08825) — OpenAlex 金融时序模型专题; 模型训练 / 序列预测, 评估审计 / 可比性; MLP 时序预测, Linear/Ridge baseline
- ` 9` [金融时序 LSTM 的横截面异质性建模](https://openalex.org/W7202005981) — OpenAlex AI 因子生成专题; 因子生成 / 表示学习, 模型训练 / 序列预测, 数据坐标 / 高频状态; MLP 时序预测, 数据 sidecar / 高频衍生数据, LLM 因子生成

## 人工 Review Checklist

- 是否明确 `t` 时刻可见信息和预测 horizon？
- 是否只是已有 OB/SF/PLM/CS 的 rolling-window 变体，还是新增了观察坐标？
- 是否能沉淀为高频数据特征工程模板，例如订单不平衡、主动买卖、价格层记忆、事件时间或盘口形态？
- 应作为 predictor、gate/context、normalizer 还是 evaluation audit？
- 是否存在版权、付费源或全文再分发风险？
