# 高频时序预测研究 Idea 周报 2026-W31

- 周期: `2026-07-27` 至 `2026-08-02`
- 生成时间: `2026-07-28T06:45:12+00:00`
- source registry version: `2026-07-28.v6`
- 来源条目: `64`
- 候选想法: `4`

## 本周结论

本周候选只代表研究启发，不代表可直接上线。每篇文章由 LLM 或人工 notes 尽量总结文章自身的背景、逻辑、方法、数据和结果；没有依据的字段留空，不再硬写固定模板。项目相关迁移只放在“研究启发/管线落点”里，不混入文章摘要。本轮特别关注高频数据特征工程，优先识别能转化为订单流、盘口形态、价格层记忆、事件时间、主动买卖和 sidecar 字段的想法。

## 本周汇总导航

本周共 `4` 条候选 idea，分布在 `3` 个板块。
证据分布: 已读 PDF 1, 已读网页 2, 读取失败 1。
摘要质量: {'high': 1, 'medium': 2, 'low': 1}；摘要长度中位数 `656.5` 字；有提示的条目 `1` 条。

### 本周去重审计

- 高分候选: `25`
- 主榜新增: `4`
- 补充池入选: `0`
- 观察池候选: `17`
- 历史重复过滤: `17`
- 同周重复过滤: `0`
- 离题过滤: `20`
- 精选阅读: `10` / `10`
- 上周重合: `0`

- **AI 辅助因子生成**：1 条
  - 用于迷因股尾部风险检测的 LLM 情绪信号与词典情绪信号比较：直接比较 VADER 单维情绪与 LLM 多维语义表示
- **加密市场与跨资产信息**：1 条
  - 高频金融市场中具备波动率感知的极端事件检测：将极端收益与高波动率状态联合纳入目标定义
- **金融时序预测模型**：2 条
  - AlphaZeroBeta：面向市场中性投资组合的深度强化学习框架：把基准相对 alpha 与近零市场暴露纳入同一强化学习目标
  - 基于情绪增强技术指标与贝叶斯优化 LSTM 的股票收益预测：来自沪深300的证据：融合经典技术指标、新闻情绪与社交媒体情绪

### 重点亮点

- **加密市场与跨资产信息** / 高频金融市场中具备波动率感知的极端事件检测：将极端收益与高波动率状态联合纳入目标定义
- **AI 辅助因子生成** / 用于迷因股尾部风险检测的 LLM 情绪信号与词典情绪信号比较：直接比较 VADER 单维情绪与 LLM 多维语义表示
- **金融时序预测模型** / AlphaZeroBeta：面向市场中性投资组合的深度强化学习框架：把基准相对 alpha 与近零市场暴露纳入同一强化学习目标
- **金融时序预测模型** / 基于情绪增强技术指标与贝叶斯优化 LSTM 的股票收益预测：来自沪深300的证据：融合经典技术指标、新闻情绪与社交媒体情绪

## 本周精选阅读清单

为保证每周有足够可读内容，本区按“本周新增主榜、观察池精选、历史高价值复盘、常青资料轮播”补足；主榜仍只代表严格新增 idea。

1. **本周新增主榜** `24` [Volatility-Aware Extreme Event Detection in High-Frequency Financial Markets](https://openalex.org/W7170112210)；本周新增且通过强量化相关性门槛
2. **本周新增主榜** `9` [AlphaZeroBeta: Deep Reinforcement Learning for Market-Neutral Portfolios](https://doi.org/10.1186/s40854-026-00955-4)；本周新增且通过强量化相关性门槛
3. **本周新增主榜** `9` [Bayesian-Optimized LSTM with Sentiment-Augmented Technical Indicators for Stock Return Prediction: Evidence from CSI 300](https://doi.org/10.54254/2754-1169/2026.35422)；本周新增且通过强量化相关性门槛
4. **本周新增主榜** `9` [LLM-Based vs. Lexicon-Based Sentiment Signals for Tail-Risk Detection in Meme Stocks](http://arxiv.org/abs/2607.24072v1)；本周新增且通过强量化相关性门槛
5. **观察池精选** `12` [Deep Temporal Convolutional Networks for High Frequency Cryptocurrency Price Forecasting](https://doi.org/10.54254/2755-2721/2026.tj35387)；方法或泛金融相关，但缺少量化硬锚点
6. **观察池精选** `9` [Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features](http://arxiv.org/abs/2607.23370v1)；方法或泛金融相关，但缺少量化硬锚点
7. **观察池精选** `9` [Stock Price Trend Prediction and Securities Trading Optimization Based on CNN-GAA](https://doi.org/10.5755/j01.itc.55.2.43595)；弱金融锚点，缺少订单簿/收益/因子等硬锚点
8. **观察池精选** `5` [A multi-dimensional intelligent financial risk early warning model based on deep learning](https://doi.org/10.1007/s10791-026-10351-2)；方法或泛金融相关，但缺少量化硬锚点
9. **观察池精选** `5` [AI Trading: Evaluating Large Language Models for Technical Market Analysis](https://openalex.org/W7169923154)；方法或泛金融相关，但缺少量化硬锚点
10. **观察池精选** `5` [Physics-Informed Reinforcement Learning for Financial Markets, Deep Hedging and Systemic-Risk-Constrained Portfolio Optimization](https://doi.org/10.62311/nesx/rp5jy-30072026)；方法或泛金融相关，但缺少量化硬锚点

## 按类别整理的候选想法

## AI 辅助因子生成

### IDEA-2026-W31-ba394a27 — 用于迷因股尾部风险检测的 LLM 情绪信号与词典情绪信号比较

- 优先级: `medium`
- 状态: `candidate`
- 来源: arXiv HFT Time-Series Forecasting
- 链接: http://arxiv.org/abs/2607.24072v1
- 原题: LLM-Based vs. Lexicon-Based Sentiment Signals for Tail-Risk Detection in Meme Stocks
- 研究轴: 因子生成 / 表示学习, 模型训练 / 序列预测, 评估审计 / 可比性
- 管线落点: Linear/Ridge baseline, LLM 因子生成, MLP 时序预测
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读 PDF`；摘要质量: `高`；摘要长度: `791` 字

研究亮点:

- 直接比较 VADER 单维情绪与 LLM 多维语义表示
- 同时刻画极性、看多程度、讽刺可能性和主题相关性
- 用领先—滞后、回归、方向分类和分位数预警进行多角度检验
- 指出语义表征更丰富并不等于预测能力稳定提升

文章摘要: 文章研究一个具体而容易被高估的问题：大型语言模型能够更细致地理解社交媒体语言，但这种语言理解优势是否会转化为稳定的市场预测能力。研究对象是散户关注度高、价格波动剧烈的迷因股 GME、AMC 和 NOK，文本来自 Reddit 的 r/WallStreetBets，观察期为 2020 年 11 月至 2022 年 5 月，覆盖 2021 年初迷因股事件的形成阶段及其后续时期。作者整合 Kaggle 的 WallStreetBets 帖子数据与 Figshare 的资产专属 JSON 帖子和评论档案，按股票代码筛选文本，并通过 yfinance 获取日收盘价，将文本指标与市场数据按日对齐。比较基线为计算高效且易解释的 VADER：它依靠预定义词典和启发式规则生成区间为负一至一的复合情绪分数，再形成资产日度情绪指标。LLM 方法则不把每段文本压缩为单一正负极性，而是提取情绪极性、看多程度、讽刺可能性和主题相关性等多维表示，以处理 WallStreetBets 中常见的俚语、反讽、社区特有表达和迷因化叙事。评估不仅考察普通相关关系，还使用领先—滞后相关分析区分信号的预测性与反应性，以 OLS 回归检查统计关系，以 ROC-AUC 衡量短期方向分类能力，并构建基于分位数的预警框架，专门检测各资产收益分布上尾的极端正收益事件。结果表明，LLM 指标确实提供了比 VADER 更丰富的语义维度，并呈现更强的资产特异性统计结构；但其与市场运动的关系在三只股票之间并不一致，语言表达能力的增强没有自动带来稳定预测优势。文章因此强调，社交媒体信号必须按资产和市场状态验证，不能把更复杂的文本表征等同于更可靠的交易信号。其边界也较清楚：样本仅含三只迷因股、采用日频聚合，并把“尾部风险”具体定义为极端正收益而非通常意义上的下行损失，结论不宜直接外推至一般股票、负向尾部风险或更高频市场。

背景: 社交媒体关注与情绪可能影响短期价格形成，在迷因股中尤其明显。VADER 等词典方法高效且可解释，却难以处理讽刺、俚语、上下文歧义和金融社区特有语言；LLM 能表达更丰富的语义，但其市场预测价值仍缺乏稳定证据。

逻辑: 先比较 VADER 单维极性和 LLM 多维语义指标的结构差异，再通过时间对齐后的相关、回归、分类与上尾事件预警检验，判断更强的语言理解究竟产生领先信息，还是仅对已经发生的市场变化作出反应。

方法: VADER 为文本生成负一至一的复合情绪分数并按资产、日期聚合；LLM 提取情绪极性、看多程度、讽刺可能性和主题相关性等维度。作者采用领先—滞后相关、OLS 回归、ROC-AUC 方向分类以及基于分位数的极端正收益预警框架进行比较。

数据: 使用 2020 年 11 月至 2022 年 5 月 r/WallStreetBets 的帖子和评论，来源包括 Kaggle 的 WallStreetBets Posts 数据集与 Figshare 的资产专属 JSON 档案，研究 GME、AMC、NOK；日度股价通过 yfinance 获取并与文本指标对齐。现有摘录未完整给出各资产帖子、评论和交易日数量。

结果: LLM 指标形成了比 VADER 更丰富的多维表示，并表现出更明显的资产特异性统计结构；但信号与收益的关系在资产间高度异质，更强的语义表达并未转化为一致、稳定的预测表现。现有材料未提供各检验的具体系数、ROC-AUC 数值或显著性结果。

高频特征工程关注点: 研究本身使用日频社交媒体数据，不属于盘口高频特征工程。其可借鉴之处是保留极性、看多程度、讽刺概率和主题相关性等独立维度，并严格进行文本时间戳与收益窗口的领先—滞后对齐；若扩展到事件时间场景，还需防止日内后验文本进入预测窗口。它没有研究订单不平衡、主动买卖、微价格、队列状态、成交时长或盘口形态。

研究启发: 可将 LLM 输出的极性、看多度、讽刺概率、主题相关性和文本活跃度保存为带明确发布时间的低频 sidecar，而不是直接合成为单一情绪因子；随后分别用 Linear/Ridge 检查边际关系，用 LGB 或 MLP 检验非线性与状态交互，并要求相同股票池、时间窗口和标签定义下与 VADER 比较。LLM 因子生成环节应同时保留提示词、模型版本与聚合规则。由于原文发现明显的资产异质性，回测和审计需报告逐资产、逐阶段及领先—滞后结果，并把“极端正收益预警”与通常的下行尾部风险标签严格区分。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: linear_codeX, llm_factor_pipeline, mlp_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

## 加密市场与跨资产信息

### IDEA-2026-W31-c303f9f2 — 高频金融市场中具备波动率感知的极端事件检测

- 优先级: `high`
- 状态: `candidate`
- 来源: OpenAlex Semantic Works Search
- 链接: https://openalex.org/W7170112210
- 原题: Volatility-Aware Extreme Event Detection in High-Frequency Financial Markets
- 研究轴: 数据坐标 / 高频状态, 评估审计 / 可比性
- 管线落点: LGB 融合与筛选, Linear/Ridge baseline, LLM 因子生成
- 角色: `数据坐标 / sidecar 候选`
- 原文证据: `已读网页`；摘要质量: `中`；摘要长度: `570` 字

研究亮点:

- 将极端收益与高波动率状态联合纳入目标定义
- 以标签设计缓解稀有事件的严重类别不平衡
- 在相同任务中将 PR-AUC 从约 0.06 提升至约 0.40
- 强调目标构造的重要性可能超过模型复杂度

文章摘要: 文章研究高频金融市场中的极端价格变动检测。此类任务同时受到市场非平稳性、收益分布厚尾和类别严重不平衡的影响：真正重要的剧烈波动样本十分稀少，而常规标签通常只把超过未来收益阈值的单个观测视为极端事件，既忽略波动持续聚集的市场状态，也使模型难以获得足够的有效训练样本。作者以高频比特币限价订单簿数据为对象，依据波动率聚集的经验事实重新定义预测目标，将较大的未来收益与高波动率状态共同纳入极端事件标签。该设计不再把极端变动理解为彼此孤立的异常点，而是把它放在相应的市场波动结构中识别，从而提高标签中信息样本的占比，并使学习目标更贴合极端行情的形成方式。模型采用树模型 XGBoost，以时间序列交叉验证保持训练与验证的时间顺序，并使用适合类别不平衡问题的 Precision-Recall AUC 作为核心指标。实验显示，波动率感知标签的 PR-AUC 约为 0.40，而仅依据传统极端收益定义构造的基线约为 0.06，检测能力提高六倍以上。文章据此强调，在金融机器学习中，预测目标和标签设计可能比增加模型复杂度更重要。其主要贡献是把波动状态直接写入监督信号，为稀有但影响重大的市场事件提供更有效且更符合实际动态的检测框架。材料未披露订单簿的具体档位、采样频率、预测跨度、阈值选择和跨市场验证结果，因此结论目前主要适用于文中给出的比特币高频场景。

背景: 高频极端价格运动具有稀少、厚尾和波动聚集等特征，传统模型若仅按单点未来收益阈值定义事件，会面临严重类别不平衡，并忽略极端运动所处的持续高波动状态。

逻辑: 极端收益并非完全孤立的异常观测，而往往与高波动率状态共同出现。将未来大收益和高波动状态联合用于标签定义，可以增加有信息样本的比例，使监督目标更符合市场动态，并改善稀有事件的可学习性。

方法: 使用高频比特币限价订单簿数据，构造同时考虑较大未来收益与高波动率状态的极端事件标签；采用 XGBoost 完成分类，通过时间序列交叉验证评估，并以适合严重类别不平衡问题的 PR-AUC 衡量检测效果。

数据: 高频比特币限价订单簿数据；现有材料未说明交易场所、时间范围、订单簿深度、采样频率和样本数量。

结果: 波动率感知目标定义取得约 0.40 的 PR-AUC，传统基线标签约为 0.06，提升超过六倍。结果表明，纳入波动结构的标签设计能显著改善稀有极端事件检测。

高频特征工程关注点: 对高频特征工程最直接的启发是将订单簿特征与波动状态联合组织，而非只依赖未来收益阈值。可围绕订单不平衡、主动买卖、微价格偏离、盘口形态和事件时间状态构造条件化特征，并检验这些信号在低波动与高波动区间中的响应差异；但原文材料并未披露实际采用的订单簿字段。

研究启发: 在因子管线中，可把“标签定义审计”作为独立于模型选择的实验轴：先固定同一时序切分和同一特征集合，比较纯收益极端标签与收益加波动状态标签，再分别用 Linear/Ridge、LGB 和 MLP 检验增益是否跨模型存在。对 OB/SF 或 sidecar 数据，可提供只使用当时可见信息计算的波动状态、订单不平衡和盘口形态变量；LLM 因子生成阶段则应明确区分预测特征与事后标签，避免未来波动信息泄漏。

管线落点: 优先判断是否能成为 OB 1s exact-axis sidecar；候选 routes: lgb_codeX, linear_codeX, llm_factor_pipeline。

可能增益: 潜在增益在于提供 baseline 186 因子没有表达的状态变量，帮助筛出在特定微观结构状态下更可靠的短周期预测信号。

## 金融时序预测模型

### IDEA-2026-W31-d509cc55 — AlphaZeroBeta：面向市场中性投资组合的深度强化学习框架

- 优先级: `medium`
- 状态: `candidate`
- 来源: OpenAlex Semantic Works Search
- 链接: https://doi.org/10.1186/s40854-026-00955-4
- 原题: AlphaZeroBeta: Deep Reinforcement Learning for Market-Neutral Portfolios
- 研究轴: 评估审计 / 可比性, 因子生成 / 表示学习, 模型训练 / 序列预测
- 管线落点: LLM 因子生成, MLP 时序预测, 回测与可比性审计
- 角色: `评估审计 / 可比性候选`
- 原文证据: `读取失败`；摘要质量: `低`；摘要长度: `652` 字；提示: 读取失败，summary 主要依赖元数据或人工 notes

研究亮点:

- 把基准相对 alpha 与近零市场暴露纳入同一强化学习目标
- 以 CNN-GRU 和 Recurrent PPO 联合建模动态市场状态与组合决策
- 采用覆盖十年、七个股票指数的滚动 walk-forward 回测
- 在 Sharpe、基准相关性和回撤三个维度同时评估策略

文章摘要: 市场中性投资组合试图在抵消系统性市场风险的同时持续获得相对于基准的超额收益，但传统因子模型与凸优化方法通常依赖较稳定的风险结构、线性关系或预先设定的约束；当市场状态切换、相关性变化或结构假设失效时，这些方法的表现可能下降。文章提出 AlphaZeroBeta，将投资组合构建表述为序列决策问题，目标是在提高风险调整后基准相对收益的同时，把组合对基准的暴露和交易摩擦控制在较低水平。框架采用 CNN-GRU 策略网络：CNN 用于提取局部市场模式，GRU 用于建模跨期依赖与动态状态；策略通过 Recurrent PPO 端到端训练，使模型能够依据不断变化的市场信息调整持仓。其复合奖励函数同时考虑风险调整后超额收益、组合与基准的相关性以及交易成本，从目标层面协调 alpha、市场中性和可交易性，而不是仅追求原始收益。实验使用滚动 walk-forward 协议，在 2014—2024 年间覆盖七个股票指数进行回测，以减少固定样本切分对结论的影响并考察跨市场、跨时期表现。摘要报告显示，AlphaZeroBeta 相比基线取得更高的 Sharpe 比率，同时维持接近零的基准相关性，最大回撤表现也具有竞争力。这说明把中性约束和交易成本直接纳入强化学习目标，能够在动态环境中兼顾超额收益与系统风险控制。不过，现有材料没有披露七个指数的具体名称、基线配置、费用假设、调仓频率、统计显著性及分市场结果，因此尚不能据此判断优势在不同市场状态下是否稳定，也无法区分收益提升来自状态表征、奖励设计还是策略优化算法。

背景: 市场中性策略希望获得独立于大盘方向的超额收益。传统因子模型和凸优化依赖较强的结构假设，在市场状态切换或相关结构改变时可能难以保持收益与中性约束。

逻辑: 将组合管理建模为动态序列决策，并在同一奖励目标中同时奖赏风险调整后的基准相对收益、惩罚基准相关性和交易成本，使策略学习过程直接围绕“高 alpha、近零 beta、可交易”三个目标展开。

方法: 使用 CNN-GRU 策略网络提取局部模式和时序依赖，通过 Recurrent PPO 端到端训练；采用包含风险调整后超额收益、基准相关性与交易成本的复合奖励函数，并以滚动 walk-forward 协议评估。

数据: 回测覆盖 2014—2024 年及七个股票指数；现有材料未列出指数名称、样本频率、成分股范围、输入变量和交易成本参数。

结果: 摘要称该模型相较基线获得更高的 Sharpe 比率，同时保持接近零的基准相关性，回撤表现具有竞争力；未提供具体数值、显著性检验或逐市场结果。

研究启发: 可在组合回测与可比性审计中借鉴其多目标评价思路，将超额收益、基准暴露、换手成本和回撤拆开报告，避免仅凭收益或 Sharpe 判断模型。若用于 MLP、LGB、Linear 或 LLM 因子管线，CNN-GRU 与强化学习策略应被视为独立的下游组合决策层，并与使用相同预测信号、成本假设和股票池的线性优化基线比较；在缺少完整论文参数和分市场证据时，不宜直接把摘要结论解释为可迁移的稳定优势。

管线落点: 优先进入审计/评估方法库，服务 baseline 可比性和 SFT/BT 可信度；候选 routes: llm_factor_pipeline, mlp_codeX, backtest_audit。

可能增益: 潜在增益在于减少不可比实验、泄露和过拟合带来的误判，让 SFT/BT 结论更可信。

### IDEA-2026-W31-de0ab556 — 基于情绪增强技术指标与贝叶斯优化 LSTM 的股票收益预测：来自沪深300的证据

- 优先级: `medium`
- 状态: `candidate`
- 来源: OpenAlex Semantic Works Search
- 链接: https://doi.org/10.54254/2754-1169/2026.35422
- 原题: Bayesian-Optimized LSTM with Sentiment-Augmented Technical Indicators for Stock Return Prediction: Evidence from CSI 300
- 研究轴: 模型训练 / 序列预测, 评估审计 / 可比性, 因子生成 / 表示学习
- 管线落点: MLP 时序预测, LGB 融合与筛选, Linear/Ridge baseline
- 角色: `模型训练 / 融合候选`
- 原文证据: `已读网页`；摘要质量: `中`；摘要长度: `661` 字

研究亮点:

- 融合经典技术指标、新闻情绪与社交媒体情绪
- 使用 FinBERT 与贝叶斯更新构造多源情绪表征
- 以 TPE 贝叶斯优化搜索 LSTM 超参数
- 通过高斯噪声注入检验模型的扰动稳健性

文章摘要: 文章针对股票收益序列具有非线性、随机性并受非理性投资行为影响的问题，提出 BOLSTM-SATI 混合预测框架，将 LSTM、传统技术指标、多源投资者情绪和自动超参数优化结合起来。研究对象为沪深300成分股，特征空间包含 MACD、RSI、布林带、成交量平衡指标和平均真实波幅 ATR，用以描述趋势、动量、成交量关系及波动水平；情绪部分同时使用经 FinBERT 提取的新闻文本情绪分数和东方财富股吧的社交媒体情绪指数，再通过贝叶斯更新机制将多源信息整合为投资者情绪表征。预测器采用 LSTM 学习价格、技术指标和情绪变量的时间依赖关系。为降低人工调参带来的任意性并缓解过拟合，作者使用基于树结构 Parzen 估计器（TPE）的贝叶斯优化搜索 LSTM 超参数，并通过高斯噪声注入实验检验模型面对输入扰动时的稳健性。实证使用2015年1月至2022年12月的日频数据，比较对象包括 ARIMA、传统 LSTM、XGBoost 和 Transformer 变体。报告结果显示，BOLSTM-SATI 的方向准确率为67.3%，平均绝对误差为0.0082，回测夏普比率为2.41，并优于上述基线。作者据此认为，将投资者情绪动态纳入技术特征学习能够同时改善收益方向预测、数值误差和交易策略表现。文章的突出之处是把异质情绪来源、经典技术指标、序列模型和贝叶斯调参整合为统一框架。不过，现有材料没有披露交易成本、成分股生存偏差处理、具体切分方法、超参数空间及各基线的逐项数值，因此回测可复现性和跨时期泛化能力仍需结合全文细节判断。

背景: 股票收益预测受到非线性市场动态、投资者非理性行为和金融时间序列随机性的共同影响。仅依赖价格历史或单一技术指标，可能无法充分捕捉由新闻和社交讨论驱动的情绪变化。

逻辑: 技术指标刻画价格、动量、成交量和波动状态，多源情绪指标补充投资者行为信息，LSTM 负责学习这些变量之间的时序依赖；贝叶斯优化用于系统搜索模型配置，以提高泛化能力并降低过拟合风险。

方法: 构建 BOLSTM-SATI 框架：输入包括 MACD、RSI、布林带、成交量平衡指标、ATR，以及由 FinBERT 新闻情绪和东方财富股吧情绪形成的多源情绪指标；利用贝叶斯更新机制融合情绪信息，以 LSTM 预测股票收益，并用基于 TPE 的贝叶斯优化搜索超参数。通过高斯噪声注入测试扰动稳健性，并与 ARIMA、传统 LSTM、XGBoost 和 Transformer 变体比较。

数据: 使用沪深300成分股2015年1月至2022年12月的日频数据，并结合新闻文本和东方财富股吧社交媒体信息。数据可按合理请求向作者获取；材料未提供样本数量、新闻来源范围及成分股历史调整方法。

结果: BOLSTM-SATI 报告的方向准确率为67.3%，MAE 为0.0082，回测夏普比率为2.41，并优于 ARIMA、传统 LSTM、XGBoost 和 Transformer 变体。作者认为情绪动态与技术特征的联合学习提高了预测准确性和策略盈利表现。

研究启发: 该研究可作为多源特征融合的对照思路：将技术指标、文本情绪和社交情绪分别保留为可审计特征组，在相同日期切分下依次比较 Linear/Ridge、LGB 与 MLP 的增量表现，而不是只评估完整 LSTM。情绪数据更适合作为具有明确发布时间和可用时间的 sidecar；需严格处理新闻发布时间、股吧帖子时间、交易日对齐和成分股历史变化。LLM 因子管线可用于生成并审查情绪与市场状态的交互假设，但最终应通过消融、成本后回测和跨时期验证确认。

管线落点: 优先作为 MLP/LGB/Linear 的训练或融合实验，不直接改变因子数据；候选 routes: mlp_codeX, lgb_codeX, linear_codeX。

可能增益: 潜在增益在于提升多 horizon 序列预测稳定性，或改善 MLP/LGB/Linear 对 sidecar/context 特征的吸收方式。

## 观察池

以下内容有一定金融/交易语境，但缺少订单簿、收益预测、因子、回测或市场微观结构等量化硬锚点；本期不进入主榜。完整观察池保留在 JSON 审计文件中。

- `12` [Deep Temporal Convolutional Networks for High Frequency Cryptocurrency Price Forecasting](https://doi.org/10.54254/2755-2721/2026.tj35387)；方法或泛金融相关，但缺少量化硬锚点
- `9` [Stock Price Trend Prediction and Securities Trading Optimization Based on CNN-GAA](https://doi.org/10.5755/j01.itc.55.2.43595)；弱金融锚点，缺少订单簿/收益/因子等硬锚点
- `9` [Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features](http://arxiv.org/abs/2607.23370v1)；方法或泛金融相关，但缺少量化硬锚点
- `5` [AI Trading: Evaluating Large Language Models for Technical Market Analysis](https://openalex.org/W7169923154)；方法或泛金融相关，但缺少量化硬锚点
- `5` [A multi-dimensional intelligent financial risk early warning model based on deep learning](https://doi.org/10.1007/s10791-026-10351-2)；方法或泛金融相关，但缺少量化硬锚点
- `5` [Physics-Informed Reinforcement Learning for Financial Markets, Deep Hedging and Systemic-Risk-Constrained Portfolio Optimization](https://doi.org/10.62311/nesx/rp5jy-30072026)；方法或泛金融相关，但缺少量化硬锚点
- `5` [The Fundamental Structure of Risk: From Characteristics to Covariance](http://arxiv.org/abs/2607.24410v1)；方法或泛金融相关，但缺少量化硬锚点

## 常青资料库

以下资料已在历史周报覆盖，但仍有长期参考价值；不再占用本周新增 idea 名额。

### AI 辅助因子生成

- [AlphaAgent：带正则化探索的 LLM Alpha 挖掘以对抗 Alpha 衰减](https://arxiv.org/abs/2502.16789)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [Chain-of-Alpha：基于 LLM 的自动公式化 Alpha 挖掘框架](https://www.researchgate.net/publication/394426875_Chain-of-Alpha_Unleashing_the_Power_of_Large_Language_Models_for_Alpha_Mining_in_Quantitative_Trading)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [FactorMAD：基于 LLM 多智能体辩论的可解释 Alpha 因子挖掘](https://dl.acm.org/doi/10.1145/3768292.3770377)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LLM 驱动的自动稳健特征工程](https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5124841)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [量化投资中的 LLM 自动策略发现](https://aclanthology.org/2025.findings-emnlp.1005/)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [面向稀疏投资组合优化的 LLM 进化式 Alpha 因子发现](https://openreview.net/forum?id=Zs3ZXwfaIu)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料

### 时序预测模型与 LOB

- [Deep Limit Order Book Forecasting：深度限价订单簿预测与 LOBFrame 基准](https://arxiv.org/abs/2403.09267)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LENS：用于探索金融时序规律的大规模预训练 Transformer](https://arxiv.org/abs/2408.10111)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LSTM、GRU 与 Transformer 在股票价格趋势预测中的比较分析](https://arxiv.org/abs/2411.05790)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [LiT：限价订单簿Transformer](https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1616485/full)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [TLOB：基于限价订单簿数据的双注意力 Transformer 股价趋势预测模型](https://arxiv.org/abs/2502.15757)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料

### 订单簿表示与逐笔数据

- [基于注意力机制的限价订单簿阅读、突出与全簿预测](https://arxiv.org/abs/2409.02277)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料

### 评估审计与风险控制

- [金融科技系统中的自适应风险评估：基于强化学习的连续策略优化](https://doi.org/10.62762/jse.2026.605759)；首次 `2026-W25`；最近 `2026-W26`；出现 `2` 次；历史高频资料

### 高频数据特征工程

- [中信建投：市场微观结构系列研究，从分钟频到 Level2 的探索与发现](https://view.inews.qq.com/a/20251217A01V3A00)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [国信证券：高频订单成交数据蕴含的 Alpha 信息](https://www.fxbaogao.com/detail/4095774)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [国信金工：基于主动买卖特征的高频订单因子改进](https://finance.sina.com.cn/roll/2024-08-20/doc-inckfzcs5651129.shtml)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [开源证券：市场微观结构观察与2023年以来的高频因子回顾](https://www.fxbaogao.com/detail/4984776)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料
- [挂单方向长期记忆性的讨论与应用](https://www.fxbaogao.com/detail/4339762)；首次 `2026-W25`；最近 `2026-W26`；出现 `3` 次；本周重复，已移入常青资料

## 本周高分来源

- `24` [高频金融市场中具备波动率感知的极端事件检测](https://openalex.org/W7170112210) — OpenAlex 语义论文检索; 数据坐标 / 高频状态, 评估审计 / 可比性; LGB 融合与筛选, Linear/Ridge baseline, LLM 因子生成
- ` 9` [AlphaZeroBeta：面向市场中性投资组合的深度强化学习框架](https://doi.org/10.1186/s40854-026-00955-4) — OpenAlex 语义论文检索; 评估审计 / 可比性, 因子生成 / 表示学习, 模型训练 / 序列预测; LLM 因子生成, MLP 时序预测, 回测与可比性审计
- ` 9` [基于情绪增强技术指标与贝叶斯优化 LSTM 的股票收益预测：来自沪深300的证据](https://doi.org/10.54254/2754-1169/2026.35422) — OpenAlex 语义论文检索; 模型训练 / 序列预测, 评估审计 / 可比性, 因子生成 / 表示学习; MLP 时序预测, LGB 融合与筛选, Linear/Ridge baseline
- ` 9` [用于迷因股尾部风险检测的 LLM 情绪信号与词典情绪信号比较](http://arxiv.org/abs/2607.24072v1) — arXiv 高频时序预测; 因子生成 / 表示学习, 模型训练 / 序列预测, 评估审计 / 可比性; Linear/Ridge baseline, LLM 因子生成, MLP 时序预测

## 人工 Review Checklist

- 是否明确 `t` 时刻可见信息和预测 horizon？
- 是否只是已有 OB/SF/PLM/CS 的 rolling-window 变体，还是新增了观察坐标？
- 是否能沉淀为高频数据特征工程模板，例如订单不平衡、主动买卖、价格层记忆、事件时间或盘口形态？
- 应作为 predictor、gate/context、normalizer 还是 evaluation audit？
- 是否存在版权、付费源或全文再分发风险？
