按公司与市场状态调整的 NLP 阿尔法信号

一份自然语言处理(NLP)研究计划:让文本信号随公司特征和可观测的市场状态而变,并输出经过校准的预期收益估计及其置信度,而不只是排序。

计划中 · 项目 · 研究计划 · 独立研究备忘录,2026 年 6 月 · 执行摘要(1 页)、研究计划(2 页)、技术附录(7 页)· 全部项目

我撰写的内容

  • 问题诊断:常用的已发表文本信号方法(SESTM 式监督情绪模型、Loughran–McDonald 词典、仿商业数据商的情绪评分、嵌入模型)有三个共同假设:同一段文字对每家公司、在每种市场环境下含义都相同,而且输出只是排序(执行摘要第 1 页;研究计划第 1 页)。
  • 四种模型设定及估计方案(附录 §§B–E,第 1–3 页):在 200–500 个主题或事件聚类层面加入公司偏移项,取低秩形式(s_{i,c} = s_c + e_i' W h_c,W = UV'),并向全市场的情绪映射收缩;加入加性的市场状态项 \beta_c' z_t,状态变量少而连续、事前可观测(4–6 个,不估计隐马尔可夫状态);用保序回归或 Platt 映射,在 Huber、分位数或 Student-t 损失下把得分校准为 (\hat\mu_i, \hat\sigma_i);按事件类型估计信息衰减的半衰期。
  • 一套按时点设计的生产方案:从数据采集到再训练共八个环节,每个环节都标明主要的失效方式(附录 §F,第 4 页);漂移监控(群体稳定性指数、KS 检验、滚动信息系数(IC))与冠军/挑战者式再训练;带版本号的交付约定(研究计划第 2 页)。
  • 分五个阶段、逐级把关的首期实施方案,每个阶段都有成功标准;以及对风险与应对措施的自我审视(附录 §§I–J,第 6 页)。

对投研团队的价值 已发表的文本策略,结果大多未计交易成本,换手率高,又偏向小盘股;基于大语言模型的结果,如果模型“见过”未来的数据,还可能被高估。投研团队需要的是按时点生成、写明持有期限和置信度的信号,一份说明它如何构建的记录,以及能及时发现信号失效的监控。这份计划的重心正是把信号交付给投研团队这一环节,而不是回测。

大语言模型的位置 在这份计划里,大语言模型只作为后续加入的输入,供可解释的评分器使用,而不是端到端的“神谕”;前视污染被视为首要的建模约束。盲测(对隐去公司名称的新闻,如“Company A”,进行打分,检验模型读的是文本内容还是记住了公司)与第 1–2 阶段同步进行(附录 §§I、K,第 6–7 页)。

计划中设定的方法 金融文本分析 低秩与收缩估计 概率校准 时点一致的防泄露控制 漂移监控(设计)

阅读提示。 这是一份研究计划,不是研究结果。文中没有我本人的任何回测;文件中的业绩数字都是其他作者已发表的结果,除非另有说明,均未计交易成本。文件提到我复现过四种已发表的基线方法,但没有记录这些复现所用的数据来源、样本期或结果,因此本页不报告任何复现结果,并把有据可查的复现列为计划的第 1 阶段。这是我个人的独立工作,与任何机构或雇主无关,也未获其认可。文件中标注 OURS 的是我提出的方案,标注 PRIOR-LIT 的是其他作者已发表的结果(除非另有说明,均未计交易成本),标注 FUTURE 的是后续拓展;文中的“we”“our”及“our mandate”指本计划的范围(从文本到信号),全文由我独立完成。

图表 1:三个假设,四个方向

现有流程的假设 计划的做法 设定
语言不随公司而变:同一个词对每家公司的收益含义相同 1. 在主题或事件聚类层面按公司调整情绪,并向全市场映射收缩 s_{i,c} = s_c + e_i' W h_c,W 为低秩(附录 §B,第 1 页)
语言不随时间而变:同一个词的收益含义在各种市场环境下都稳定 2. 在聚类层面加入一个加性项,随事前可观测的市场状态变化 s_{i,c,t} = s_c + e_i' W h_c + \beta_c' z_t(附录 §C,第 2 页)
只输出排序:得分能给股票排序,却不给幅度和置信度 3. 在对厚尾稳健的损失函数下,把得分校准为预期收益估计及其置信度 (\hat\mu_i, \hat\sigma_i)(附录 §D,第 3 页)
生产环节:时间戳或实体匹配造成的信息泄露,以及不易察觉的信号衰减(附录 §H,第 6 页) 4. 一条按时点设计的流程,从多来源文本一直到带版本号的交付约定,内置泄露筛查、衰减监控与再训练 八个环节(附录 §F,第 4 页)
研究计划中四个研究方向的原文版式(英文),四个方框均标注 OURS:1. 在主题或事件聚类层面按公司调整情绪,公司项为低秩并向全市场映射收缩;2. 通过聚类层面的可加项,让情绪随事前可观测的宏观状态而变;3. 从排序到校准,在 Huber、分位数或 Student-t 目标下给出预期收益估计及其置信度;4. 从多来源文本到交付的按时点生产流程。(在新标签页打开大图)
研究计划中四个方向的原文版式(英文);其中“Why it matters”各条是预期效果,有待第 2–5 阶段检验。资料来源:研究计划,第 2 页(PDF,仅供学术用途)。

要点。 每个方向放松一个明确的假设,并各自给出模型设定和估计方案;目前都还没有估计。

图表 2:已完成、有描述、计划中、后续拓展

状态 内容
已完成 三份文件(2026 年 6 月):四种模型设定、估计方案与推导;按时点设计的生产、监控、再训练与交付方案;对风险及应对措施的自我审视。
有描述、无实证记录 附录(§H,第 5 页)以定性方式描述了对四条基线流程(SESTM 式、Loughran–McDonald 词典、仿商业数据商的情绪评分、嵌入基线)的复现,但没有说明所用数据来源、样本期或股票范围,也没有报告我本人的任何数字;首期实施计划仍把基线复现列为第 1 阶段(§I,第 6 页)。
计划中、尚未实施 估计公司偏移项、市场状态项、校准映射与衰减半衰期;盲测(隐去公司名称的输入)验证,与第 1–2 阶段同步(附录 §I,第 6 页);附录中所有“计划中的诊断”。
后续拓展 以大语言模型嵌入作为特征;按时点的检索增强生成;考虑事件类型的工具与智能体工具,均须通过同样的按时点验证(研究计划第 2 页;附录 §K,第 7 页)。

要点。 目前已有的是设计:模型设定、估计方案、生产方案和自我审视。本页没有任何实测结果。

图表 3:逐级把关的首期实施

阶段 内容 成功标准
1.基线 复现 SESTM、Loughran–McDonald 词典、仿商业数据商的情绪评分和嵌入基线;严格时点一致、滚动前推(walk-forward)、次日开盘执行 得到稳定的词表和可比的样本外排序优势
2.按公司调整 从单词改为主题或事件聚类;加入低秩的公司偏移项,并按特征收缩 样本外 IC 较第 1 阶段有正的提升,且集中在小盘股和特质风险较高的个股上
3.按市场状态调整 加入加性的事前状态项(连续状态,不用隐马尔可夫模型) 按市场状态分层的 IC 改善,状态转换期间更稳定
4.校准 用保序回归或 Platt 映射,在稳健目标函数下把得分映射为 (\hat\mu_i, \hat\sigma_i) 校准曲线可靠,区间覆盖率达标
5.验证 完整的信号报告:IC、命中率、衰减、换手率、容量代理、小盘集中度、行业中性、因子暴露;未计成本与扣除成本两种口径 信号带来增量信息、与已有因子正交,扣除成本后收益仍为正,且各项暴露均有记录

IC 即信息系数(信号与随后收益的秩相关)。资料来源:技术附录 §I,第 6 页(PDF,仅供学术用途)。

要点。 如果某项拓展相对上一阶段没有带来样本外、扣除成本后的增益,就报告这一负面结果,不上线这项拓展。

交付约定。 每个信号交给投研团队的内容:信号编号、截至时间戳、持有期限、\hat\mu、置信度与覆盖范围(研究计划第 2 页),并附上事件半衰期 \hat\tau(附录 §E,第 3 页),以便让持有期与信息衰减的快慢相匹配。

延伸阅读

  • 《特征库》:计划中的公司嵌入由股票特征构成,正是这篇论文研究的输入。
  • 相关项目:NA-IPCA 工具包,同样的审计记录习惯,用在估计代码上。
  • 相关项目:AI 辅助研究工作流程:计划只把智能体工具当作研究加速手段,并要求其通过同样的按时点验证(附录 §K,第 7 页)。