研究
我的研究追问:因子模型给出的答案,包括因子、阿尔法和投资组合,哪些反映了数据中的信息,哪些只反映了模型衡量这些信息的方式。
因子模型用少数几个共同驱动因素来解释大量股票的收益。要说清一只股票的预期收益有多少归功于哪个驱动因素,模型得先判断两个特征方向是否真的不同、各自有多大。做这个判断的规则,就是尺子。
给每个特征一个权重再相加,每只股票就得到一个分数;这样的加权组合称为特征方向(它不是投资组合)。普通尺子(欧氏度量)只看方向的权重本身;特征尺子(格拉姆度量)则看这个方向给真实股票打出的分数:分数通常有多大,两个方向的分数在股票之间是否同高同低。
尺子,是模型用来衡量一个特征方向有多大、两个特征方向重叠多少的规则。两个价值信号若总是选中同一批便宜的股票,特征尺子会把它们算作重叠,普通尺子却把它们当作互不相关。
每篇论文都尽量固定其他一切,只改变一项选择,再看哪些结果随之改变。按下列顺序阅读,五篇论文从选择尺子出发,经过解读模型的阿尔法(模型的因子未能解释的那部分预期收益),最终落到投资者的持仓。
时间有限?请先读求职论文。
论文正文为英文,中文为作者译文,以英文原文为准。
求职论文
第 5 问(共 5 问):信息相同,持仓为何不同?
特征库与投资组合决策
信息相同,持仓却不同:复制或重新加权特征库中已有的特征,不增加任何信息,却会改变调好参数的投资规则的持仓,原因是模型对大额押注的惩罚,对被复制的主题收费更低。仅做主题均衡,四种这样的规则的目标持仓就变动了平均多空头寸总规模的 19%–28%。扣除交易成本后收益是升是降,取决于方法、成本水平以及缺失收益的估值方式。
展开详情
原因在惩罚项。岭惩罚(ridge:按系数平方收费的收缩方法,强度由历史数据调定)按特征库写出的列逐列收费。复制某一主题的特征,对该主题的收费就除以复制份数,拟合于是偏向这一主题。主题均衡按列数缩放各主题,让列多的主题不再占便宜。这四种是基于 153 个美国股票特征、调好参数的岭类组合方法;比较的是同一日期、重新调参后的持仓。而把月度岭回归的特征库实际从 39 个扩充到 153 个,对预测精度的影响小,估计也不精确。
工作论文
第 1 问(共 5 问):用哪把尺子?
基于特征的因子模型中识别问题的几何框架
数据相同,因子却可能不同:哪些特征方向算作彼此不同,取决于所用的尺子。本文从特征在股票之间的分布与重叠中取得这把尺子,并在其上建立识别、无套利约束与推断。
《特征空间度量》较早、范围较宽的版本 · 源自博士论文 · SSRN 署名为 Yang Liu。
展开详情
从数据中取得尺子:用特征在股票之间分布与重叠的长期平均来衡量。本文的估计量称为无套利 IPCA(NA-IPCA):它在这把尺子上重建工具化主成分分析(IPCA),并为截距可承载的预期收益设上限。名称中的“无套利”即指这一上限。换成普通尺子、截距上限又宽松到不起作用时,它就退化为 IPCA。在按美国股票校准、真实定价方向按设计落在特征变动最大的那些方向上的模拟中,NA-IPCA 找回了这些方向(子空间距离约 0.01;0 表示完全找回,约 1.73 表示方向完全错误);不含截距块的 IPCA 基准则偏到约 0.73。这一设计没有把尺子的作用与缺失的截距块分开。在论文的效率与压力测试模拟中,IPCA 同样接近真值,两者在模拟中的样本外拟合几乎相同。
英文题目 A Geometric Framework for Identification in Characteristic-Based Factor Models · 论文页面 · PDF(英文) · SSRN:10.2139/ssrn.7013178
第 2 问(共 5 问):尺子决定了什么,又有多可靠?
因子模型中的特征空间度量:识别与推断
拟合收益相同,拆分却不同:尺子决定收益如何归于潜在因子(从数据中推断出的共同驱动因素)、可观测因子(如市场因子)与截距(本模型中没有被任何因子解释的那部分预期收益)。当尺子由数据估计时,它的误差也必须计入置信区间。
SSRN 署名为 Yang Liu。
展开详情
尺子决定拆分,不决定拟合。拟合收益完全相同的模型,可以把收益以不同方式归于潜在因子、可观测因子与截距。R² 无从裁决,只能靠约定。尺子由同一批数据估计,它的误差必须计入置信区间。在一个为隔离这一机制而设计的简化模拟中(12 个特征、100 只股票、960 期、重复 2,000 次,并非按美国数据校准),忽略这一误差,本应 100 次中有 95 次包含真值的区间,实际只有约 89–92 次包含;计入之后约为 94–95 次。
英文题目 Characteristic-Space Metrics in Factor Models: Identification and Inference · 论文页面 · PDF(英文) · SSRN:10.2139/ssrn.7445120
第 3 问(共 5 问):更小的阿尔法意味着什么?
如何解读估计的定价误差:来自基于特征的收益预测的证据
尺子相同,目标却不同:阿尔法变小,可能是因为因子解释得更多,也可能是因为因子要解释的预期收益估计(目标)变了。本文在同一批股票上交叉搭配各模型的预期收益估计与因子,发现两种训练方式之间阿尔法的较大差距主要来自目标不同。
展开详情
在本文的比较中,更小的阿尔法主要反映被解释的对象变了,而不是因子解释得更多。基于特征的模型给出的预测,可以拆成因子能生成的部分和剩下的阿尔法。同一个模型训练两次,一次对各股票等权,一次按市值加权。两者用同一把尺子、在同一批股票上、按同一组计分权重衡量。等权版本阿尔法的均方根为每月 117.37 个基点,市值加权版本为 77.27 个基点。只给等权版本换上另一版本的因子,其阿尔法仍为 116.67;只换上另一版本的预期收益估计,则降到 75.02。每年挑出阿尔法较小的模型,对预测精度帮助不大。把阿尔法成分适度调小,在 24 个检验设定中有 20 个比全部保留预测更准,但只有 8 个比两个模型预测的简单平均更准。这些证据是探索性的。
第 4 问(共 5 问):预测相同,组合为何不同?
特征几何与投资组合选择
预测相同,组合却不同:组合规则里有一个为数值稳定而设的固定小常数,它写在尺子的单位里,换尺子就改变了每个个股头寸被压低的程度;只去掉这个常数,权重差距几乎消失。
展开详情
原因在一个固定的小常数。组合规则在因子的预测相对其风险较高时多持有该因子;为了数值稳定,它还给每个因子的风险加上一个固定的小常数(岭项),让每个因子都少持有一点。这个常数写在尺子的单位里,尺子一换,同一个数压低的就是不同的个股头寸。在基于 132 个特征的美国股票滚动估计中,几乎相同的预测给出了不同的权重;只去掉这个常数,最大相对权重差距就降到约 0.01%。另一项检验在同一次 NA-IPCA 拟合内进行:把截距也纳入预期收益,594 个月的年化夏普比率(每单位波动的平均收益,未计交易成本)由 0.39 升至 2.51;2007 年 10 月以来,用上截距带来的平均收益增益估计并不精确。这项检验与《解读定价误差》的模型、目标和样本都不同,因此两者既不相互印证,也不相互矛盾。
英文题目 Characteristic Geometry and Portfolio Choice · 论文页面 · 幻灯片(PDF,英文)
博士论文
无套利 IPCA:横截面资产定价框架
博士论文提出无套利 IPCA(NA-IPCA);《基于特征的因子模型中识别问题的几何框架》阐述其背后的理论。英文题目 No-Arbitrage IPCA: A Framework for Cross-Sectional Asset Pricing。帝国理工学院,2026 年。全文可应要求提供。博士论文中的估计量已在 NA-IPCA 工具包中实现,见数据与代码。