第十章 孟加拉国的黄油产量预测标普500(S&P500)指数收盘价

第十章  孟加拉国的黄油产量预测标普500(S&P500)指数收盘价

我一直认为,太多的对于价格和成交量行为,也就是技术分析派的那些东西的研究是匪夷所思的。你能想象仅仅是由于一家公司的股价在上周或者上上周上涨就贸然买入它吗?当然,如今这种量价分析泛滥的原因是由于在如今这个电脑时代,我们可以获得和它们相关的大量数据。所以,并不是因为这些研究真的有什么价值;而仅仅是因为数据就在那里,而且学者们也非常努力地学习各种管理数据所需要的数学知识。一旦人们学会了这些技能之后,不去使用它们似乎就有罪似的,即使这些技术并没有什么价值或者甚至有负面价值。正如我一个朋友所言,对于一个拿着锤子的人来说,所有的东西看起来都像是钉子。

一一沃伦·巴菲特, 《格雷厄姆和多德都市的超级投资者们》

(The Superinvestors of Graham-and-Doddsville)

巴菲特1984年在哥伦比亚大学的著名演讲

1995年,大卫·莱因韦贝尔(David J. Leinweber)开始研究最能预测美国股市运行的方法。他首先选取标准普尔500(S&P500)1983-1993年十年的年度收盘指数。之后他找到联合国发布的国际数据库,包含所有140个成员国利率、经济增速以及失业率的变动情况。通过使用“回归分析”的统计方法,莱因韦贝尔找到了最能预测S&P500指数年度收盘价的序列数据。

回归分析是统计学家用来揭示两个或多个变量之间线性关系的主要工具。关于它的真正提出者,存在一些争议。它最早由法国数学家阿德利昂·玛利·勒让德(Adrien-Marie Legendre)以“最小二乘法”(methode des moindres carres)的方式于1805年发表。但是在1795年,年仅18岁的德国数学家及物理学家卡尔·弗里德里希·高斯(Carl Friedrich Guass)被认为建立了最小二乘法的基础。而高斯直到1809年才发表了这一方法,所以,从官方来看,勒让德应为最早的提出者。

描述回归分析解释力的指标是“R方”。两变量之间如果有完美的相关关系的话,R方就会是1或是100%。相关关系较强的话,R方通常要在50%以上。如果R方为0则意味着两个变量之间没有任何关系。比如,一个关于人体身高和体重的回归分析显示一个很强的正相关关系,R方接近0.7或70%。如果你越高,那么有可能你会越重。

在对联合国140个成员国的数据序列进行了回归分析之后,莱因韦贝尔有了一个惊人的发现。一个国家的乳制品产量竟然可以解释标普500总回报指数75%的变动,这简直非常不可能。这个变量是什么呢?就是孟加拉国黄油产量。莱因韦贝尔知道他应该找了一条正确的道路。或许,他可以扩大乳制品产量的国家选择范围来使回归结果变得更好。如果再加入奶酷的产量并且把美国的数据也加入其中呢?莱因韦贝尔查询了这些数据。令人惊讶的是,R方增加到了95%的准确度。但是是什么内在因素驱使得到了这样的结果呢?通过加入第三个变量一一羊的产量一一莱因韦贝尔发现,他可以解释1983年至1993年标普500总回报指数99%的变动。非常接近于完美。莱因韦贝尔并没有急于发表他的研究。这些结果看起来好到不大可能是真的。记者们偶然发现了莱因韦贝尔的研究,同时这篇研究还走进了斯坦福研究生商学院的课堂以及其他许多地方。莱因韦贝尔开始接到投资者打来的电话,询问孟加拉国的黄油产量状态。随着图表由于一次次复印而不断褪色,莱因韦贝尔决定写出这篇论文并发表。

当然,莱因韦贝尔做这篇研究的目的是作为一个玩笑来说明数据挖掘的危险之处。数据挖掘是分析极大量的数据,从中找到数据序列之间相关关系的一种方法,但这种关系往往仅仅是选取数据这段时间的巧合。比如说,孟加拉国的黄油产量几乎无法解释标普500总回报指数在1983年之前或者1993年之后的变化。莱因韦贝尔故意设计了这项研究来阐述一个几乎不可能预测标普500总回报指数的变量也可以在回归分析中得到很强的相关关系。这仅仅是由于巧合而产生的联系,他做研究时当然不知道哪个变量会是预测标普500总回报指数的最佳预测指标,但是他知道只要有足够多的数据序列,总有一些相关关系会出现的。孟加拉国黄油产量和标普500总回报指数之间产生的相关关系仅仅是运气的结果,这一结果非常值得怀疑。

本书的目的就是将我们之前考虑过的价格和质量衡量指标结合起来,来构建一个稳健的量化价值投资策略。在我们构建这个投资策略之前,我们要先考虑这个研究是否可信。这项投资策略是否符合经济逻辑?我们可不想做出一个我们自己的基于孟加拉国黄油产量的投资策略。实际上,找到令人惊喜的模拟投资结果往往非常容易。而找到真正能在真实世界中在未来表现良好的投资策略则非常困难。在这一章,我们将讨论需要避免的陷阱并提供一个解释结果的框架。