附录A 理解这些公式

附录A 理解这些公式


本附录将对本书中所提到的公式进行详细地介绍。

标准差

标准差是一种用来度量相对于均值的偏离度的方法。其公式为:

其中:

n 为该组中的样本数量

Xi 为该组中的第i 个样本

μ 为该组的n 个样本的均值

σ 为该组的这些样本的标准差

该公式看上去有些复杂,实际计算起来其实是很简单的。你首先把该组中的所有值加在一起,再除以样本数量,得到这些样本的均值。接下来,对均值减去每个样本值后的差求平方,再把这些平方值加在一起,除以样本数量减去1后的值,就得到一个被称为方差的值。最后,你对方差求平方根,就得到了标准差。你可能见过分母为n ,而非n-1时的这个公式。该公式在计算诸如世界上所有人的身高之类的总体时会用到。当你在计算某个样本的标准差时,比如所有美国人的身高时,你就需要用n-1的值。当样本规模很大时,两者之间的差异微乎其微。

在本书中,这些样本通常为某个时间段内的收盘价。20 天收盘价的标准差,就是把过去20 天的收盘价作为该组样本,并使用上面的公式来计算得到。但也可以对其他样本计算标准差,比如价格波幅(日最高价减去日最低价) 。当这些上下波幅的样本值很小时,其标准差也会很小。当样本值很大时,其标准差也相对较大。因此, 若某笔交易处于市场平稳期或趋势期时,这些收盘价或价格波幅的标准差,也会随波动率而扩大或收缩。

标准差的显著性,或称为一倍标准差值,是指在一个正态分布的组(看上去像一个钟型曲线)中,该样本组中接近68% 的值,都位于均值上下一倍标准差之内所包含的区域内。均值上下两倍标准差的区域(一倍标准差乘以2) ,则包括了约95% 的样本; 而3 倍标准差区域,则包括了约99.7% 的样本。并不一定必须是正态分布,才能使用标准差公式。对于其他的分布而言,标准差仍能提供一种对偏离度的度量结果。

吹动率的度量方法和比较

除标准差之外,平均波幅和平均真实波幅是另外两种在交易系统中常用的波动率度量方法。平均波幅和平均真实波幅之间的差异在于,平均真实波幅会在当前K 线存在跳空时,将上一根K 线与当前K 线之间的距离加进去。平均波幅只包括了每根K 线的最高价和最低价之间的距离,然后求平均值。我发现在使用中,平均真实波幅和平均波幅并没有什么差异。因此我建议只使用一个: 平均波幅。但用波幅和标准差来分别度量波动率时,结果是有很大差异的。

最主要的差异是,标准差考虑了方向性的波动率,而平均波幅并没有。图A-1显示了两个数据流,在这18 个K 线中,平均被幅值都是一样的,因为这两个数据流中每天的最高价和最低价之间的距离是不变的。但标准差计算结果显示,第一个数据流的标准差会大许多,因为这些收盘价是有趋势的。在这个例子中,标准差方法对于真实波动率的捕捉,会比平均波幅方法更好。当我在使用波动率过滤器时,我通常会同时用这两种方法都去测试一下。


相关性

相关性是用来衡量两个数据流朝相同方向变化的程度。有一个被称为皮尔森相关系数的数学公式,用来度量相关性的值,用r 来表示,其值介于-1 和1 之间。如果两个数据流的相关系数为1,则它们是完全正相关的,会同涨同跌,尽管其变化率可能并不完全一样。当相关系数为-1时,它们是完全负相关的,其中一个涨,另一个就会跌。和正相关一样,它们的变化率可能并不完全一样。若相关系数接近于0,则这两个数据流是不相关的,它们的变化会相互独立。图A-2 显示了几组数据流,以及它们对应的相关系数。


其中:

n 为该组中的样本数量

z 为数据流1 中的第i 个样本

yi 为数据流2 中的第i 个样本

r 为皮尔森相关系数

这又是另一个看上去很复杂的公式,但它可以用两个数据流(数据流x 和数据流y) 来很容易的计算出来。如果这两个数据流是对应的,那对于这两列数据,你需要做三个运算: 把两个数据点的积加起来,即;把x 点加起来,即; 再把y 点加起来,即。然后再把它们代入公式中来求r 。

相关性有许多用途。在附录B 中,可以用它来表示同一组中不同商品之间的相关度。它还可以用来表示某个数据流的序列相关性。序列相关性是指在该数据流中,之前的数据对之后的数据的影响程度。如果某个数据流是高序列相关的,那该数据流中会出现这样的情况: 上涨之后继续上涨,下跌之后继续下跌。可以利用序列相关性来盈利。假如把每笔交易的盈利都按顺序放入一个文件中,并计算该数据流与其自身滞后一期的数据,流之间的相关性,如果这两个数据流的相关性是正的,则意味着,盈利交易之后,倾向于继续出现盈利交易; 而亏损交易之后,倾向于继续出现亏损交易。在真实交易中,当你有一笔不错的盈利交易时,你可以扩大交易规模,以利用后续预期会出现的盈利交易;而如果你遭遇了一笔亏损交易,你可以缩小交易规模,或者干脆暂停交易。

在交易中,可能相关性的最好用途,是用来展示资金管理中分散化的效果。如果两个交易变量的连续收盘价之间的差异是服从正态分布的,那用这两个变量之和所形成的第三个变量就会有下列所示的标准差:

其中:

σ1 为第一个变量的收盘价变化的标准差

σ2 为第二个变量的收盘价变化的标准差

σ3 为新变量的收盘价变化的标准差

r12 为这两个变量的相关系数

假设这两个变量是你组合中的交易在每天中的价格变化(希望其方向对你的交易是有利的) 。第三个变量就为该组合的值。组合值的标准差反应了该组合的变化,要么上,要么下。不妨让我们给这些变量赋一些值,再来看看结果如何。如表A-1 所示。

在表中的第一行,变量1 和变量2 是完全相关的。当变量1 的收盘价上涨时,变量2 也会上涨。当变量1 的收盘价下跌时,变量2 也会下跌。它们的变化方向是完全相同的。由于变量1 和变量2 的标准差都相等(值都为5) ,则组合的变动相当于你在交易2 份相同的交易(10 点) 。

第二行表明了传统资金管理方法中使用分散化的原因。当变量1 和变量2 不相关时,该组合的变动会小于两个变量的标准差之和,但比其中任何一个变量都大。一些人据此声称,如果你的组合是用两种不相关的资产来完全分散化的,那你的风险实际上会降低。这个由两个变量所构成的组合表明,风险并不会下降。在组合中每额外增加一个不相关的变量,组合风险都会上升,只是上升的幅度在下降。

最后一行显示了一个交易的奇迹。如果你能成功的交易两种时时刻刻都完全负相关的资产,那你就不会有风险。像美元指数和日元这两种商品就是高度负相关的,但如何找到一个策略,来同时做多它们,或同时做空它们,却是一个问题。

上面所示的双变量公式,很容易就能扩展为任意多个变量时的情形,交易任意数量的合约/股份的多头或空头头寸。