12.1 背景介绍
在金融市场中有很多交易标的(板块),有时需要进行交易品种(板块)的相关性分析,这样可以帮助挑选相关性高的品种(板块)进行对冲操作,或通过相关性分析监控整个市场的系统性风险。在资产组合层面,也需要对不同的组合进行相关性分析,达到组合的异构性和分散化。
变量间的相关性涉及变量或变量组间的多种相关性,下面分别阐述。
(1) 两变量间的相关性。最简单的就是两个变量之间的相关性,通常会定义一个相关系数来量化两个变量之间的相关程度。它常被用于衡量两个指标的相关性或相似性,如在地震勘探中,要对比两个地震记录波形的相似性;在无线电技术中,要将接收信号与某己知信号对比,根据二者之间的相似性做出判断。此外,在对多个变量间的相似性进行分析时,需要根据一定的标准对这些变量进行筛选,而两个变量间的相关性是多个变量间相关性分析的基础。
(2) 多元变量的整体相关性。如果考察的变量是一组变量(多于两个变量),则需要考察这一组变量总体的相关性,也可称为多元整体相关性分析。一组变量的多元整体相关性常常采用广义相关系数(相对于两个变量间的相关系数而言)来量化,有时也将广义相关系数称为混合相关系数。例如,对于获得的描述研究对象属性的多个变量指标,首先需要了解这组变量整体是否相关,进而确定是否需要对变量间的相关性作进一步的分析。
(3) 复相关性。复相关性分析指多元变量组中某一变量与其他剩余变量间的相关性分析,其量化指标是复相关系数(或多重相关系数)。这种相关性显然不同于多元变量整体相关性,涉及的是一个变量与一组变量之间的相关性问题。
(4) 偏相关性。在讨论一组变量Y1,Y2,X1,X2,… , Xm 内部之间的相关性时,涉及一组变量里某两个变量如YI与Y2间的相关性。这种相关性不同于单独两变量间的相关性,因为YI与Y2间的相关性有一部分可能会受到其余变量X1,X2 ,…,Xm的共同影响,当把这种影响按照一定的统计原理从YI与Y2中消除后所作的相关性分析就是偏相关性分析,常用偏相关系数来量化这种偏相关性。
(5) 典型相关性。该相关性就是将讨论的变量分为两组(一般每组变量多于两个)来考察这两组变量之间的相关性,或者直接讨论两组变量之间的相关性,例如讨论农作物生长状态指标体系(一组变量)与土壤、肥料、管理等状态指标体系(另一组变量)之间的相关性就属于典型相关性分析。典型相关性分析常用典型相关系数来量化。
明确了变量间各种相关性分析讨论的范围、概念和本质,可以用这些相关性概念或者相关系数去分析问题、解决问题。
两变量间的简单相关性是最基础、最重要的,也是实践中经常用到的,下面详细介绍。
利用相关系数衡量两个变量之间的相关性的价值在于定量刻画两个数据向量X=(X1,X2,...Xn)T 和Y=(Y1,Y2...,Yn)T的相似程度。从几何上粗略地讲,将两个向量平移至相同起点,如果它们位于同一条直线上,则有理由认为二者完全相似。如果两个向量不重合,但二者间的夹角较小,也可以认为二者较相似。因此,用两向量夹角(希尔伯特空间)的正弦值衡量相似性是科学的,即有:

通常称上式为两变量的相似系数。
另一方面,两个变量X和Y可能是两组数据向量,如
是取自某两个随机变量X和Y的总体抽样数据,这时对衡量它们的线性相关程度可以作如下思考:先由一组数据如
确定一条拟合直线α+bx,然后再考察数据组
到该直线距离的平均值的最小性:

为了方便计算,将绝对值符号去掉,代之以平方和:

如果找到某个参数α、b使得上式中的Q=0,则可以认为X和Y完全相同,否则以Q值的大小来衡量其相关程度。为了求出Q的值,可应用微分中值定理求解。通过推导(这里略去推导过程,有兴趣的读者可以参看相关文献),问题等价于用公式

衡量X与Y的相关程度,上式被称为相关系数。显然|P1|≤1,|P1|的值越大,说明X和Y越相关(相似);|P1|的值越小(越接近于零),说明X和Y越不相关(不相似);当|P1|=1时,表示X与Y线性相关(完全正相关或完全负相关);当|P1|=0时,表示X与Y最不相关。
最后,还可以从概率出发考察变量X与Y的相关性。此时将X看作某一指标的随机变量,
看作样本点。设X和Y是两个随机变量,两个变量之间的线性相关程度可以用相关系数

来度量。由概率可知:(l)当0≤P1≤l时,大的X值趋于同大的Y值相关联,小的X值趋于同小的Y值相关联,表明变量X与Y 间正相关;(2)当-l≤P1≤0时,大的X值趋于同小的Y值相关联,小的X值趋于同大的Y值相关联,表明变量X与Y之间负相关; (3)当P1=0时,表明Y的取值几乎完全不受X值的影响,变量X与Y之间不存在线性相关;(4)当P1=1时,变量X与Y之间完全正相关;(5)当P1=-l 时,变量X与Y之间完全负相关。后两种情况表明变量X与Y之间实质上是函数关系。需要说明的是,即使出现情形(3),也只能说明变量X与Y之间不存在线性统计关系,但可能存在非线性统计关系。
在实际应用中,判断变量X和Y之间是否存在线性相关性或相关程度有多大,需要通过统计样本计算判断。这种计算带有一定的随机性,样本容量越小,随机性越大。因此,相关系数的推断涉及显著性检验问题,对总体相关系数P1=0的假设检验就是对总体是否相关做出推断。
有了这些理论基础,下面给出简单线性相关分析统计检验过程的步骤。
(I) 假设检验问题H0 : P1=0 。
(2) 计算相关系数。
(3) 计算统计量:

其中,统计量t~t(n-2)。给定显著性水平α ,查t分布表以确定相应的临界值
。
(4) 判断。如果通过计算的值满足 |t|<
,则接受假设H0,表明变量X与Y之间没有线性相关关系;否则拒绝假设H0,变量X与Y之间有线性相关关系。至此,大概介绍了一些相关性分析的背景知识,下面会讲解相关性分析的具体计算如何通过MATLAB实现。