第4章 高频数据
交易和报价信息往往以I 级或II 级格式(Level I 、Level II ) 发布。LevelI 报价可以包括最优买价、最优卖价、最优买盘数量、最优卖盘数量、最新交易价和最新交易量。Level II 报价包括对买卖盘的所有变化,还包括新到达限价订单或在价格与市场价格差距过大时取消的订单。本章详细介绍了数据报价和抽样方法,并将高频数据与其对应的低频数据做了对比。
什么是高频数据
高频数据, 也被称为分笔数据( tick data) ,是实时市场活动的记录。每次客户、经销商或其他实体发布所谓的限价订单,以q 的价格,用有特殊安全代码股票报价器( ticker ) 购买s件X, 买盘报价qbtb记录为在tb 时,购买Sbtb件X。分笔数据记录以一种不同的方式将市场买卖盘合并在内,这一点在本章也有详细的讨论。
当新到达的买盘报价qbtb比前面所有的有效买盘报价都相对要高时,qbtb则被视为tb 时的"最优买价" 。同样地,当交易实体挂出一张限价买单,要在价格q 卖出s 件X 时,卖盘报价qata被记录为在ta 时间卖出Sata件X。如果最新的qata比之前所有对证券X 的报价都低,qata被视为ta 时间的"最优卖价" 。
报价自到达的那一刻会发生什么,很大程度上取决于发布订单的交易场所。在交易所中直接发布的最优买价及最优卖价,会向所有的交易参与者及其他跟踪报价数据的各方公布。当新的最优买价超过交易中已经实施的最优卖价时,即qbtb ≥qbtb时,大多数交易所会立刻"撮合"这些报价,以在tb 时原有的最优卖价qata来执行交易。相反地,当新到达的最优卖价小于目前的买盘价格,即qata≤qbtb 时,交易以tb 时原有的最优买价qbtb来执行。
大多数暗池交易通过"交叉价差"来撮合买价和卖价,但可能不会公布新到达的报价(因此有了"暗池"这个神秘的绰号) 。同样地,指向交易商间网络的报价可能会或不会公布给其他市场参与者,具体情况要根据交易场所而定。
市场买卖盘以"最终交易"信息的方式提供高频数据。与以某一价格购买规定量证券的限价订单不同,市价订单是为了在交易场所"发布"的最优价格购买规定量的证券。因此, 市价订单在现有最优买价或最优卖价的情况下会立即执行,市价买单在最优卖价时执行,市价卖单与最优买价撮合,这一交易在报价数据中被记录为"最新交易价"以及"最新交易量"。
一个大额的市价订单可能需要与一个或几个最优报价撮合,产生几个"最新交易"数据点。例如,如果新到达的市价买单量比最优卖价的量小,最优卖价在大多数交易场所会继续有效实行,但最优卖盘数量会被减少,以反映最优卖价报价与市价订单是相匹配的。当新的市场买盘比相应的最优卖盘数量大,市场买卖盘会完全消化最优卖价,然后会继续与下一个可行的最优卖价进行撮合, 直到市价订单都被执行。剩下最低价格的报价将成为交易场所中的现有最优卖价。
大多数限价订单和市价订单都被所谓的"手数" (lot sizes) 下单:一定单位的增量,被称为一手( lot) 。在外汇交易中,目前标准的交易批量单位为500 万美元,相比几年之前高调的经纪人所吹嘘的2500 万美元的最低标准大大降低了。在股票交易所,一手可以低至一股但暗池交易或许仍旧要订单的规模最少为100 股。针对总数并非一手的整数增量订单,被称为"零星交易" (odd lot ) 。
通过经纪人发布的小型限价订单和市价"零星交易"订单可能会被经纪人与规模较大的订单聚合或"打包"在一起,以在订单的执行场所得批量折扣。在此过程中,经纪人可以"压住"报价,不将报价传输至交易地点,同时延缓客户订单的执行。
高频数据如何被记录
最高频率的数据是连续的"分笔数据",即最新到达报价、交易、价格、买卖盘大小和成交量信息的集合。分笔数据通常具有以下属性:
● 时间戳( timestamp);
● 金融证券识别码;
● 表明它具有哪些信息的一个指示器:
▲买价(bid price)
▲卖价(ask price)
▲申买量(available bid size)
▲申卖量(available ask size)
▲最新交易价(last trade price)
▲最新交易量(last trade size)
▲特有证券数据,如期权的隐含波动率;
▲市场价值信息,如价格的实际数值、申买和申卖的量或规模。
时间戳记录了报价起始的日期和时间,可能是交易所或经纪自营商发布报价的时间,也可能是交易系统已收到报价的时间。在撰写本书时,纽约的订单报价从下单客户到交易所并在订单收到确认时返回客户的标准"往返"( round-trip) 行程时间为15 毫秒或更短。若经纪人无法以目前的标准速度来处理订单,就会被客户解雇。因此,成熟的报价系统会将毫秒甚至微秒纳入时间戳。
报价的另一部分是金融证券的识别码。在股票中,这一识别码可以是一个代码,对于在多个交易所同时交易的股票来说,识别码可以是股票代码加上交易所代码。对期货来说识别码可以由标的证券、期货到期日和交易代码组成。
最新交易价显示的是证券交易最近一笔交易的成交价格。最新交易价与买价和卖价不同。这是因为当客户挂出了一个优惠的限价订单,而经纪人在公布客户报价之前就立刻将这一订单进行撮合时,这种价格差就会产生。最新交易量显示了最近一笔交易的实际成交规模。
最优买价指的是证券在市场上卖出时可获得的最高价格 ; 最优卖价指的是某一时刻购买证券可获得的最低价格。除了最优买价和最优卖价,报价系统可能会发布"市场深度"的信息:买卖报价会以比最优买价和最优卖价较差的价格在交易场所发布,与交易场所"订单簿"上记载的买价和卖价相对的每个买单和卖单的大小也会被公布。市场深度信息、有时被称为Level II 数据,可能是付费才能订阅的信息; 相比之下,最优卖价、最优买价、最新交易价和最新交易量信息( LeveI ) 可能只是象征性收费。
图4-1 显示了由纽约证券交易所为SPDR S&P500 交易型开放式指数基金( ETF,股票代码Spy) 记录的30 秒Leve门高频数据,时间为2009 年11月9 日14:00: 16:400 - 14:02:00:000 GMT。图4-1a 为报价信息:最优买价,最优卖价和最新交易信息,而图4-1b 则显示了相应点位的成交量大小(最优卖盘量、最优买盘量和最新交易量) 。


高频数据的属性
关于高频证券数据的研究已经有很多年了。但是对于学者和从业人员来说,还是非常新奇的事物。不同于金融研究和相关应用中常使用的每日或每月的数据集,高频数据有着独特的性质,对于研究者来说同时存在优点和不足。表4-1 总结了高频数据的性质。每个性质及其优点和缺点都会在接下来的内容里进行详细讨论。

高频数据是巨量的
表4-1 所展示的Spy 的约两分钟分笔数据样本包含2000 个Level I数据的观测量: 最优买价和交易量、最优卖价和交易量,最新成交价和成交量。表4-2 总结了由纽约证交所高增长板块所提供的Spy 数据点的细目,时间为2009 年11 月9 日,14:00: 16:400 ~ 14:02 : 00:000GMT,以及2009 年11 月9日Spy,日元期货和欧元看涨期权的相关信息。表4-2 省略的其他Level I 信息、有Spy 和日元期货的每日累计交易量和欧元看涨期权的希腊值(greeks),即期权风险值气假设每年平均252 个交易日,2009 年) 1 月9 日观察到的报价数,单对Spy 来说就包括超过160 年的每日开盘价、最高价、最低价、收盘价和成交量的数据点。

数据的质量并不总是等同其数量。集中交易一般会提供有关买价、卖价和规模的精确数据。美国股票交易所,按照法律规定,需要对每笔分笔数据交易数据记录进行可靠的存档和维护,同时在最优报价出现后的一分钟内将其提交给美国集中行情显示系统( centralized ticker tape),即证券信息处理器( SIP) 。限价买卖盘中除最优买价和卖价之外的信息被称为Level II 数据,可以通过特别订阅获取。
在分散的市场中,如外汇和银行同业拆借市场,无法在任何给定的时间获得整个市场报价。在这些市场上,参与者会意识到现有价格水平,但每个机构提供的是根据自己的订单预定调整后的自身价格。在分散市场上,每个交易商向客户提供自己的分笔数据。因此,某一给定的金融工具在某时刻的具体报价会因为交易商的不同而有所差别。路透社、德励财经资讯、奈特里德以及其他机构,会从不同交易商处收集报价信息并进行回传,提高了分散市场的效率。
一般认为,在交易商间的报价差异中有三种异常情况:
1. 每个交易商的报价都反映了自己的库存。例如,当一名交易商刚刚卖给其客户1 亿美元/加元时,他可能会渴望分散头寸的风险,避免卖出更多的美元/加元。然而,大多数交易商有义务与其客户在可流通的价格进行交易。为了促使客户沽出美元/加元,交易商会暂时提高美元/加元的买价。同时,为了鼓励客户不下买单,交易商抬高美元/加元的卖价。因此,交易商倾向于在特定金融工具短缺时提高买价和卖价,并且在金融工具中不成比例地降低买方和卖方的价格。
2. 在一个匿名市场,如暗池,交易商以及其他做市商或许会通过发送与先前报价相差甚远的指示性报价来"钓"到市场信息,以评估可用的供应或需求信息。
3. Dacorogna 等人( 2001 )认为,某些交易商的报价可能会落后于真实市场价格。价格的滞后可能从几毫秒到一分钟不等。一些交易商的报价变动会平均其他交易商的报价。交易商提供滞后报价,在数据反馈中宣传他们的市场存在。尤其是当过去大多数订单价格是通过电话协商时,更是如此,这使得报价和订单之间有一个相当大的延迟。快节奏的电子市场不鼓励滞后的报价,以提高市场质量。
高频数据受交易波动的影响
除了在低频数据中长期可以获得的交易价和交易量数据外,高频数据包括买入和卖出报价及其相关的订单大小。买入报价和卖出报价数据到达不同步,且在报价过程中会有干扰信息。
任何给定时间的买入报价和卖出报价之间的差被称为买卖价差( bid-ask spread) 。买卖价差是即时买入和卖出证券的成本。买卖差价越大,证券须产生的收益越高,以便与其他交易成本一起弥补差价。大多数低频价格变化足够大,使得买卖价差在比较中可以忽略不计。然而,在分笔数据中,增量价格变化可以相当于或小于买卖价差。
买卖差价通常在一天中会有差异。图4-2 显示了2008 年10 月最后两周在欧元/美元市场中观测到的平均买卖价差。如图4-2 所示,在东京交易时段内,当市场平静时,平均价差显著增加。在伦敦和纽约交易时段重叠期间,当市场有许多活跃的买家和卖家时,该价差达到最低水平。2008 年10月18~19 日周末的涨幅反映了市场对于2009 年10 月 17 日雷曼兄弟高管发布的由于雷曼兄弟涉嫌证券欺诈案件收到传票的关注。

当市场不确定或不稳定时,买卖价差会增大。例如,图4-3 比较了2008年7~8 月的市场稳定情况下和2008 年9~10 月危机情况下欧元/ 美元的平均买卖价差。如图4-3 所示,在危机和稳定的市场条件下都持续存在日间差价模式,但在市场危机期间的差价在一天中的所有时间都显著高于正常情况。一天之中价差的增长不是均匀的。当伦敦和纽约交易时段重叠时,在12~16GMT,平均每小时欧元/美元价差增加了0.0048% (0.48 个基点) 。在12~16GMT 时段增加了0.0048% (0.48 个基点或点) 。在东京交易时段0~2GMT ,价差增加了0.0156% ,是纽约/伦敦时段平均增幅的三倍。

由于在市场不确定和危机期间买卖价差的增加,这些时期的高频率策略的盈利能力会下降。例如,与正常市场情况相比,2008 年9 月和10 月在亚洲时段欧元/美元高频交易策略的成本显著增加。由于价差的增加,在亚洲时段单独执行100 次交易的策略,每日会有1.56% 的利润蒸发,而在伦敦和纽约时段执行同一策略导致的利润减少会少一些,但每日利润也显著减少0.48% 。这种情况对于流动性较低的证券的高频策略来说,情况会更加严重。例如,与2008 年7~8 月的市场情况相比,在9~10 月,新西兰元/美元(未在图中显示)的买卖价差平均增加了三倍。
尽管分笔数据反映了有关市场动态的信息,但这些数据也被同样的进程变得扭曲了,所以使得这些数据的在一开始最具有价值。Dacorogna 等人(2001) 的研究表明,市场执行订单期间,买卖报价之间的顺序交易价差会使高频参数预估的显著失真。例如, Cors 、Zumbach 、Muller 和Dacorogna (2001)的研究表明,买卖价差会使得波动率估测产生加大偏差。研究者计算得出,平均买卖价差导致了分笔数据40% 的一阶段自相关。Corsi 等人(2001),Voev 和Lunde (2007) 建议,在估测之前通过过滤买卖价差的干扰信息来修正偏差。
除了对买卖数据进行实时调整外,研究人员还使用预测技术来估计即将产生的买卖价差,并提前在模型中进行调整。未来的买卖价差可以用Roll( 1984 )提出的模型进行估计,假设某一资产在t 时的价格Pt 与不可观测的基础变量mt 相等,外加买卖价差s 的一半作为补偿。当市价订单是买入时,价格补偿值是正的,当交易为卖出时,价格补偿值是负的,如式( 4-1 )所示:

如果接下来买入或卖出订单到达的概率相等,则E[It]=0 ,且E[△Pt] = 0 ,与基础资产价值mt 的变化无关。然而,随后的价格变化的协方差不等于0;

因此,未来的预期价差可估计如下:

对于Roll 模型已发展出了许多扩展版本,这些扩展考虑到了当时的市场条件以及许多其他变量。Hasbrouck (2007 )对这些模型进行了一个很好的综述。
为了在出现买卖价差的情况下使用标准计量经济学技术,许多从业者将分笔数据转换为"中间报价" (midquote) 的形式: 最近的买卖报价的简单平均值。如果买方和卖方同意在价格区间上各让步一半,中间报价可近似于市场理论上愿意交易的价格水平。数学上,中间报价可以表示如下:

后一种在tm 时的情况反映了中间报价估值的不断更新: 当最新的最优买价qbtb或最优卖价qata分别在tb 或ta 到达时,
便会更新。
另一种对分笔数据报价进行抽样以形成聚合数据系列的方法是通过相应的买卖盘大小衡量最近的最优买价和最优卖价:

式中, qbtb和句是在tb 时间记录的最优买价和最优买盘量(当qbtb为最优买价时), qata 和Sata是ta 的最优买价和最优买盘量。
高频数据不是呈正态或对数正态的
许多古典模型假定价格呈对数正态分布,承认价格分布之间没有空隙,并产生了几种定价模型,如Black-Scholes 模型,这些模型被视为与相关金融工具市场的真实价格情况近似。实现价格对数正态的必要条件之一是连续价格变化的正态分布。然而,本节显示大多数分笔数据,如中间报价、大小加权报价和交易的连续性改变并不遵循正态分布,但连续交易分笔数据的分布接近正态。因此,交易分笔数据是建模者估算对数正态价格的最优选择。
图4-4比较了由2009 年11 月9 日以来记录的SPDR 标准普尔500 ETF 数据的中间报价(图a),大小加权中间报价(图b) 和交易价(图c) 计算得出的简单收益率直方图。数据忽略了相邻报价之间的时间差,将每个连续报价视为独立观察。图4-5 对比了相同数据集的分位数图和标准正态分布的分位数。

图44 中间报价(图a)、大小加权中间报价(图的和交易价(图c) 的Spy 数据简单收益的直方图,记录为2009 年11 月9 日全天


如图4-4 和图4-5 所示,基本中间报价的分布受到了最小"步长" ( step size ) 的限制: 中间报价中的最小变化可以发生在半个变动值( tick) 的增量中,目前,股票的最小变动价位( tick size) 为0.01 美元。大小加权中间报价构成了上面所讨论的三个分布中最连续的分布。图4-5 进一步确认了这一概念,并且说明了所有三种类型的数据分布中存在的肥尾(fat tails ) 。
如图4-5 所示,在三种方法中,逐笔交易(tick-by-tick trade) 收益最接近正态分布,此时超过四个标准差的重尾(heavy-tails) 被忽略不计。中间报价值和大小加权中间报价一样,在两个标准差处开始偏离正态,而交易收益保持正态直至四个标准偏差。
高频数据的时间间隔不规则
大多数现代计算技术经过发展,已可以用于处理每月、每周、每天、每小时或其他规则间隔数据。研究人员对固定时间间隔的传统依赖是由于:
● 每日数据相对容易获得(自20 世纪20 年代以来报纸已经公开发布每日报价) 。
● 处理规则间隔的数据相对容易。
● "无论是什么推动的证券价格和收益,在短期内都没有发生显著变化的可能"这类过时观点的影响( Goodhart and O'Hara , 1997 ,pp.80-81 ) 。
相比之下,高频观测值被变化的时间间隔分离开来。应对数据不规则的一种方法是对其进行定时抽样一一如每小时或每分钟进行一次抽样。例如,如果数据要从分笔数据转换为分钟"线" (bar) ,则在传统方法下,任何给定分钟的卖价或买价将被确定为在该特定分钟期间到达的最后报价。如果在某一分钟内没有报价,则前一分钟的收盘价将被作为当前分钟的收盘价等。图4-6a 说明了这个想法。这种方法隐含地假设在没有新报价的情况下,价格保持不变。事实却不一定是这样的。
Dacorogna 等人( 2001 )提出了一种更精确的抽样方法: 相邻报价之间的线性时间权重插值( linear time-weighted interpolation) 。插值技术的核心是,假设在任何既定时间,未观测到的报价位于与它相邻的两个观测到的报价链连接而成的直线上。图4-6b 显示了线性插值抽样的方法。

如图4-6 所示,两种报价抽样方法产生完全不同的结果。在数学上,两种抽样方法可以表示如下:
抽取收盘价时的报价:

抽取线性插值法的报价:

式中, q, 是抽样报价的结果; t 是期望的抽样时间(例如,新一分钟的开始);ttast 是在抽样时间t 之前的最后观测到报价的时间戳; qt.last 是在抽样时间t 之前最后一笔报价; tnext是在抽样时间t 之后的第一笔观测到报价的时间戳;qt,next 是在抽样时间t 之后第一笔报价的值。
图4-7 和图4-8 比较了作为收盘价格抽样并且插值的中间报价的直方图,频率为200 毫秒和15 秒。图4-9 比较了收盘价和插值分布的分位数图。如图4-7 和图4-8 所示,抽样的分布是稀疏的,即比在频率较低时的分布抽样包含更多的零收益。同时,如图4-9 所示,从插值报价计算的收益比收盘价更连续。


图4-7 "收盘价"的中间报价,以200 毫秒间隔抽样(上)和15 秒间隔抽样(下)


图4-8 "时间插值"的中间报价,以200 毫秒间隔抽样(上)以15 秒钟间隔抽样(下)


比起将报价间隔操作为方便的规则间隔格式,一些研究人员研究了后续报价到达报价本身的时间间隔是否携带一定信息。例如,大多数研究者同意,对于禁止卖空的证券而言,交易的时间间隔确实会携带信息;交易时间间隔越短,越有可能发生了利好消息,接下来的价格变动就越大。
久期模型( duration model) 用于估计影响任何两个连续分笔数据之间时间的因素,这样的模型分别被称为报价过程( quote processes) 和交易过程( trade processes) 。久期模型也用于测量预定幅度价格变化之间的时间间隔和事先指定的交易量增长之间的时间间隔。处理固定价格运行的模型被称为价格过程( price processes) ;估计固定交易量增量久期变化的模型被称为交易量过程( volume processes) 。
久期通常使用泊松过程( Poisson processes) 建模,这些过程假定顺序事件(如报价到达),彼此独立地发生。假设任意两个时间点t 和( t + τ) 之间的到达个数具有泊松分布。在泊松过程中,每单位时间到达个数为λ 。换句话说,到达以平均到达率( 1/λ) 发生。平均到达率可以假定保持恒定,或者假设可以随时间变化。如果平均到达率是恒定的,则在时间t 和( t + τ)之间恰好观测到k 个到达的概率是:

Diamond 和Verrecchia ( 1987 )和Easley 和O'Hara ( 1992 )首先提出,序列数据到达之间的久期会携带信息。他们的模型假设在存在卖空限制的情况下,交易间久期可以表明存在好消息; 在不允许卖空的证券市场中,久期时间越短,尚未工作所知的利好消息的可能性越高。反之亦然:在有限卖空和流动性正常的市场中,后续交易到达之间的久期越长,未观察到的坏消息的概率越高。但是,完全没有交易,则表明没有消息。
Easley 和O'Hara ( 1992 )进一步指出,由时间间隔分开的交易与彼此之间相连的交易所包含的信息内容是大不相同的。Easley 和O'Hara ( 1992 )结论的另一个隐含意思是,整个的价格序列都传递信息,应该在可能的情况下加以充分利用,这也成了支持高频交易的又一个论据。
表4-3 显示了2009 年5 月13 日Spy 的所有交易而得的久期的描述性统计。如表4-3 所示,在常规市场时间之外,交易间平均久期最长; 在收盘前一个小时, (美国东部时间下午3:00 ~ 4:00),平均久期最短。

相邻交易间久期的变化可能是多种原因导致的。缺乏交易可能是因为缺乏新的信息,交易不活跃则可能是因为流动性水平低、交易所暂停交易或交易商的策略考量。Foucaalt 、Kadaa 和Kaadel (2005 ) 认为,耐心地使用限价订单提供流动性可能本身就是一个有利可图的交易策略,因为流动性提供者应当因为其等待而获得补偿。补偿常常以买卖价差的方式进行,并且是限价订单被流动性消耗着"命中"所需等待时间的函数;交易问久期越短,其引致的买卖价差也就越小。然而, Dufour 和Engle ( 2000) 以及Saar 和Hasbrouck ( 2002 )发现,交易商观察到短的久期时, 买卖价差实际上更高,这与基于时间的限价订单补偿假设相悖。
除了研究相邻交易和报价的久期之外,研究人员一直在建模,发展了用于描述固定证券价格变化和交易量变化的久期模型。前后价格变化达到特定幅度所需的时间间隔称为价格久期(price duration) 。随着波动率的上升,价格久期会下降。同样,前后交易量变化达到预先设定规模所需的时间间隔称为交易量久期(volume duration) ,交易量久期会随着流动性的增加而减小。
利用交易量久期方法的变体, Easley、Lopez de Prado 和O'Hara ( 2011 )提出了基于交易量的高频数据抽样。在基于交易量的方法中,研究人员将一计时单位定义为交易量的一次"桶",例如50 个期货合约。当"桶"被装满时,交易量计时器便开始计时了。因此,当50 合约交易量计时单位在50 份合约交易相继到达时便开始计时了。当100 份合约交易执行时, 50 份合约的成交量便计时了两次。
然而,报价、交易、价格和交易量久期所包含的信息会造成估算过程的偏差。如果可用信息决定了后续交易之间的时间,则时间本身不再是一个独立变量,这会造成估算过程的大量内生性偏差。因此,与价格序列的真实方差相比,传统的交易价格方差估计值过高。
大多数高频数据不包含买卖标识符
无论是Level Ⅰ 或Level II 报价数据都不包含说明给定记录的交易是市价买单还是市价卖单的标识符,而一些应用要求买卖交易标识符作为模型的输入量。为了克服这个困难,在这里提出了四种方法来估计一个交易是根据Leve门数据的买人还是卖出:
● 限价卖空规则(tick rule);
● 报价规则(quote rule);
● Lee-Ready 规则(Lee-Ready rule);
● 整体交易量分类(bulk volume classification) 。
没有此类信息的数据集的时候,限价卖空规则是用于确定给定交易是由买方还是卖方发起的三种最流行的方法之一。其他两种流行的方法是报价规则和Lee-Ready 规则,由Lee 和Ready ( 1991 )提出。最新的方法是由Easley 、Lopez de Prado 和O'Hara (2012 )提出的整体交易量分类(BVC) 。
根据限价卖空规则,交易的分类是通过比较交易的价格和前一个交易的价格进行的,不考虑卖价或买价信息。每个交易则被归为以下四个类别中的一类:
● 如果交易价格高于前一个交易的价格,则为升标(uptick) 。
● 如果交易价格低于前一个交易的价格,则为降标(downtick) 。
● 若价格没有变化,但最后的变化记录为升标,则为零升标( zerouptick)
● 若价格没有变化,但最后的变化记录为降标,则为零降标( zerodowntick) 。
如果交易价格与先前交易的价格不同,根据价格是上升还是下跌,最新交易被分为升标或降标。如果价格没有变化,根据最后非零价格变化的方向,交易被分为零升标或零降标。根据Ellis 、Michaely 和O'Hara ( 2000 )的研究, 1997 ~ 1998 年,限价卖空规则正确地分类了所有纳斯达克交易的77.66% 。图4-10 对限价卖空规则做了解释。

低比例的正确分类交易可能是由于股票监管问题造成的。例如,Asquith 、Oman 和Safaya ( 2008 )的报告观测到的错误分类至少部分是由于法规要求股票卖空要在升标或零升标(被称为升标规则)情况下执行而造成的,美国证券交易委员会于2007 年废除了这一规则。因为近30% 的股票交易是卖空,所以Asquith 等人(2008 )认为,仅靠监管限制的卖空可能导致观测到的交易分类错误。在没有卖空限制的情况下,所有之前的交易分类可能会更加精确。在期货数据中,没有升标规则, Easley 等人( 2012 )明确发现,限价卖空规则能够更准确地将交易分为买方发起和卖方发起。根据Easley 等人(2012 )的计算,限价卖空规则能够准确分类电子迷你标准普尔500 指数期货的86.43% 。
报价规则是另一种分类报价的方式,也是由Lee 和Ready ( 1991 )和Ellis 等人(2000 )在论文中发表的。根据该规则,如果交易价格高于(低于)当前通行买卖报价的均值,则交易是买入(卖出) ;如果交易价格正好在当前通行买卖价的中值,则该交易不进行分类。虽然报价规则经常被使用,并且已被证明正确地分类了纳斯达克上所有交易的76.4% (参见Ellis et al.,2000 ) ,但是当前通行报价( prevailing quote) 的定义可能有不同的解释,并且分析结果可能比限价卖空规则差。例如, Lee 和Ready ( 1991 ) 指出,报价和交易通常不排序,导致很难确定当前通行报价。具体来说,随着电子预定簿的引入,报价通常会在触发它们的交易实现之前就被记录了下来。他们建议通过在至少提前5 秒钟使用报价来分类交易,以缓解这种情况。1991年,纳斯达克在报告交易时,延迟中值为5 秒。然而,在过去20 年里,自Lee 和Ready 的研究出版以来,市场速度取得了相当大的提升,该规则的有效性可能已经降低。图4-11 为该报价规则分类的示例。
所谓的Lee-Ready 规则, 首先使用报价规则对交易进行分类。发生在当前通行买卖报价中价的交易,不使用报价规则进行归类,随后使用限价卖空规则进行分类。此外,Lee 和Ready ( 1991 )强调将交易与至少提前5 秒的报价进行撮合,以避免错误的报价排序。Dufour 和Engle (2000 )遵循5 秒规则,但Ellis 等人( 2000 )反对,他们认为交易报告延迟可能会根据终端用户的系统而有所不同。忽略5 秒的延迟, Ellis 等人( 2000 )认为,Lee-Ready 规则能够将所有交易的81.05% 分类为买方发起或卖方发起,相对限价卖空规则有了小幅改善。

为了进一步提高交易分类的准确性, Easley 等人( 2012) 提出了一种方法,对市场买盘或市场卖盘产生的特定交易量进行概率估计。这一名为"整体交易量分类" ( BVC) 的规则,操作如下: 对于每单位时间或数量[ "交易量" (volume bar ),可以为每100 股交易] ,BVC 将观测到的交易量作为买盘的概率如下:

式中,Vr 是在时间或交易量间隔r 期间观测到的总交易量; Pr-Pr- 1 是在两个连续的时间或交易量,τ-1 和τ 之间观察到的价格差;σ△P 是基于顺序时间或基于交易量时钟的价格变化的标准偏差: Z 是标准正态分布的概率分布函数。
买方发起的交易量可以估计为

根据BVC,市价卖单产生特定交易量的概率则变为

然后,卖方发起的交易量相应大小为

Easley 等人( 2012 )将BVC 方法应用于电子迷你期货,结果表明,在使用时间间隔时, BVC 规则正确地分类了所有交易的86.6% ,以及当使用基于交易量而不是基于时间时,BVC 规则正确地分类了所有交易的90.7% 。
|总 结|
分笔数据与低频数据之间有着显著的差别。分笔数据的使用创造了很多低频数据无法提供的机会。多种抽样和插值技术创造了数据研究的多种角度。多种组织和解读细微分笔数据的方式传达了产生的时间序列不同的数据属性。
|章末问题|
1. 高频数据的关键属性是什么?
2. 什么类型的数据信息是最常见的?
3. 什么数据抽样技术所产生的高频时间序列更符合正态分布?
4. 限价卖空规则、报价规则、Lee-Ready 规则和整体交易量分类的关键区别在哪?
5. 思考一笔在时间t,以价格17.01 执行,即在当前时间t 的最优买价执行的交易。在这笔交易前,在时间t-1 执行的价格为17.00 。按照报价规则,交易在时间t 应被分类为买方发起还是卖方发起?根据限价卖空规则, 如何将在时间t 完成的交易归类?