halo 的技术博客

返回

美股的交易单位是 100 股一手(round lot)。不足 100 股的订单叫碎股(odd lot)——在很长的历史里,这个词几乎是”散户零钱”的同义词。教科书甚至有个”碎股理论”(odd lot theory):碎股交易者是最不知情的散户,跟他们反着做就能赚钱。于是几十年里,学术研究和交易系统不约而同地做了同一件事:把碎股从数据里过滤掉。

结论先放这:这是市场微观结构研究里代价最大的数据清洗错误之一。 O’Hara、Yao 和 Ye(2014, Journal of Finance)发现:碎股在高价股中占到成交笔数的一半以上;碎股交易的买卖失衡对未来收益的预测力显著强于整手交易;而且在 2013 年 12 月之前,碎股成交根本不进公开磁带(consolidated tape)——用 TAQ 公开数据做研究的所有人,都在系统性地漏看市场上信息含量最高的那部分订单流。原因和”散户零钱”完全相反:算法拆单把大机构的知情订单切成了碎股。 最小的单,藏着最大的钱。

一、碎股为什么从噪音变成了信号#

三个结构性变化把碎股从边缘推到了中心:

第一,高名义股价。 当一只股票交易在 $2000 以上(想想 Booking、AutoZone,以及拆分前的 Amazon、Google),买一手就是 20 万美元。对绝大多数订单来说,100 股已经不是”最小交易单位”而是”一笔大单”。名义股价越高,碎股占比越高——这是纯粹的机械效应。

第二,算法拆单。 现代机构执行几乎全部通过算法:一笔 50 万股的母单被切成几千笔子单,用 VWAP/TWAP/POV 的节奏喂进市场。切分逻辑是最小化冲击,不是凑整手——于是子单里大量出现 37 股、83 股这种碎股。知情机构的订单越大、越急于隐藏,拆得越碎。

第三,做市商的库存管理。 高频做市商的库存目标经常不是整手,回归目标库存的对冲单天然是碎股。

模拟高价股与低价股的碎股占比路径:

碎股占比长期抬升

高价股(>$500)的碎股成交笔数占比从 2010 年的个位数一路爬到 50% 以上,低价股则始终温和。当一个市场里一半的成交是”碎股”时,“过滤碎股”等于扔掉一半样本——而且扔掉的不是随机的一半。

二、磁带缺口:一段真实的数据史#

碎股最惊人的一点是它的数据可见性历史。在 2013 年 12 月 9 日之前,碎股成交不报告给公开的 consolidated tape——它们真实发生、真实清算,但公开数据里不存在

磁带缺口

这造成一个奇特的信息分层:用 TAQ 公开数据的研究者和普通投资者看不到碎股;但直连交易所私有数据流(proprietary feed)的高频交易商看得到。O’Hara-Yao-Ye 用交易所内部数据测算,缺失的碎股占成交笔数约 20-25%,在高价股中更高——而这恰恰是知情交易最密集的部分。

换句话说,2013 年之前的美股有一个制度性的信息不对称:付钱买私有数据流的人,看得见一层别人看不见的订单流,而这层订单流恰好信息含量最高。 这也是碎股研究最终推动监管改革的原因——SEC 在 2013 年底把碎股纳入公开磁带,2024 年起 round lot 定义本身也按股价分级改革(高价股一手可以是 10 股甚至 1 股)。

对量化研究者的教训比故事本身更重要:你的数据源”看不见”的东西,不等于市场里不存在。 用 TAQ 做 2013 年前的微观结构回测,所有基于成交笔数、订单流失衡的因子都带着系统性测量误差。

三、碎股失衡的预测力:受控模拟#

核心命题:碎股买卖失衡(买方发起的碎股量减卖方发起的碎股量)预测未来收益,且强于整手失衡。用受控模拟复现这个结构——设定 30% 的碎股流来自知情机构的拆单(带方向信息),70% 是真散户和做市商库存调整(噪音);整手流的知情占比设为显著更低:

结果与对照组(整手失衡)的对比:

碎股失衡预测力

碎股失衡十分组呈现清晰的单调结构——净买入最强的第 10 组未来 5 日收益显著为正,净卖出最强的第 1 组显著为负;而整手失衡的十分组曲线几乎平坦。同样是订单流失衡,按”单子大小”切一刀,信息含量完全不同。

这个反差的机制值得掰开:整手及以上的大单,要么是已经被市场看见并定价的(大单冲击即时反映进价格),要么是不知情的被动执行(指数基金);而碎股是知情机构刻意隐藏的痕迹——拆单的目的就是让市场把自己误认成散户。失衡信号的强度排序其实是”隐藏意图的浓度”排序。

四、信息优势的半衰期#

好信号被公开,就开始死亡。碎股数据 2013 年底进入公开磁带后,这个因子发生了教科书式的衰减:

碎股因子 alpha 衰减

模拟的两条净值曲线:数据公开前,碎股失衡多空组合稳定跑出年化 ~15% 的 alpha(只有私有数据流用户能算出这个因子);数据公开后,同一因子的 alpha 逐年衰减到接近零——不是因为知情者不再拆单,而是因为所有人都能看到拆单的痕迹了,信号被竞争性地即时定价。

这是量化研究里一个普适的模式:因子的 alpha 一半来自信号本身,一半来自”多少人看得见这个信号”。 PIN、VPIN、订单流毒性这些微观结构因子全部走过同样的生命周期——私有数据阶段暴利、学术发表后衰减、进入商业数据库后归零。评估任何微观结构因子时,第一个问题不是”信号强不强”,而是”我在数据可见性食物链的哪一层”。

A. 实现细节#

  • 信号判定字段:碎股买卖失衡 =(买方发起碎股量 - 卖方发起碎股量)/ 碎股总量,周频截面;买卖方向用 Lee-Ready 类算法从逐笔数据推断。
  • 执行时点:信号周末确定,次周第一个交易日建仓,持有 5 个交易日;十分组等权多空。
  • 模拟设定:5000 股票-周样本;碎股流知情占比 30%(知情失衡均值 0.4、预测系数 0.35),整手流预测系数 0.05;未来收益噪音标准差 0.45。衰减实验:alpha 从 6bp/日线性衰减至 0.5bp/日,模拟数据公开后的竞争定价。
  • 数据史关键节点:2013-12-09 碎股纳入 consolidated tape;2024 年起 SEC 分级 round lot 改革。此前的 TAQ 数据存在约 20-25% 成交笔数的系统性缺失。

B. 已知偏差#

  • 知情占比是模拟假设:真实市场中碎股流的知情浓度无法直接观测,30% 取自 O’Hara-Yao-Ye 对高价股的间接估计上沿;低价股中碎股仍以散户为主,因子在低价股上可能反号(回到”碎股理论”的反向指标逻辑)。
  • 买卖方向推断误差:Lee-Ready 在高频撮合下误分类率 10-20%,碎股多以吃单形式成交略缓解此问题,但失衡信号仍带测量噪音,实测预测力低于理论值。
  • 交易成本未建模:碎股失衡是周频换手 100% 的高频因子,多空各 5 天持有期,双边成本 20-30bp 就能吃掉大部分模拟 alpha;实盘可行性依赖极低成本的执行通道。
  • A 股映射失真:A 股最小单位 100 股且股价低,“碎股”仅在盘后零股交易和港股通碎股市场存在,本文机制不能直接搬到 A 股——A 股里对应的”隐藏知情流”研究对象是拆单后的小单流(与龙虎榜小单占比逻辑相通),但数据定义完全不同。

C. 结果解读#

  • 核心洞见是”信号在哪一层”而不是”信号是什么”:碎股失衡的预测力来自算法拆单对知情意图的搬运。同样的失衡指标,切在碎股上有信息、切在整手上没有——因子研究里变量定义的颗粒度本身就是 alpha 的来源。
  • 磁带缺口是数据质量的经典案例:2013 年前用公开数据做的微观结构研究都带系统性缺失,且缺失非随机(集中在高价股、知情流)。任何依赖”成交笔数""平均单笔大小”的历史因子,跨越 2013 年边界时都需要断点检验。
  • alpha 衰减的时间结构:模拟展示的衰减不是信号失效而是可见性民主化。这给微观结构因子研究定了一个务实的预期:学术发表即衰减开始,商业数据库上线即接近终点——这类因子的价值窗口按年计,不按十年计。
  • 策略适用边界:碎股失衡因子在高名义股价、高机构持仓、高算法执行渗透率的股票池里最强;在低价股、散户主导的票上信号反转或消失。2024 年 round lot 分级改革后,“碎股”的定义本身在变化,历史因子的构造规则需要随制度重写。
  • 更深的含义:碎股故事的本质是——市场里最不起眼的数据维度,可能因为一次技术变迁(算法拆单普及)而突然获得信息含量,又因为一次制度变迁(纳入磁带)而失去超额收益。微观结构 alpha 的猎场永远在制度与技术的变更边界上。
碎股交易的信息含量:odd lot 里的知情交易
https://blog.halo26812.eu.org/blog/odd-lot-trades-information
Author halo
Published at 2026年7月29日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨