halo 的技术博客

返回

2018 年那波「专利数量大跃进」,很多公司一年申请几百件,市值却纹丝不动;同一时期,几家手握少量高被引专利的公司,股价三年翻了倍。专利的「数量」是公关指标,「质量」才是定价信号。 本文把一个学术上站得住、实战里常被忽视的因子——专利质量因子——从定义做到可回测。

直觉很简单:一家公司真正有价值的创新,会被后来的专利反复引用(这叫 forward citation,前向引用)。一件专利被引用 50 次,和一件专利从没被引用过,含金量天差地别。Kogan、Papanikolaou 与 Seru (2017) 的实证发现:用「前向引用次数 / 专利数」度量的专利质量,比单纯专利数量更能预测公司未来的股票超额收益。 这就是我们要量化的「创新 alpha」。

一、用前向引用度量专利质量#

单件专利的价值,市场看的是它之后被同行引用的次数——引用越多,说明它奠定了越重要的技术基础。把一家公司所有专利的前向引用加起来、再除以专利数,就得到「平均专利质量」:

qi=kpatents(i)citationsk#patents(i)q_i = \frac{\sum_{k \in \text{patents}(i)} \text{citations}_k}{\#\text{patents}(i)}

qiq_i 越高,说明这家公司的创新越「硬核」。我们合成 150 家公司,用 lognormal 抽样模拟 qq(右偏,符合真实专利引用长尾分布),并合成规模作为控制变量:

import numpy as np

N, T = 150, 240                 # 150 公司, 240 月(20 年)
rng = np.random.default_rng(20260720)

q = rng.lognormal(mean=0.0, sigma=0.8, size=N)   # 专利质量 q = 前向引用/专利
q = np.clip(q, 0.1, None)
size = rng.lognormal(0, 0.6, N)                  # 公司规模(控制变量)
print(f"专利质量中位数={np.median(q):.2f}, P90={np.sort(q)[int(0.9*N)]:.2f}")
# 中位数 0.93, P90 2.67 -> 长尾: 少数公司质量碾压多数
python

图 1 是合成 qq 的分布:典型的右偏长尾,少数公司质量极高、多数平庸——这正是真实专利数据的形态。

专利质量分布(合成 150 家,q=前向引用/专利,lognormal)

二、数据生成机制:持续溢价 + 创新浪潮#

为了让「专利质量有 alpha」这件事可验证,我们在收益里注入两个隐藏结构:

  • 持续创新溢价:专利质量越高的公司,每月多赚 κqi\kappa \cdot q_i(创新带来的长期竞争优势);
  • 创新浪潮事件:在 T6072T\approx 60\text{–}72 注入一次对高质公司的额外奖励冲击(高 qq 公司吃到超额回报、低 qq 几乎无感)。
MKT = rng.normal(0.008, 0.04, T-1)
innov_shock = np.zeros(T-1)
for t in range(60, 73):                       # 创新浪潮窗口
    innov_shock[t] = rng.normal(0.03, 0.01)

beta = rng.normal(1.0, 0.3, N)
kappa, innov_load = 0.0045, 1.6
R = (MKT[None, :]
     + beta[:, None] * MKT[None, :]
     + kappa * q[:, None]                       # 持续创新溢价
     + innov_load * q[:, None] * innov_shock[None, :]   # 高质公司在浪潮期吃超额
     + rng.normal(0, 0.02, (N, T-1)))
python

关键设计:创新浪潮的冲击乘以 qq,所以浪潮对高质公司是放大器,对低质公司几乎无感。图 2 把 20 年累计净值拆出来——高质组(组 5)持续跑赢、低质组(组 1)走平,浪潮窗口(橙色阴影)加速拉开差距。

20 年累计净值: 高质组持续跑赢, 浪潮期加速拉开

三、构建因子:多高质 / 空低质#

qq 分五分位,多空组合:

order = np.argsort(q)
n = N // 5
groups = [order[i*n:(i+1)*n] for i in range(5)]
grp_ret = np.array([R[g, :].mean(0) for g in groups])   # (5, T-1)
pq_factor = grp_ret[4] - grp_ret[0]                    # 多 Q5(高质) / 空 Q1(低质)
python

净值见图 3。因子年化 22.3%、Sharpe 2.31,同期市场年化仅 10.6%——这是一个典型的「质量溢价型」因子:平时赚创新竞争力的持续超额,创新浪潮期赚一大笔预期重定价。注意:22% 是合成校准下的量级,真实世界里专利质量因子的多空年化通常在个位数到十几个百分点,幅度更小但结构一致。

专利质量因子净值: 把创新质量变成可交易 alpha

四、横截面检验:t 统计量说了算#

因子有没有「统计上的存在感」,要看横截面回归的 t 值。控制市场和规模后,回归个股月均收益对 qq

def xs_reg(y, Xcols):
    X = np.column_stack([np.ones(N)] + Xcols)
    coef, *_ = np.linalg.lstsq(X, y, rcond=None)
    resid = y - X @ coef
    dof = N - X.shape[1]
    se = np.sqrt((resid @ resid)/dof) * np.sqrt(np.diag(np.linalg.inv(X.T @ X)))
    return coef, se

coef, se = xs_reg(R.mean(1), [q, size])
t_q = coef[1] / se[1]          # ≈ 24.4
python

t(q) = 24.4,远超过 |2| 的显著性门槛,正号说明「专利质量越高,收益越高」。图 4 的拟合线直观展示这条正斜率。注意我们控制了 size——否则大公司天然专利多、质量也高,专利质量效应会和规模效应混淆。

横截面: 专利质量越高, 月均收益越高(t 显著为正)

五、五分位单调性与浪潮放大#

def ann(r): return (np.prod(1 + r))**(12/len(r)) - 1
dec_ann = np.array([ann(grp_ret[k]) for k in range(5)])
# Q1(低质) 22.4% -> Q5(高质) 48.9%, 严格单调上行
python

图 5 显示五分位年化收益严格随专利质量升高而上升——因子是「干净」的单调暴露,不是头尾两组臆造。更值得说的是幅度:把创新浪潮窗口(60–72 月)单独拎出来,高质组相对低质组的月均超额是 11.5%,而平稳期只有 1.16%——浪潮期溢价被放大了约 10 倍。这说明专利质量因子的爆发力集中在「技术范式切换」窗口,平时是慢钱。对组合管理的启发很直接:把它当长期底仓因子持有,但在行业出现技术范式切换(如某细分领域引用量突然集体跳升)时,可临时超配对应高质公司,去吃那波被放大约 10 倍的超额。

需要强调一个口径细节:本文的 22.3% 多空年化是合成校准量级,目的是把「专利质量有 alpha」这件事讲清楚、画出来。真实世界里,Kogan et al. 报告的多空年化通常在个位数到十几个百分点,幅度更小但单调结构一致。所以实战里不要拿这个量级当预期收益,要拿它的暴露方向和单调性当信号。

五分位组合年化收益: 专利质量单调(低→高 收益升)

六、六类真实陷阱#

  1. 引用可以被「堆」出来:企业会自我引用、关联公司互引、甚至用防御性专利刷量。真实世界里 q 必须做「剔除自引」「同族去重」「按 IPC 分类归一化」,否则你交易的是「专利写作团队 KPI」而非创新质量。
  2. 披露与引用滞后(最致命):专利从申请到公开有 18 个月延迟,引用积累更是要等 3–5 年。当你在回测里「看到」某公司的专利质量,真实世界可能早就price-in了——这个因子的实盘信号永远比学术回测慢半拍
  3. 行业技术周期混淆:半导体、生物医药天然高引用(技术密集),传统制造低引用。不做行业中性化,你交易的其实是「科技板块多头」。和供应链因子一样,申万一级行业内中性化是必做项
  4. 幸存者偏差:低专利质量、技术落后的公司更容易退市/ST,从面板消失,你算 q 时只看到「活下来的高质量公司」——因子效果会被幸存者偏差系统性高估,必须用含退市的全样本。
  5. 质量 ≠ 护城河:高被引专利也可能被绕过、被无效宣告、或对应产品根本没商业化(实验室成果)。少数公司是「论文强、赚钱弱」。实战要用「专利质量 × 研发转化效率(营收/研发支出)」做二阶过滤。
  6. 做空成本与可得性:因子要空低质组,但这类公司常是小盘、低流动性,借券难、冲击成本高;A 股几乎不可直接做空,退化成「只多高质」后,因子从「质量溢价」变成「质量多头」,回撤结构与多空版本不同。

七、落地清单#

  • 数据层:拉取 CNIPA/USPTO 专利前向引用,剔除自引与同族重复,按 IPC 大类做行业归一化;
  • 组合层:组内等权、季度或半年调仓(匹配专利披露频率)、强制行业内中性化;
  • 二阶过滤:在高质组里叠加「研发转化效率」与「毛利率」,剔除「纸面专利」公司;
  • 浪潮增强:当行业出现技术范式切换信号(如某细分领域引用突增),临时超配该细分赛道的高质公司,吃专利质量的「爆发期」。

结语#

专利质量因子量化的是一句大白话:你的创新是「硬科技」还是「专利数量秀」。 前向引用次数/专利越高,说明技术越被同行认可、竞争优势越持久。本文用自洽合成证明:横截面 t 统计量 24.4、年化 22.3%(合成校准量级)、Sharpe 2.31,五分位年化收益严格单调(22.4%→48.9%),且溢价在创新浪潮期被放大约 10 倍。但六类陷阱里,引用堆量和披露滞后是真正会让你在实盘里栽跟头的两道坎:你回测看到的漂亮曲线,可能只是因为最烂的那批公司已经「消失」在数据里,而最好的信号永远比市场慢半拍。最后一句忠告:这个因子是「长期底仓 + 浪潮增强」的组合,不是追涨杀跌的短线信号——它的 alpha 在时间上极不均匀,急不得。

专利质量因子:用发明专利授权构建创新 alpha
https://blog.halo26812.eu.org/blog/patent-quality-factor
Author halo
Published at 2026年7月20日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨