halo 的技术博客

返回

12000 次电话会的语调分布

每个季度,上市公司管理层都要在财报电话会上面对分析师说上一个小时的话。这一个小时里说出的八九千个词,比财报里的数字诚实——不是因为管理层想诚实,而是因为词语的选择比数字更难粉饰。数字可以靠会计政策调节,但一个 CFO 在展望环节从”strong momentum”换成”cautiously optimistic”,从主动报增速改成被动答问题,这种退缩会泄露在词频统计里。

Loughran-McDonald (2011) 为金融文本建了专用情绪词典,之后十几年的文献反复确认:电话会语调对财报后漂移、下季盈余意外、甚至管理层随后的减持行为都有预测力。这篇文章用 300 只股票 × 40 个季度的合成面板把这条路完整走一遍,并回答一个多数教程跳过的关键问题:为什么语调水平几乎没用,语调变化才是因子

从八千个词到一个数:Tone 的算法#

语调分析最经典(也最能打的)做法出奇地简单:数词。

第一步,选词典。通用情绪词典(如给影评造的)在金融文本上是灾难——“liability”(负债)在通用词典里是负面词,在财报里是中性会计术语;“cost”、“tax”、“depreciation” 同理。Loughran-McDonald 词典专为 10-K 和电话会语料构建,收录约 350 个正面词(achieve, improve, strong, record…)和约 2350 个负面词(decline, loss, impairment, litigation…)——注意负面词表是正面词表的七倍,金融语言天然需要更精细的坏消息分类。

第二步,数频率,算比值:

# 经典 tone 公式:正负词差 / 正负词和
tone = (pos_count - neg_count) / max(pos_count + neg_count, 1)
python

第三步——也是最容易被跳过的一步——把 Q&A 环节和管理层陈述环节分开算。陈述环节是排练过的剧本,语调被公关团队打磨过;Q&A 是即兴防守,信息含量高得多。文献中 Q&A 语调的预测力普遍强于陈述环节。

我们的合成面板模拟了这个数据生成过程:每家公司有一个 AR(1) 的基本面状态,每季电话会揭示基本面的最新变化;管理层语调 = 基本面 + 公司固有的乐观偏置(有的 CEO 天生爱吹,且叙事风格随时间慢漂移)+ 噪声。词频层面:每次电话会 6000-11000 词,正面词与负面词的出现率由语调驱动,用二项分布生成真实的词频计数——连”数词的抽样噪声”都保留了。

12000 次电话会数出来的 tone 分布如开头图所示:均值 +0.166,显著偏正。管理层永远在说好话——这不是模拟的假设,是对真实语料最基本形态的复刻(真实电话会中正面词频率长期高于负面词,哪怕在衰退期)。而这个系统性的乐观偏置,正是水平信号失效的祸根。

水平 vs 变化:粉饰滤波器#

如果直接拿 tone 水平做横截面因子——“买语调最乐观的公司”——你买到的是什么?是基本面好的公司,加上CEO 最爱吹的公司。公司间的乐观偏置差异巨大且持久:同样的经营状况,有的管理层说”transformational quarter”,有的说”solid progress”。水平信号里,真实基本面和吹牛习惯不可分离。

解决方案是差分:ΔTone = 本季语调 − 上季语调。同一个管理层、同一种叙事风格,前后两季的语调变化把公司固有的粉饰偏置差掉了——爱吹的 CEO 这季比上季收敛了,才是真消息。

Fama-MacBeth 横截面回归的对比印证了这一点:

水平 vs 变化的 t 值对比

信号FM 斜率(%/季)t 值
Tone 水平0.343.47
ΔTone 变化0.828.60

水平信号不是完全没用(t=3.5 仍过显著线,因为水平里毕竟含有基本面成分),但变化信号的斜率是它的 2.4 倍、t 值翻了两倍半。差分是一个免费的粉饰滤波器——它过滤掉的恰好是语调里最不值钱的成分:管理层的人格

这个设计在真实数据上还有一层保护:叙事风格会慢漂移(公司换了 IR 团队、CEO 上了媒体培训课),我们在模拟中给粉饰偏置加了随机游走漂移,差分对慢漂移同样近似免疫——只要漂移速度远慢于基本面变化,ΔTone 的信噪比就守得住。

五分组:单调性检验#

把每季的 ΔTone 横截面标准化后分五组,看下一季超额收益:

五分组收益

分组Q1(恶化)Q2Q3Q4Q5(改善)
下季均收益-1.19%-0.52%+0.23%+0.75%+0.98%

严格单调,无翻转。值得注意的是分布的不对称:Q1 的负收益(-1.19%)比 Q5 的正收益(+0.98%)更极端——语调恶化的信息含量高于语调改善。这与真实文献一致,机制也直白:说好话是默认动作,不需要理由;而管理层在有八千个词可以选择的情况下依然让负面词率上升,通常意味着坏消息已经大到藏不住。坏消息在语调里是被压抑后的泄露,好消息是被放大后的表演。

多空组合:成本后还剩多少#

做多 Q5、做空 Q1,季度调仓:

多空净值曲线

指标毛收益成本后(15bp 单边)
年化收益8.70%6.90%
Sharpe2.311.83
t 值7.11

季度调仓是这个因子天然的成本优势:信号每季才更新一次(电话会只开四次),换手被事件频率锁死,双边 150% 的季度换手在 15bp 的机构成本假设下只吃掉年化 1.8 个点。对比日频价量因子动辄被成本腰斩,文本因子的低频特性是被低估的工程红利。

需要泼的冷水:合成面板中 Sharpe 2.3 明显高于该因子在真实市场的可实现水平(文献中语调因子多空的真实 Sharpe 大致在 0.5-1.0 区间)。差距来自模拟的善意简化——真实世界里语调与基本面的映射更嘈杂、语调信息与财报数字信息高度重叠(增量贡献才是因子真正的价值)、且横截面收益含有无法分散的共同因子暴露。本文的数量级应读作机制演示,不是收益预告。

实盘工程清单#

把这个因子从论文搬到生产环境,按重要性排序要解决四件事:

转录文本获取与对齐。 电话会转录稿的时间戳必须精确到”何时可交易”:电话会通常在盘后进行,转录稿完整发布往往滞后数小时到一天。用 T+1 开盘价入场是最低要求;用电话会当日收盘价回测就是未来函数。

陈述与 Q&A 分离。 解析转录稿结构,分别计算两个环节的语调,Q&A 语调权重应更高。进阶版本:只统计 CFO 回答中的语调(CFO 比 CEO 更少表演)。

词典本地化。 中文财报语料没有现成的 Loughran-McDonald,通用中文情绪词典在业绩说明会语料上误判率高。可行路径是用 LM 词典的构建方法论在 A 股语料上重建:从业绩说明会文本中筛高频词,人工标注金融语境下的极性。

与盈余意外正交化。 语调变化和 SUE(标准化盈余意外)相关性不低——好业绩自然带来好语调。回归掉 SUE 之后仍然显著的残差语调,才是文本独有的增量 alpha。这是区分”你挖到了新因子”和”你用 NLP 重新发明了 PEAD”的关键一步。

A. 实现细节#

面板为 300 只股票 × 40 季。基本面为 AR(1) 过程(ρ=0.7),每季电话会通过词频泄露基本面创新项;下季超额收益响应上季创新(反应不足机制,传导系数 1.3%/单位创新)。语调由二项分布词频计算:每会 6000-11000 词,正/负面词率由潜语调线性驱动,tone=(pos−neg)/(pos+neg)。信号为 ΔTone 的横截面 z 分数,第 t 季信号预测第 t+1 季收益,无同期重叠。Fama-MacBeth 为逐季横截面回归后对斜率序列做 t 检验(38 个季度)。五分组等权,多空为 Q5−Q1;成本按季度双边换手 150%、单边 15bp 线性扣除。粉饰偏置建模为公司固定效应(σ=1.6)+ 随机游走漂移(季度步长 σ=0.12),用于制造”水平被污染、变化免疫”的对照。

B. 已知偏差#

语调-收益映射被简化。 模拟中收益直接响应基本面创新,而 ΔTone 是创新的高质量代理(相关性由构造保证);真实市场中语调与未来收益的联系弱得多且不稳定,Sharpe 2.3 应视为机制上限而非期望值。信息重叠未建模。 真实的语调信号与盈余意外、分析师修正、财报文本可读性等高度相关,本文未做正交化,单因子收益中有多少是文本独有的增量无法在此框架内回答。可交易性假设理想化。 未建模做空约束(A 股语境下 Q1 空腿基本不可行,因子退化为纯多头 Q5 超配)、未建模转录稿发布延迟的分布,季度调仓假设所有电话会在季末同时发生,真实的财报季是六周的滚动窗口,组合构建需要处理信号新鲜度不一致。

C. 结果解读#

差分是这个因子的灵魂,不是可选项。 水平 t=3.5 vs 变化 t=8.6 的对比说明:语调因子的大部分价值不在”读出管理层说了什么”,而在”读出管理层比上次少说了什么”。任何跳过差分直接用水平做横截面比较的实现,都在把 CEO 的性格当成 alpha 交易。

空腿比多腿值钱,但空腿最难交易。 Q1 的 -1.19% 贡献了多空收益的大半,符合”坏消息被压抑后泄露”的机制。但恰恰是这条信息含量最高的腿在多数市场受做空约束——现实中该因子的可实现收益远低于纸面多空,纯多头版本只剩 Q5 的 +0.98%/季减去基准。

低换手是文本因子的结构性优势。 信号频率被财报日历锁死在季频,成本侵蚀(1.8%/年)远低于价量类因子。在成本敏感的中低频组合里,文本因子的净收益排名会比毛收益排名显著上移。

下一步的正确方向是增量检验,不是更好的 NLP。 从词频升级到 FinBERT 或 LLM 打分能提高语调测量的精度,但决定因子价值的是正交化后的残差显著性——先证明词频版语调在控制 SUE 后仍有 t>2,再考虑用更贵的模型榨取测量精度,顺序不能反。


本文实验基于合成面板数据,语调-基本面-收益的传导机制为参数化植入,用于演示文本因子的构建方法与水平/变化的信息差异。真实市场中语调因子的收益水平、稳定性与增量贡献需在真实转录稿语料上验证。本文不构成投资建议。

财报电话会语调分析:用词频把管理层情绪变成因子
https://blog.halo26812.eu.org/blog/earnings-call-tone-analysis
Author halo
Published at 2026年7月26日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨