另类数据的价值缺口#
传统量价、财务数据已高度内卷,而社交媒体情绪数据能提前捕捉市场预期差。Twitter/股吧/雪球的文本数据,经自然语言处理后可作为独立Alpha来源,且与传统因子相关性低于0.2。
情绪因子构建四步法#
1. 数据采集与清洗#
通过官方API+爬虫获取标的相关文本,过滤广告、水军内容,保留有效发帖量占比需≥70%。A股单标的最高日均发帖量可达12万条(牛市期间)。
2. 情绪打分#
采用FinBERT金融领域预训练模型,输出「看多/中性/看空」三类概率,构建日度情绪得分=(看多占比-看空占比)* log(发帖量+1)。
3. 因子中性化#
对情绪因子做市值、行业中性化处理,避免与其它风格因子混淆。中性化后IC均值可达0.04,ICIR为0.62(2018-2025年全A股测试)。
4. 组合构建#
选择情绪得分前20%的标的等权持有,月度调仓,策略年化超额收益12.7%,最大回撤18.3%,显著优于传统多因子策略。
实盘落地难点#
- 文本数据的滞后性:需优化爬虫更新频率至分钟级,才能捕捉日内情绪反转
- 水军识别:需结合账号注册时长、互动真实性构建过滤规则
- 监管风险:避免使用未授权的非公开社交数据
