在金融领域训练一个大语言模型,最大的瓶颈不是算力,也不是模型架构,而是数据。金融数据的特殊之处在于:它既极度敏感,又极度稀缺——历史走势可以免费查到,但真正有预测价值的信号几乎都是非公开的。这意味着,任何依赖于”多多益善”式互联网爬取的传统大模型训练方法,在金融场景下都会遭遇结构性失灵。
合成数据(synthetic data)正在成为破解这道难题的核心方向。2026年上半年,多家量化对冲基金和金融科技公司已经将合成数据从”实验性探索”提升为”生产级基础设施”。这篇文章聊聊合成数据在金融大模型训练中的技术路线和真实价值。
金融数据的”不可能三角”#
训练一个能理解金融世界的大模型,面临三重约束:
第一,真实数据极度不足。 价格数据和公开财报只是冰山一角。大量有预测价值的信号——订单流细节、交易员决策过程、机构资金流动轨迹——要么不存在于文本中,要么受到严格的合规限制。即使你能拿到所有公开数据,训练出来的模型也只是学会了”已知世界的平均值”,而不是发现了新的 Alpha。
第二,历史数据没有分布外样本。 这是比数量不足更致命的问题。一个看遍全球所有股票历史数据的模型,仍然无法预测一次前所未有的金融危机,因为类似的极端事件在训练集中要么不存在,要么只有极少数样本。金融市场的根本特征就是”下次不一样”。
第三,真实数据的标注成本接近无穷。 要训练一个能评估”这份研报的论证逻辑是否有漏洞”的模型,你需要大量金融分析师对海量文本进行专业标注。任何一个有资格做这种标注的人,时间成本都极高。
合成数据的三条技术路线#
目前业界在金融合成数据上有三条并行的技术路线,各有侧重:
1. 基于大模型的文本合成#
用 GPT-4o、Claude 4 等通用大模型,按照精心设计的 prompt 模板批量生成”模拟金融文本”。典型场景包括:
- 模拟财报解读:给定一家真实公司的财务数字,让模型以不同风格的分析师口吻写解读报告。通过变化分析框架、着重点、悲观/乐观倾向,生成成百上千条训练样本。
- 模拟交易决策记录:构建一个交易员角色、给定市场背景,让模型输出完整的”观察 → 推理 → 决策 → 事后复盘”链条。
- 模拟金融问答对:从真实研报中提取关键知识点,让模型围绕这些知识点生成不同难度、不同角度的问答对。
这条路线的核心难点是幻觉控制。你需要确保合成数据中引用的数字、日期、事件在逻辑上自洽,不会产生”一家营收100万的公司市值却有一万亿美元”这种低级错误。目前主流的做法是在 prompt 中显式传入 ground truth 数据,并设置多轮验证流程。
2. 基于统计模型的时序合成#
用于生成合成价格序列和订单簿数据,而不是文本。
这类方法的思路是:先学习真实市场数据的统计特征——波动率聚类、肥尾分布、涨跌不对称性、交易量-波动率相关性等——然后用一个参数化的随机过程来生成具有相同统计特征的新序列。
常用技术包括:
- Heston 模型 + GARCH 残差注入:用 Heston 随机波动率模型生成骨架价格序列,再从真实数据的 GARCH 标准化残差中随机采样注入,让合成数据既保持数学结构的一致性,又保留真实市场的”不规则性”。
- GAN-based 合成:用生成对抗网络直接学习从噪声到价格序列的映射。TimeGAN 和 QuantGAN 是两个专门针对时间序列的变体,能够捕捉真实序列中的非线性依赖关系。
这条路线最大的价值:你可以用合成数据批量生成”从未发生过的崩盘场景”来训练模型。比如,把 2008 年美国次贷危机的市场波动特征嫁接到 2024 年的中国 A 股估值水平上,生成一种”如果 A 股遇到次贷级别冲击会怎样”的模拟轨迹。
3. 基于 Agent 的多智能体模拟#
这是 2026 年最前沿的方向。核心思路是:构建多个 LLM Agent,每个 Agent 扮演市场中的一个角色——基金经理、散户、量化策略、做市商、央行——让它们在一个模拟的市场环境中交互,产生决策轨迹。
这种方法的独特优势在于它能生成策略互动层面的合成数据。当”散户 Agent”因为恐慌消息而抛售、“量化 Agent”检测到流动性异常开始跟风、“做市商 Agent”修正报价——这个交互链条中产生的每一步决策文本,都是训练金融推理能力的高质量数据。
真正的突破点是:你可以在这个模拟环境中注入一个特定的事件(比如”央行意外加息 50bp”),然后观察所有 Agent 的反应轨迹。这种”可控实验”的数据在真实世界中几乎不可能获得。
合成数据的质量验证#
合成数据最大的风险不是它没用,而是它可能引入系统性偏差。如果你的合成数据生成器本身就是有偏的——比如总是在牛市中高估反转概率——那用这些数据训练的模型只会放大你的偏见。
目前行业实践的验证方法包括:
- 分布一致性检验:确保合成数据在关键统计量上与真实数据没有显著差异(K-S 检验、Wasserstein 距离)。
- 下游任务基准:不直接比较数据分布,而是比较模型在使用真实数据和合成数据上得到的结果。如果合成数据训练的模型在 real-world holdout 上的表现不比真实数据差太多,那合成数据就是有用的。
- 对抗性检测:训练一个二分类器来区分真实样本和合成样本。如果分类器的准确率接近随机猜测(50%),说明合成质量足够高。
对量化投资的启示#
对于量化团队来说,合成数据不是”锦上添花”,而是生存必需品。
大模型需要大量高质量标注数据来学习金融推理能力,而金融数据的稀缺性决定了获取成本必然极高。合成数据提供了一条用较低成本扩展训练数据规模的路径。
更重要的是,合成数据让你能够针对特定风险场景做定向训练。塔勒布式的黑天鹅问题——你的模型从未见过极端事件,所以无法预测它——可以通过在合成数据中刻意注入极端情景来缓解。
当然,合成数据不是万能的。它只能在你给它设定的框架内”举一反三”,无法凭空产生超出生成器知识范围的洞察。但话说回来——人类分析师不也是在有限的经验框架内做推理吗?关键在于,合成数据帮我们把”有限经验”的边界大幅拓宽了。
合成数据是金融大模型的新燃料。它不是替代真实数据,而是让你在真实数据不足的地方,建立起一座通往未知世界的桥梁。

