- 扩散模型合成金融序列:为稀缺行情数据做可控数据增强
金融时间序列数据稀缺且标注成本高,扩散模型(Diffusion Model)通过前向加噪与反向去噪的迭代过程,能够生成保持真实统计特性(厚尾、波动聚集、长记忆)的合成数据。本文用 Python 从零实现 DDPM 骨架,在受控实验中证伪三个常见直觉,并给出条件生成与数据增强的实务框架。
13 min Chinese - 扩散模型收益分布建模:用分数匹配拟合整条尾部
金融收益的尾部风险远比正态假设预测的更厚,传统参数方法(GARCH、t分布)在极端分位点仍然系统性偏差。本文用分数匹配(Score Matching)从原始收益数据直接估计整条概率密度——不假设分布族、不依赖MLE的尾部外推,用核密度与数值score估计把VaR从『正态幻觉』拉回真实数据。受控实验证明:t₄分布下正态VaR在1%水平低估极端损失达3.2pp,而分数匹配几乎贴紧真实分位点。附完整Python实现与三张真实计算图。
13 min Chinese - 得分匹配生成金融序列:用去噪分数匹配合成行情
生成式模型要学分布 p(x) 却卡在归一化常数 Z 上。得分匹配(Hyvärinen 2005)绕开 Z——只学分数 s(x)=∇log p(x),它与 Z 无关。去噪分数匹配 DSM(Vincent 2011)更妙:给数据加噪 x̃=x+σε,让网络学预测 (x−x̃)/σ²,等价于「从噪声指回干净数据的方向」;采样用 Langevin 动力学沿分数场爬向高密度区。这正是当今扩散模型(Diffusion)的数学地基。纯 numpy 从零实现 DSM 闭式最优解(Parzen/Tweedie 去噪器)+ Langevin 采样,在「平静态+危机态」混合的重尾金融收益上实测:生成样本还原资产相关 ρ=0.49(真实 0.54)、下尾联动 P(B跌|A跌)=0.45(真实 0.47),重尾与左偏形状 QQ 图基本对齐;但诚实翻车——Langevin 步长 δ 太大方差爆炸(δ=0.2 时 std 误差 9.7)、太小混合慢覆盖不足,且低密度区分数估计误差随距离线性上升(斜率 7.1),采样进不去稀有危机区。拆穿分数匹配免归一化就免费/单尺度够用/Langevin 随便调/生成即真实/直接造行情五类陷阱(中阶)。
12 min Chinese - 扩散模型生成合成行情:用 DDPM 做组合压力测试
历史太短、极端行情稀少,传统压力测试只能回看有限样本。本文用纯 numpy 实现 DDPM 扩散模型生成海量合成 30 日行情,补全历史稀疏的尾部,给出更稳的压力 VaR,并诚实列出过弥散、无法凭空创造新危机等真实陷阱。
12 min Chinese
返回