- 强化学习最优执行:用策略梯度把大单拆成低冲击序列
要卖掉 100 万股,一次性砸下去会把价格砸穿;TWAP 均分又扛着最大的库存风险。经典 Almgren-Chriss(AC) 用闭式解给出「前重后轻」的最优拆单,但它假设连续时间、平滑冲击。本文用 REINFORCE 策略梯度直接在离散环境里学拆单:30 步、临时冲击 ε=0.01、波动 σ=0.05、风险厌恶 λ=9。结果——REINFORCE 期望总成本 0.00367(3.67bps),远低于 TWAP 的 0.01082(10.82bps, 降 66%),也比 naive 离散化的 AC 闭式(0.00583)更低;实现短fall 标准差从 TWAP 的 0.032 压到 0.005(约 1/6)。图表显示它学到与 AC 一致的「前重后轻」,且因为端到端优化真实离散成本,落在 AC 公式之下。附完整 numpy 实现与四张真实计算图。
9 min Chinese - 元强化学习少样本适应:让交易智能体在新市场快速上手
一个在A股练出来的RL交易智能体,丢到美股/加密/商品市场为什么往往废掉?元强化学习(MAML)通过学一个『靠近所有历史市场』的初始化,让智能体在新市场只用几笔交易就完成适应。本文numpy从零实现双层梯度的MAML,受控实验证明少样本爬坡速度比『仅预训练』快约一倍、比从头训练快一个数量级,并诚实标注它只迁移『市场结构的共性』而非『具体alpha』。
15 min Chinese - PPO 强化学习交易:用近端策略优化学会在连续动作空间下单
监督学习只能回答『下一期涨还是跌』,回答不了『该持多少仓』——仓位是个连续决策,且换手有成本、决策有惯性,这天然是强化学习问题。PPO 是策略梯度的工程化版本:用概率比 r(θ) 度量新旧策略偏移,clip 目标把更新钉死在信任域 [1-ε,1+ε] 内,防止一次大步毁掉整个策略。本文纯 numpy 实现线性高斯策略 PPO(tanh 均值头 + 可学习 σ + GAE 优势估计),在 OU 均值回复合成市场上训练 200 轮:episode 奖励从 -8.9 爬到 +7.0,agent 自己学会『涨多了做空、跌多了做多』的平滑连续仓位函数。样本外对比揭示连续动作的真正价值:PPO Sharpe 1.57 与硬规则 ±1 满仓反转的 1.75 接近,但最大回撤只有其 1/5(-3.5% vs -17.2%)、换手只有其 1/5——它学到的不是更强的信号,而是更聪明的仓位。拆穿 reward=收益率就够了/训练曲线涨=真学会了/RL 免疫过拟合/σ 收敛=策略成熟四类陷阱(中阶)。
15 min Chinese - 共形强化学习交易:给 RL 动作一个可验证的覆盖保证
RL 输出一个 Q 值就下单,但点估计不带可靠性凭证——分布一漂移就「自信地犯错」。共形预测包裹任意预测器输出预测区间,有限样本+分布无关保证以 ≥1−α 覆盖真实收益,唯一假设是可交换性。据此设计带可验证下限的交易规则:仅当共形收益下界>0 才出手。纯 numpy 分裂共形+局部自适应,异方差+协变量偏移合成 bandit 上实测:同分布目标覆盖 90% 实测 91.1%(保证兑现);门控把开仓即盈利命中率从 76.9% 抬到 97.4%,代价出手率降到 17.1%。诚实翻车:可交换性破坏→偏移 3.0 时覆盖从 90% 崩到 53.8%;边际覆盖达标≠处处达标——普通等宽区间高波动区只覆盖 49%、低波动区 98%,需局部自适应共形拉回 87%~92%。拆穿保证=永真/边际=条件/区间=预测准/无分布=无假设/覆盖达标即可交易五类陷阱(中阶)。
16 min Chinese - 离线强化学习交易:用 CQL 保守 Q 学习做策略迁移
实盘不允许在线试错,离线 RL 只用历史日志学策略——但直接把 Q 学习搬到固定数据集会灾难:Bellman 目标里的 maxₐQ 专挑没被覆盖的 OOD 动作、把 Q 越推越高(自举高估),部署即崩。CQL(NeurIPS 2020)加保守正则:压低所有动作 logsumexp Q、抬高数据里真实动作 Q,给未见动作上保守下限。纯 numpy 表格版 CQL,在「趋势为主+偶发反转」合成 MDP 上用只覆盖 40% 格子的 800 步窄日志训练,40 个样本外新市场平均实测:Naive-FQI 总收益 −61%/Sharpe −1.18/回撤 65%/胜率 0%,CQL +11.5%/+0.43/7.5%/72%——OOD 动作平均 Q 从 0 压到 −0.44。诚实翻车:α 太小压不住高估、过大退化成行为克隆收益封顶;数据一充足 Naive 反超 CQL。拆穿离线=免费午餐/覆盖不重要/α越大越稳/合成赢=实盘赢/保守必胜五类陷阱(中阶)。
17 min Chinese - 逆强化学习策略偏好推断:从一段「赚钱轨迹」反推出它到底在优化什么
我们知道某择时策略『很能赚钱』,但不知道它凭什么赚——它在奖励什么?逆强化学习(IRL)把这个问题反过来:给一段专家实际走过的轨迹,反推它背后的奖励函数。本文用纯 numpy 从零实现 MaxEnt IRL(Ziebart 2008):特征期望 + 梯度上升学奖励权重 + softmax 访问频率求解。在「专家其实在奖励『动量 + 低波动 + 周期 − 噪声』」的合成市场里,IRL 把奖励权重还原得与真值余弦相似度 0.94,学到的奖励重放出的状态分布与专家 KL=0.06(随机基线 0.23);并诚实拆穿「专家样本不足→奖励不可辨识 / 特征冗余→权重被错分 / 折扣因子误设 / 最大熵温度 / IRL 给的是偏好不是收益」五类真实陷阱(中阶)。
12 min Chinese - 强化学习算法交易:从Q-Learning到深度强化学习的量化实践
深入探讨强化学习在量化交易中的应用,从传统的Q-Learning算法到现代深度强化学习方法(DQN、PPO、A3C),包含完整的Python实战代码和回测框架。
19 min zh
返回