PPO 强化学习交易:用近端策略优化学会在连续动作空间下单
监督学习只能回答『下一期涨还是跌』,回答不了『该持多少仓』——仓位是个连续决策,且换手有成本、决策有惯性,这天然是强化学习问题。PPO 是策略梯度的工程化版本:用概率比 r(θ) 度量新旧策略偏移,clip 目标把更新钉死在信任域 [1-ε,1+ε] 内,防止一次大步毁掉整个策略。本文纯 numpy 实现线性高斯策略 PPO(tanh 均值头 + 可学习 σ + GAE 优势估计),在 OU 均值回复合成市场上训练 200 轮:episode 奖励从 -8.9 爬到 +7.0,agent 自己学会『涨多了做空、跌多了做多』的平滑连续仓位函数。样本外对比揭示连续动作的真正价值:PPO Sharpe 1.57 与硬规则 ±1 满仓反转的 1.75 接近,但最大回撤只有其 1/5(-3.5% vs -17.2%)、换手只有其 1/5——它学到的不是更强的信号,而是更聪明的仓位。拆穿 reward=收益率就够了/训练曲线涨=真学会了/RL 免疫过拟合/σ 收敛=策略成熟四类陷阱(中阶)。