- 生成对抗模仿学习:从优秀交易员轨迹里学策略
行为克隆(BC)是'照葫芦画瓢'——把专家的每个动作都回归下来。但它有两个硬伤:演示里夹带的噪声会被一并背进策略,且它从不理解专家'为什么'这么做。生成对抗模仿学习(GAIL, Ho & Ermon 2016)换了个思路:不复制动作,而是训练一个判别器去分辨'这是专家轨迹还是我的轨迹',再用判别器的输出当奖励去训练策略,形成生成器与判别器的对抗博弈,等价于在匹配专家的状态-动作占用分布。本文用纯 numpy 从零实现一个带 dropout 的小 MLP 版 GAIL,诚实给出三个结论:GAIL 能从随机策略经对抗训练把真实回报从 -2.93 拉到 -1.65、判别器最终被'骗到分不清'(准确率 0.49→0.50,奖赏信号耗尽)、动作分布还原出贴近专家的形态;但也诚实标注——在单步 iid 模仿里 BC 直接回归更高效(BC -0.28 vs GAIL -1.70),GAIL 的真正优势场在序贯/误差累积场景。附完整 Python 与四张真实计算图。
13 min Chinese - 逆强化学习策略偏好推断:从一段「赚钱轨迹」反推出它到底在优化什么
我们知道某择时策略『很能赚钱』,但不知道它凭什么赚——它在奖励什么?逆强化学习(IRL)把这个问题反过来:给一段专家实际走过的轨迹,反推它背后的奖励函数。本文用纯 numpy 从零实现 MaxEnt IRL(Ziebart 2008):特征期望 + 梯度上升学奖励权重 + softmax 访问频率求解。在「专家其实在奖励『动量 + 低波动 + 周期 − 噪声』」的合成市场里,IRL 把奖励权重还原得与真值余弦相似度 0.94,学到的奖励重放出的状态分布与专家 KL=0.06(随机基线 0.23);并诚实拆穿「专家样本不足→奖励不可辨识 / 特征冗余→权重被错分 / 折扣因子误设 / 最大熵温度 / IRL 给的是偏好不是收益」五类真实陷阱(中阶)。
12 min Chinese
返回