逆强化学习策略偏好推断:从一段「赚钱轨迹」反推出它到底在优化什么
我们知道某择时策略『很能赚钱』,但不知道它凭什么赚——它在奖励什么?逆强化学习(IRL)把这个问题反过来:给一段专家实际走过的轨迹,反推它背后的奖励函数。本文用纯 numpy 从零实现 MaxEnt IRL(Ziebart 2008):特征期望 + 梯度上升学奖励权重 + softmax 访问频率求解。在「专家其实在奖励『动量 + 低波动 + 周期 − 噪声』」的合成市场里,IRL 把奖励权重还原得与真值余弦相似度 0.94,学到的奖励重放出的状态分布与专家 KL=0.06(随机基线 0.23);并诚实拆穿「专家样本不足→奖励不可辨识 / 特征冗余→权重被错分 / 折扣因子误设 / 最大熵温度 / IRL 给的是偏好不是收益」五类真实陷阱(中阶)。