返回
在线 RL 在交易里等于拿真金白银探索,几乎不可用。Offline RL 只用历史数据学策略、不与环境交互,但朴素离线 Q 因分布偏移给未支持动作虚高估值、策略幻想、收益崩塌。本文用可复现 Python 演示这一失败,并给出行为克隆 / 保守 Q 学习(CQL)解法与落地清单。
量化交易
离线强化学习
offline rl
保守 q 学习
分布偏移
行为克隆
python