离线强化学习交易:用 CQL 保守 Q 学习做策略迁移
实盘不允许在线试错,离线 RL 只用历史日志学策略——但直接把 Q 学习搬到固定数据集会灾难:Bellman 目标里的 maxₐQ 专挑没被覆盖的 OOD 动作、把 Q 越推越高(自举高估),部署即崩。CQL(NeurIPS 2020)加保守正则:压低所有动作 logsumexp Q、抬高数据里真实动作 Q,给未见动作上保守下限。纯 numpy 表格版 CQL,在「趋势为主+偶发反转」合成 MDP 上用只覆盖 40% 格子的 800 步窄日志训练,40 个样本外新市场平均实测:Naive-FQI 总收益 −61%/Sharpe −1.18/回撤 65%/胜率 0%,CQL +11.5%/+0.43/7.5%/72%——OOD 动作平均 Q 从 0 压到 −0.44。诚实翻车:α 太小压不住高估、过大退化成行为克隆收益封顶;数据一充足 Naive 反超 CQL。拆穿离线=免费午餐/覆盖不重要/α越大越稳/合成赢=实盘赢/保守必胜五类陷阱(中阶)。