传统量化把「预测下一帧价格」当回归问题,但真实市场里你下每一笔单都会改变价格、还会被对手反制。多智能体强化学习(MARL)把交易当成博弈:你、其他机构、做市商都是同时决策的智能体。本文用 Almgren-Chriss 瞬时冲击下的执行博弈做受控实验,证明「对手建模」比朴素 TWAP 在 2 人博弈里省 1.47 bps(约 24.5%)、多智能体虚拟博弈把早期撞车损耗从 87.1 bps 砍到 27.3 bps(降幅 68.7%);并诚实给出可预测性消融——对手越不可预测,建模优势越消失——以及真实落地时四类必踩的坑。附完整 Python 与四张真实计算图。