3个训练效率提升: 1. Neural filter: V训练只取player=2数据, 排除ISMCTS状态干扰 旧格式(无player列)自动fallback全量数据 2. 经验回放: 保留最近3轮数据混入当前轮训练, 扩大分布覆盖 存储到 paodekuai-trainer/data/replay_buffer.pkl 3. 每轮eval: 训练后跑200局--eval测胜率, 下降>10%自动回滚 回滚到 model_prev.pt, 防止坏模型污染下轮数据
3个训练效率提升: 1. Neural filter: V训练只取player=2数据, 排除ISMCTS状态干扰 旧格式(无player列)自动fallback全量数据 2. 经验回放: 保留最近3轮数据混入当前轮训练, 扩大分布覆盖 存储到 paodekuai-trainer/data/replay_buffer.pkl 3. 每轮eval: 训练后跑200局--eval测胜率, 下降>10%自动回滚 回滚到 model_prev.pt, 防止坏模型污染下轮数据