dc17c0f464
feat: position rotation every 10 games in self-play
...
--mix-rotate: 每10局轮换bot排列
[ISMCTS,ISMCTS,NEURAL] → [NEURAL,ISMCTS,ISMCTS] → [ISMCTS,NEURAL,ISMCTS]
Neural 三个位置都练到, 数据分布平衡
orchestrator改用--mix-rotate替换--mix
2026-07-13 11:28:45 +08:00
4e6ad234da
feat: Neural-only training, experience replay, per-round eval
...
3个训练效率提升:
1. Neural filter: V训练只取player=2数据, 排除ISMCTS状态干扰
旧格式(无player列)自动fallback全量数据
2. 经验回放: 保留最近3轮数据混入当前轮训练, 扩大分布覆盖
存储到 paodekuai-trainer/data/replay_buffer.pkl
3. 每轮eval: 训练后跑200局--eval测胜率, 下降>10%自动回滚
回滚到 model_prev.pt, 防止坏模型污染下轮数据
2026-07-13 11:26:40 +08:00
98ab4414a4
feat: improve V-training loop — weight decay, cosine LR, early stop
...
- Adam weight_decay=1e-5 to prevent overfitting
- CosineAnnealingLR 0.001→1e-5 over 50 epochs
- Early stopping after 10 epochs without improvement
- Epochs: 20→50 max (with early stop typically fewer)
2026-07-13 11:24:42 +08:00
4c1b1c971c
feat: 20k局/轮无限训练 + scan_wins支持存档目录
2026-07-13 08:43:39 +08:00
27d7e28236
fix: 训练编排器 — V训练从头开始 + ONNX外部数据文件复制
2026-07-13 08:14:05 +08:00