[03:59:02] ================================================== [03:59:02] 持续训练 启动 | 截止 08:00 [03:59:02] 策略: 首轮10k → 后续5k/轮 [03:59:02] ================================================== [03:59:02] ── 第1轮 10000局 (剩241min) ── [03:59:02] ── 自对弈 10000局 ── [05:57:41] Rounds: 10000/10000 Errors: 0 Total: 118.5min Avg: 0.7s/round [05:57:41] 10000 CSV [05:57:41] ── V训练 ── [05:57:59] 154235 samples from 10000 games [0713 08:43:51] ================================================== [0713 08:43:51] 持续训练: 20k局/轮 | 无限循环 [0713 08:43:51] ================================================== [0713 08:43:51] ── 第1轮: 20000局 ── [0713 08:43:51] ── 自对弈 20000局 ── [0713 11:26:27] filtered out 2 non-Neural states [0713 11:39:07] 25 ISMCTS q-value samples [0713 11:39:07] filtered 10427 unusable states [0713 11:39:24] 25 ISMCTS q-value samples [0713 11:39:24] filtered 12 unusable states [0713 11:46:51] ================================================== [0713 11:46:51] 持续训练: 20k局/轮 | Neural-only + replay + eval [0713 11:46:51] ================================================== [0713 11:46:51] ── 第1轮: 20000局 ── [0713 11:46:51] ── 自对弈 20000局 ── [0713 11:51:21] ================================================== [0713 11:51:21] 持续训练: 20k局/轮 | Neural-only + replay + eval [0713 11:51:21] ================================================== [0713 11:51:21] ── 第1轮: 20000局 ── [0713 11:51:21] ── 自对弈 20000局 ──