Topic · unordered discovery
DQN
DQN-family architecture, training, and comparison.
AI and ML
Projects
Active
從 Atari 訓練、可重現實驗與模型評估,一路延伸到 ONNX 與瀏覽器部署的強化學習工程專案。
The project carries reproducible training, evaluation, ONNX inference, and an interactive browser demo as one connected engineering story.
Writing
球掉一條命時多扣一分,真的會讓 AI 玩得更好嗎?
三次獨立訓練得到不同方向的結果。比較失命時多扣一分是否能穩定提高打磚塊的原始得分。
Reinforcement LearningDQNEvaluation
AI 怎麼從 Breakout 畫面學會選動作?
從打磚塊的一次互動開始,理解模型看到的畫面、即時得分與未來價值,並看 Q-Learning 如何把未來的回饋傳回現在。
Reinforcement LearningDQNEvaluation
DQN 得分比較高,就代表真的會玩嗎?
一個 DQN 看似贏過隨機策略,逐局檢查卻發現它常卡在等待畫面。從這個反常結果理解訓練、除錯與公平評估。
Reinforcement LearningDQNEvaluation
訓練更快,DQN 就更好嗎?
同時跑更多場 Breakout 確實能加快經驗收集,但速度不等於學得更好。從模型比較與新局面測試,看一次高分能說明多少。
Reinforcement LearningDQNEvaluation
讓 Breakout DQN 從遊戲畫面走到瀏覽器
從打磚塊的畫面、模型學習與公平比較,看到 DQN 如何成為能在瀏覽器中遊玩的系統,以及這些結果還不能說明什麼。
Reinforcement LearningDQNReproducibility