Topic · unordered discovery

Reinforcement Learning

RL environments, policies, rewards, training, and evaluation.

AI and ML

Projects

從 Atari 訓練、可重現實驗與模型評估,一路延伸到 ONNX 與瀏覽器部署的強化學習工程專案。

The project carries reproducible training, evaluation, ONNX inference, and an interactive browser demo as one connected engineering story.

Writing

3 分鐘

AI 怎麼從 Breakout 畫面學會選動作?

從打磚塊的一次互動開始,理解模型看到的畫面、即時得分與未來價值,並看 Q-Learning 如何把未來的回饋傳回現在。

Reinforcement LearningDQNEvaluation
4 分鐘

DQN 得分比較高,就代表真的會玩嗎?

一個 DQN 看似贏過隨機策略,逐局檢查卻發現它常卡在等待畫面。從這個反常結果理解訓練、除錯與公平評估。

Reinforcement LearningDQNEvaluation
3 分鐘

訓練更快,DQN 就更好嗎?

同時跑更多場 Breakout 確實能加快經驗收集,但速度不等於學得更好。從模型比較與新局面測試,看一次高分能說明多少。

Reinforcement LearningDQNEvaluation
3 分鐘

讓 Breakout DQN 從遊戲畫面走到瀏覽器

從打磚塊的畫面、模型學習與公平比較,看到 DQN 如何成為能在瀏覽器中遊玩的系統,以及這些結果還不能說明什麼。

Reinforcement LearningDQNReproducibility

Related Series