Topic · unordered discovery

Reproducibility

Repeatable environments, runs, provenance, and continuation contracts.

Engineering

Projects

從 Atari 訓練、可重現實驗與模型評估,一路延伸到 ONNX 與瀏覽器部署的強化學習工程專案。

The project carries reproducible training, evaluation, ONNX inference, and an interactive browser demo as one connected engineering story.

Writing

3 分鐘

AI 怎麼從 Breakout 畫面學會選動作?

從打磚塊的一次互動開始,理解模型看到的畫面、即時得分與未來價值,並看 Q-Learning 如何把未來的回饋傳回現在。

Reinforcement LearningDQNEvaluation
4 分鐘

DQN 得分比較高,就代表真的會玩嗎?

一個 DQN 看似贏過隨機策略,逐局檢查卻發現它常卡在等待畫面。從這個反常結果理解訓練、除錯與公平評估。

Reinforcement LearningDQNEvaluation
3 分鐘

讓 Breakout DQN 從遊戲畫面走到瀏覽器

從打磚塊的畫面、模型學習與公平比較,看到 DQN 如何成為能在瀏覽器中遊玩的系統,以及這些結果還不能說明什麼。

Reinforcement LearningDQNReproducibility

Related Series