Topic · unordered discovery

Evaluation

Experimental protocols, metrics, uncertainty, and model selection.

Engineering

Projects

Completed

在控制推論成本的前提下提升 Text-to-SQL 準確率的碩士論文研究專案。

The final public run answered 1,023 of 1,534 development questions with Gemini 3.1 Flash Lite on the dev_20240627 split.

Completed deep-learning course experiment · 東華大學課程作業

LadaGAN–EfficientNetV2

在深度學習課程中完成的人臉生成與真假影像評估實驗,保留 checkpoint、資料管線與評估限制。

課程實驗記錄第 1–30 個選定 checkpoint、每個 checkpoint 5,000 張的生成設定,以及用於判別器訓練的 real/fake 資料建構;GitHub 未提交訓練後權重。

Writing

3 分鐘

AI 怎麼從 Breakout 畫面學會選動作?

從打磚塊的一次互動開始,理解模型看到的畫面、即時得分與未來價值,並看 Q-Learning 如何把未來的回饋傳回現在。

Reinforcement LearningDQNEvaluation
4 分鐘

DQN 得分比較高,就代表真的會玩嗎?

一個 DQN 看似贏過隨機策略,逐局檢查卻發現它常卡在等待畫面。從這個反常結果理解訓練、除錯與公平評估。

Reinforcement LearningDQNEvaluation
3 分鐘

訓練更快,DQN 就更好嗎?

同時跑更多場 Breakout 確實能加快經驗收集,但速度不等於學得更好。從模型比較與新局面測試,看一次高分能說明多少。

Reinforcement LearningDQNEvaluation
3 分鐘

讓 Breakout DQN 從遊戲畫面走到瀏覽器

從打磚塊的畫面、模型學習與公平比較,看到 DQN 如何成為能在瀏覽器中遊玩的系統,以及這些結果還不能說明什麼。

Reinforcement LearningDQNReproducibility

Related Series