Series
Application Trilogy:Agent Harness
- 01
什麼是 Agent Harness?
從測試、評估到可觀測性,理解 Agent Harness 如何整合三者,讓 Agent 從「能跑」走向「可靠」。
→ - 02
測試案例設計:從單元到端到端
從單元、整合、端到端到對抗測試,理解如何設計有效的測試案例,並用 Python 實作一個完整的測試案例管理系統。
→ - 03
自動化執行與評分:Runner、Evaluator 與報告
實作 Harness 的核心引擎,從批次執行、多維度評分到版本比較,建立完整的自動化測試系統。
→ - 04
LLM-as-Judge 與 Jev:推理式評估與決策式評估的取捨
從推理式評估到決策式評估,理解 LLM-as-Judge 與 Jev 兩種評估範式的原理、優勢、局限與取捨策略。
→ - 05
回歸測試與失敗分析:確保修改不退步
從基準線建立、差異檢測、失敗分類到根因分析,用 Python 實作完整的回歸與失敗分析系統。
→ - 06
CI/CD 整合與持續改進:讓 Harness 自動跑
從 GitHub Actions 整合、門檻設定到生產環境回饋與測試集演化,建立完整的自動化持續改進系統。
→