Series

Application Trilogy:Agent Harness

6 篇 · 建議依序閱讀

  1. 01

    什麼是 Agent Harness?

    從測試、評估到可觀測性,理解 Agent Harness 如何整合三者,讓 Agent 從「能跑」走向「可靠」。

    2026.09.21 · 22 min
  2. 02

    測試案例設計:從單元到端到端

    從單元、整合、端到端到對抗測試,理解如何設計有效的測試案例,並用 Python 實作一個完整的測試案例管理系統。

    2026.09.21 · 28 min
  3. 03

    自動化執行與評分:Runner、Evaluator 與報告

    實作 Harness 的核心引擎,從批次執行、多維度評分到版本比較,建立完整的自動化測試系統。

    2026.09.21 · 28 min
  4. 04

    LLM-as-Judge 與 Jev:推理式評估與決策式評估的取捨

    從推理式評估到決策式評估,理解 LLM-as-Judge 與 Jev 兩種評估範式的原理、優勢、局限與取捨策略。

    2026.09.21 · 22 min
  5. 05

    回歸測試與失敗分析:確保修改不退步

    從基準線建立、差異檢測、失敗分類到根因分析,用 Python 實作完整的回歸與失敗分析系統。

    2026.09.21 · 28 min
  6. 06

    CI/CD 整合與持續改進:讓 Harness 自動跑

    從 GitHub Actions 整合、門檻設定到生產環境回饋與測試集演化,建立完整的自動化持續改進系統。

    2026.09.21 · 30 min