Fundamentals
個人代理程式基準測試套件
個人代理基準測試套件是一個由小型儲存庫支援的 QA 情境套件,適用於
本機個人助理工作流程。它不是通用模型基準測試,也
不需要新的執行器:它會重複使用私有 QA 堆疊(QA 概覽)、
合成的 QA 頻道,以及現有的
qa/scenarios YAML 目錄。
情境
共十個情境,定義於 qa/scenarios/personal/*.yaml:
| 情境 ID | 檢查項目 |
|---|---|
personal-reminder-roundtrip |
透過本機排程傳送的虛假個人提醒 |
personal-channel-thread-reply |
透過 qa-channel 進行虛假私訊與討論串回覆路由 |
personal-memory-preference-recall |
從暫時 QA 工作區記憶檔案中叫回虛假偏好設定 |
personal-redaction-no-secret-leak |
虛假機密不回顯檢查 |
personal-tool-safety-followthrough |
在簡短的核准式對話後,安全地繼續使用具讀取依據的工具 |
personal-approval-denial-stop |
敏感本機讀取要求遭拒絕核准後的停止行為 |
personal-task-followthrough-status |
具證據依據的任務狀態報告,將待處理、受阻和已完成狀態分開 |
personal-share-safe-diagnostics-artifact |
可安全分享的診斷成品,在省略原始個人內容的同時保留實用狀態 |
personal-no-fake-progress |
具證據依據的完成宣告,避免在取得本機證據前虛報進度 |
personal-failure-recovery |
回報部分狀態並明確標示重試界線的失敗復原 |
機器可讀取的套件中繼資料(ID 清單、標題、說明)位於
extensions/qa-lab/src/scenario-packs.ts,其名稱為 QA_PERSONAL_AGENT_SCENARIO_IDS。
使用 --pack personal-agent 執行套件:
OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa suite \ --provider-mode mock-openai \ --pack personal-agent \ --concurrency 1--pack 可透過重複使用 --scenario 旗標累加。明確指定的情境會
先執行,接著套件情境會依 QA_PERSONAL_AGENT_SCENARIO_IDS 順序執行,
並移除重複項目。
此套件以搭配 mock-openai 或其他本機 QA 提供者
執行路徑的 qa-channel 為目標。請勿將它指向即時聊天服務或真實個人帳號。
隱私權模型
情境只會使用虛假使用者、虛假偏好設定、虛假機密,以及 套件建立的暫時 QA 閘道工作區。它們不得讀取或 寫入真實 OpenClaw 使用者的記憶、工作階段、認證資訊、啟動代理程式、全域 設定或即時閘道狀態。
成品會保留在現有的 QA 套件成品目錄下,並視為 測試輸出。遮蔽檢查會使用虛假標記,因此可安全地 檢查失敗並將其提交至議題。
擴充套件
在 qa/scenarios/personal/ 下新增 .yaml 案例,然後將情境 ID
新增至 QA_PERSONAL_AGENT_SCENARIO_IDS。每個案例應保持小型、僅限本機,並在
mock-openai 中具有確定性,且聚焦於一項個人助理行為。
良好的後續候選項目:已遮蔽的軌跡匯出檢查、僅限本機的 外掛工作流程檢查。
在情境目錄擁有足夠穩定的案例,足以證明新增介面的合理性之前, 請避免新增執行器、外掛、相依套件、即時傳輸或模型評審器。