Fundamentals

個人代理程式基準測試套件

個人代理基準測試套件是一個由小型儲存庫支援的 QA 情境套件,適用於 本機個人助理工作流程。它不是通用模型基準測試,也 不需要新的執行器:它會重複使用私有 QA 堆疊(QA 概覽)、 合成的 QA 頻道,以及現有的 qa/scenarios YAML 目錄。

情境

共十個情境,定義於 qa/scenarios/personal/*.yaml

情境 ID 檢查項目
personal-reminder-roundtrip 透過本機排程傳送的虛假個人提醒
personal-channel-thread-reply 透過 qa-channel 進行虛假私訊與討論串回覆路由
personal-memory-preference-recall 從暫時 QA 工作區記憶檔案中叫回虛假偏好設定
personal-redaction-no-secret-leak 虛假機密不回顯檢查
personal-tool-safety-followthrough 在簡短的核准式對話後,安全地繼續使用具讀取依據的工具
personal-approval-denial-stop 敏感本機讀取要求遭拒絕核准後的停止行為
personal-task-followthrough-status 具證據依據的任務狀態報告,將待處理、受阻和已完成狀態分開
personal-share-safe-diagnostics-artifact 可安全分享的診斷成品,在省略原始個人內容的同時保留實用狀態
personal-no-fake-progress 具證據依據的完成宣告,避免在取得本機證據前虛報進度
personal-failure-recovery 回報部分狀態並明確標示重試界線的失敗復原

機器可讀取的套件中繼資料(ID 清單、標題、說明)位於 extensions/qa-lab/src/scenario-packs.ts,其名稱為 QA_PERSONAL_AGENT_SCENARIO_IDS。 使用 --pack personal-agent 執行套件:

bash
OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa suite \  --provider-mode mock-openai \  --pack personal-agent \  --concurrency 1

--pack 可透過重複使用 --scenario 旗標累加。明確指定的情境會 先執行,接著套件情境會依 QA_PERSONAL_AGENT_SCENARIO_IDS 順序執行, 並移除重複項目。

此套件以搭配 mock-openai 或其他本機 QA 提供者 執行路徑的 qa-channel 為目標。請勿將它指向即時聊天服務或真實個人帳號。

隱私權模型

情境只會使用虛假使用者、虛假偏好設定、虛假機密,以及 套件建立的暫時 QA 閘道工作區。它們不得讀取或 寫入真實 OpenClaw 使用者的記憶、工作階段、認證資訊、啟動代理程式、全域 設定或即時閘道狀態。

成品會保留在現有的 QA 套件成品目錄下,並視為 測試輸出。遮蔽檢查會使用虛假標記,因此可安全地 檢查失敗並將其提交至議題。

擴充套件

qa/scenarios/personal/ 下新增 .yaml 案例,然後將情境 ID 新增至 QA_PERSONAL_AGENT_SCENARIO_IDS。每個案例應保持小型、僅限本機,並在 mock-openai 中具有確定性,且聚焦於一項個人助理行為。

良好的後續候選項目:已遮蔽的軌跡匯出檢查、僅限本機的 外掛工作流程檢查。

在情境目錄擁有足夠穩定的案例,足以證明新增介面的合理性之前, 請避免新增執行器、外掛、相依套件、即時傳輸或模型評審器。

Was this useful?
On this page

On this page