Fundamentals

व्यक्तिगत एजेंट बेंचमार्क पैक

Personal Agent Benchmark Pack, स्थानीय व्यक्तिगत सहायक कार्यप्रवाहों के लिए एक छोटा, रिपॉज़िटरी-समर्थित QA परिदृश्य पैक है। यह कोई सामान्य मॉडल बेंचमार्क नहीं है और इसे किसी नए रनर की आवश्यकता नहीं है: यह निजी QA स्टैक (QA अवलोकन), सिंथेटिक QA चैनल, और मौजूदा qa/scenarios YAML कैटलॉग का पुनः उपयोग करता है।

परिदृश्य

qa/scenarios/personal/*.yaml में परिभाषित दस परिदृश्य:

परिदृश्य आईडी जाँच
personal-reminder-roundtrip स्थानीय Cron डिलीवरी के माध्यम से नकली व्यक्तिगत रिमाइंडर
personal-channel-thread-reply qa-channel के माध्यम से नकली DM और थ्रेड उत्तर की रूटिंग
personal-memory-preference-recall अस्थायी QA कार्यस्थान की मेमोरी फ़ाइलों से नकली प्राथमिकता को याद करना
personal-redaction-no-secret-leak नकली सीक्रेट को प्रतिध्वनित न करने की जाँच
personal-tool-safety-followthrough अनुमोदन-जैसी छोटी बातचीत के बाद सुरक्षित, रीड-समर्थित टूल फ़ॉलो-थ्रू
personal-approval-denial-stop संवेदनशील स्थानीय रीड अनुरोध के लिए अनुमोदन अस्वीकृति पर रुकने का व्यवहार
personal-task-followthrough-status प्रमाण-समर्थित कार्य स्थिति रिपोर्टिंग, जो लंबित, अवरुद्ध और पूर्ण को अलग रखती है
personal-share-safe-diagnostics-artifact साझा करने के लिए सुरक्षित निदान आर्टिफ़ैक्ट, जो कच्ची व्यक्तिगत सामग्री हटाकर उपयोगी स्थिति बनाए रखते हैं
personal-no-fake-progress प्रमाण-समर्थित पूर्णता दावे, जो स्थानीय साक्ष्य उपलब्ध होने से पहले नकली प्रगति नहीं दिखाते
personal-failure-recovery विफलता से रिकवरी, जो आंशिक स्थिति रिपोर्ट करती है और पुनः प्रयास की सीमाएँ स्पष्ट रखती है

मशीन-पठनीय पैक मेटाडेटा (आईडी सूची, शीर्षक, विवरण) extensions/qa-lab/src/scenario-packs.ts में QA_PERSONAL_AGENT_SCENARIO_IDS के रूप में मौजूद है। --pack personal-agent के साथ पैक चलाएँ:

bash
OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa suite \  --provider-mode mock-openai \  --pack personal-agent \  --concurrency 1

बार-बार दिए गए --scenario फ़्लैग के साथ --pack योगात्मक है। स्पष्ट परिदृश्य पहले चलते हैं, फिर डुप्लिकेट हटाकर पैक के परिदृश्य QA_PERSONAL_AGENT_SCENARIO_IDS क्रम में चलते हैं।

यह पैक mock-openai या किसी अन्य स्थानीय QA प्रदाता लेन के साथ qa-channel को लक्षित करता है। इसे लाइव चैट सेवाओं या वास्तविक व्यक्तिगत खातों की ओर निर्देशित न करें।

गोपनीयता मॉडल

परिदृश्य केवल नकली उपयोगकर्ताओं, नकली प्राथमिकताओं, नकली सीक्रेट और सुइट द्वारा बनाए गए अस्थायी QA Gateway कार्यस्थान का उपयोग करते हैं। उन्हें वास्तविक OpenClaw उपयोगकर्ता मेमोरी, सत्र, क्रेडेंशियल, लॉन्च एजेंट, वैश्विक कॉन्फ़िगरेशन या लाइव Gateway स्थिति को पढ़ना या लिखना नहीं चाहिए।

आर्टिफ़ैक्ट मौजूदा QA सुइट आर्टिफ़ैक्ट डायरेक्टरी के अंतर्गत रहते हैं और उन्हें परीक्षण आउटपुट की तरह माना जाता है। रिडैक्शन जाँच नकली मार्कर का उपयोग करती हैं, इसलिए विफलताओं का सुरक्षित रूप से निरीक्षण किया जा सकता है और उन्हें समस्याओं के रूप में दर्ज किया जा सकता है।

पैक का विस्तार करना

qa/scenarios/personal/ के अंतर्गत नए .yaml केस जोड़ें, फिर परिदृश्य आईडी को QA_PERSONAL_AGENT_SCENARIO_IDS में जोड़ें। प्रत्येक केस को छोटा, स्थानीय, mock-openai में निर्धारक और किसी एक व्यक्तिगत सहायक व्यवहार पर केंद्रित रखें।

अच्छे अनुवर्ती उम्मीदवार: रिडैक्ट किए गए ट्रैजेक्टरी निर्यात की जाँच, केवल-स्थानीय Plugin कार्यप्रवाह की जाँच।

जब तक परिदृश्य कैटलॉग में उस सतह को उचित ठहराने के लिए पर्याप्त स्थिर केस न हों, तब तक नया रनर, Plugin, निर्भरता, लाइव ट्रांसपोर्ट या मॉडल निर्णायक जोड़ने से बचें।

Was this useful?
On this page

On this page