Tools

การสร้างวิดีโอ

เอเจนต์ OpenClaw สร้างวิดีโอจากพรอมต์ข้อความ รูปภาพอ้างอิง หรือ วิดีโอที่มีอยู่ผ่าน video_generate รองรับแบ็กเอนด์ผู้ให้บริการ 16 ราย โดยเอเจนต์จะเลือกรายที่เหมาะสมโดยอัตโนมัติตามการกำหนดค่าและ คีย์ API ที่มีอยู่

video_generate มีโหมดรันไทม์สามโหมด ซึ่งพิจารณาจากอินพุตอ้างอิง ในการเรียกใช้:

  • generate - ไม่มีสื่ออ้างอิง (ข้อความเป็นวิดีโอ)
  • imageToVideo - รูปภาพอ้างอิงอย่างน้อยหนึ่งรูป
  • videoToVideo - วิดีโออ้างอิงอย่างน้อยหนึ่งรายการ

ผู้ให้บริการอาจรองรับโหมดเหล่านี้เพียงบางส่วน เครื่องมือจะตรวจสอบ โหมดที่ใช้งานอยู่ก่อนส่งคำขอ และรายงานโหมดที่รองรับใน action=list

เริ่มต้นอย่างรวดเร็ว

  • กำหนดค่าการยืนยันตัวตน

    ตั้งค่าคีย์ API สำหรับผู้ให้บริการที่รองรับรายใดก็ได้:

    bash
    export GEMINI_API_KEY="your-key"
  • เลือกโมเดลเริ่มต้น (ไม่บังคับ)

    bash
    openclaw config set agents.defaults.videoGenerationModel.primary "google/veo-3.1-fast-generate-preview"
  • สั่งเอเจนต์

    สร้างวิดีโอแบบภาพยนตร์ความยาว 5 วินาที เป็นภาพล็อบสเตอร์ที่เป็นมิตรกำลังโต้คลื่นยามพระอาทิตย์ตก

    เอเจนต์จะเรียก video_generate โดยอัตโนมัติ ไม่จำเป็นต้องเพิ่มเครื่องมือ ลงในรายการที่อนุญาต

  • การสร้างแบบอะซิงโครนัสทำงานอย่างไร

    การสร้างวิดีโอเป็นแบบอะซิงโครนัส:

    1. OpenClaw ส่งคำขอไปยังผู้ให้บริการและคืนรหัสงานทันที
    2. ผู้ให้บริการประมวลผลงานในเบื้องหลัง (โดยทั่วไปใช้เวลา 30 วินาทีถึงหลายนาที ขึ้นอยู่กับผู้ให้บริการและความละเอียด ส่วนผู้ให้บริการที่ใช้คิวและทำงานช้าอาจใช้เวลาจนถึงระยะหมดเวลาที่กำหนดค่าไว้)
    3. เมื่อวิดีโอพร้อมแล้ว OpenClaw จะปลุกเซสชันเดิมด้วยเหตุการณ์เสร็จสิ้นภายใน
    4. เอเจนต์จะรายงานผ่านโหมดตอบกลับที่มองเห็นได้ตามปกติของเซสชัน: ตอบกลับสุดท้ายโดยอัตโนมัติ หรือ message(action="send") เมื่อเซสชันกำหนดให้ใช้ เครื่องมือส่งข้อความ หากเซสชันของผู้ร้องขอไม่ได้ใช้งาน หรือการปลุกล้มเหลวและ สื่อที่สร้างขึ้นยังไม่อยู่ในการตอบกลับเมื่อเสร็จสิ้น OpenClaw จะส่ง ทางเลือกสำรองโดยตรงแบบทำซ้ำได้อย่างปลอดภัยพร้อมสื่อ

    ระหว่างที่งานกำลังดำเนินการ การเรียก video_generate ซ้ำใน เซสชันเดียวกันจะคืนสถานะงานปัจจุบันแทนการเริ่ม สร้างใหม่ ใช้ action: "status" เพื่อตรวจสอบโดยไม่ทริกเกอร์การ สร้างใหม่ หรือใช้ openclaw tasks list / openclaw tasks show <lookup> จาก CLI (ดู งานเบื้องหลัง)

    นอกการทำงานของเอเจนต์ที่มีเซสชันรองรับ (เช่น การเรียกใช้เครื่องมือโดยตรง) เครื่องมือจะใช้การสร้างแบบอินไลน์เป็นทางเลือกสำรองและคืนพาธสื่อสุดท้าย ภายในรอบเดียวกัน

    ไฟล์วิดีโอที่สร้างขึ้นจะบันทึกไว้ในพื้นที่จัดเก็บสื่อที่ OpenClaw จัดการเมื่อ ผู้ให้บริการคืนค่าเป็นไบต์ ขีดจำกัดเริ่มต้นคือ 16MB (ขีดจำกัดสื่อวิดีโอที่ใช้ร่วมกัน); agents.defaults.mediaMaxMb จะเพิ่มขีดจำกัดสำหรับงานเรนเดอร์ที่ใหญ่ขึ้น เมื่อ ผู้ให้บริการคืน URL เอาต์พุตที่โฮสต์ไว้ด้วย OpenClaw จะส่ง URL นั้นแทน การทำให้งานล้มเหลว หากการจัดเก็บในเครื่องปฏิเสธไฟล์ที่มีขนาดใหญ่เกินไป

    วงจรชีวิตของงาน

    สถานะ ความหมาย
    queued สร้างงานแล้ว กำลังรอให้ผู้ให้บริการยอมรับงาน
    running ผู้ให้บริการกำลังประมวลผล (โดยทั่วไปใช้เวลา 30 วินาทีถึงหลายนาที ขึ้นอยู่กับผู้ให้บริการและความละเอียด)
    succeeded วิดีโอพร้อมแล้ว เอเจนต์จะตื่นและโพสต์วิดีโอลงในการสนทนา
    failed ผู้ให้บริการเกิดข้อผิดพลาดหรือหมดเวลา เอเจนต์จะตื่นพร้อมรายละเอียดข้อผิดพลาด

    ตรวจสอบสถานะจาก CLI:

    bash
    openclaw tasks listopenclaw tasks show <lookup>openclaw tasks cancel <lookup>

    ผู้ให้บริการที่รองรับ

    ผู้ให้บริการ โมเดลเริ่มต้น ข้อความ รูปภาพอ้างอิง วิดีโออ้างอิง การยืนยันตัวตน
    Alibaba wan2.6-t2v ได้ (URL ระยะไกล) ได้ (URL ระยะไกล) MODELSTUDIO_API_KEY
    BytePlus (รวมมาให้) seedance-1-0-pro-250528 สูงสุด 2 รูป (เฟรมแรก + เฟรมสุดท้าย) - BYTEPLUS_API_KEY
    Plugin BytePlus 1.5 seedance-1-5-pro-251215 สูงสุด 2 รูป (เฟรมแรก + เฟรมสุดท้ายผ่านบทบาท) - BYTEPLUS_API_KEY
    BytePlus Seedance 2.0 dreamina-seedance-2-0-260128 รูปภาพอ้างอิงสูงสุด 9 รูป วิดีโอสูงสุด 3 รายการ BYTEPLUS_API_KEY
    ComfyUI workflow 1 รูป - COMFY_API_KEY หรือ COMFY_CLOUD_API_KEY
    DeepInfra Pixverse/Pixverse-T2V - - DEEPINFRA_API_KEY
    fal fal-ai/minimax/video-01-live 1 รูป; สูงสุด 9 รูปเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ สูงสุด 3 วิดีโอเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ FAL_KEY
    Google veo-3.1-fast-generate-preview 1 รูป 1 วิดีโอ GEMINI_API_KEY
    MiniMax MiniMax-Hailuo-2.3 1 รูป - MINIMAX_API_KEY หรือ MiniMax OAuth
    OpenAI sora-2 1 รูป 1 วิดีโอ OPENAI_API_KEY
    OpenRouter google/veo-3.1-fast สูงสุด 4 รูป (เฟรมแรก/สุดท้ายหรือรูปอ้างอิง) - OPENROUTER_API_KEY
    Qwen wan2.6-t2v ได้ (URL ระยะไกล) ได้ (URL ระยะไกล) QWEN_API_KEY
    Runway gen4.5 1 รูป 1 วิดีโอ RUNWAYML_API_SECRET
    Together Wan-AI/Wan2.2-T2V-A14B เฉพาะ Wan-AI/Wan2.2-I2V-A14B - TOGETHER_API_KEY
    Vydra veo3 1 รูป (kling) - VYDRA_API_KEY
    xAI grok-imagine-video Classic: 1 เฟรมแรกหรือรูปอ้างอิง 7 รูป; 1.5: 1 เฟรม Classic: 1 วิดีโอ XAI_API_KEY

    ผู้ให้บริการบางรายรองรับตัวแปรสภาพแวดล้อมสำหรับคีย์ API เพิ่มเติมหรือชื่ออื่น โปรดดู รายละเอียดในหน้าผู้ให้บริการแต่ละราย

    เรียกใช้ video_generate action=list เพื่อตรวจสอบผู้ให้บริการ โมเดล และ โหมดรันไทม์ที่พร้อมใช้งานขณะรันไทม์

    เมทริกซ์ความสามารถ

    สัญญาโหมดที่ระบุชัดเจนซึ่งใช้โดย video_generate การทดสอบสัญญา และ การกวาดตรวจสอบแบบสดที่ใช้ร่วมกัน:

    ผู้ให้บริการ generate imageToVideo videoToVideo เลนการทดสอบสดที่ใช้ร่วมกันในปัจจุบัน
    Alibaba generate, imageToVideo; ข้าม videoToVideo เนื่องจากผู้ให้บริการนี้ต้องใช้ URL วิดีโอ http(s) ระยะไกล
    BytePlus - generate, imageToVideo
    ComfyUI - ไม่อยู่ในการกวาดตรวจสอบที่ใช้ร่วมกัน การครอบคลุมเฉพาะเวิร์กโฟลว์อยู่ในการทดสอบ Comfy
    DeepInfra - - generate; สคีมาวิดีโอแบบเนทีฟของ DeepInfra เป็นข้อความเป็นวิดีโอในสัญญา Plugin
    fal generate, imageToVideo; ใช้ videoToVideo เฉพาะเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ
    Google generate, imageToVideo; ข้าม videoToVideo ที่ใช้ร่วมกัน เนื่องจากการกวาดตรวจสอบ Gemini/Veo ที่รองรับด้วยบัฟเฟอร์ในปัจจุบันไม่ยอมรับอินพุตดังกล่าว
    MiniMax - generate, imageToVideo
    OpenAI generate, imageToVideo; ข้าม videoToVideo ที่ใช้ร่วมกัน เนื่องจากเส้นทางองค์กร/อินพุตนี้ต้องใช้สิทธิ์แก้ไขวิดีโอฝั่งผู้ให้บริการในปัจจุบัน
    OpenRouter - generate, imageToVideo
    Qwen generate, imageToVideo; ข้าม videoToVideo เนื่องจากผู้ให้บริการนี้ต้องใช้ URL วิดีโอ http(s) ระยะไกล
    Runway generate, imageToVideo; videoToVideo จะทำงานเฉพาะเมื่อโมเดลที่เลือกคือ runway/gen4_aleph
    Together - generate, imageToVideo
    Vydra - generate; ข้าม imageToVideo ที่ใช้ร่วมกัน เนื่องจาก veo3 ที่รวมมาให้รองรับเฉพาะข้อความ และ kling ที่รวมมาให้ต้องใช้ URL รูปภาพระยะไกล
    xAI Classic รองรับทุกโหมด; Video 1.5 รองรับเฉพาะรูปภาพเป็นวิดีโอ; อินพุต MP4 ระยะไกลทำให้ videoToVideo ไม่รวมอยู่ในการกวาดตรวจสอบที่ใช้ร่วมกัน

    พารามิเตอร์ของเครื่องมือ

    จำเป็น

    promptstringrequired

    คำอธิบายแบบข้อความของวิดีโอที่จะสร้าง จำเป็นสำหรับ action: "generate"

    อินพุตเนื้อหา

    imagestring
    imagesstring[]
    imageRolesstring[]

    คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการรูปภาพที่รวมแล้ว ค่ามาตรฐาน: first_frame, last_frame, reference_image

    videostring
    videosstring[]
    videoRolesstring[]

    คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการวิดีโอที่รวมแล้ว ค่ามาตรฐาน: reference_video

    audioRefstring

    เสียงอ้างอิงหนึ่งรายการ (พาธหรือ URL) ใช้สำหรับเพลงพื้นหลังหรือเสียงพูด อ้างอิงเมื่อผู้ให้บริการรองรับอินพุตเสียง

    audioRefsstring[]
    audioRolesstring[]

    คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการเสียงที่รวมแล้ว ค่ามาตรฐาน: reference_audio

    การควบคุมรูปแบบ

    aspectRatiostring

    คำแนะนำอัตราส่วนภาพ เช่น 1:1, 16:9, 9:16, adaptive หรือค่าเฉพาะของผู้ให้บริการ OpenClaw จะปรับให้เป็นรูปแบบมาตรฐานหรือเพิกเฉยต่อค่าที่ไม่รองรับตามแต่ละผู้ให้บริการ

    OPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9InJlc29sdXRpb24iIHR5cGU9InN0cmluZyI คำแนะนำความละเอียด เช่น 360P, 480P, 540P, 720P, 768P, 1080P, 4K หรือค่าเฉพาะของผู้ให้บริการ OpenClaw จะปรับให้เป็นรูปแบบมาตรฐานหรือเพิกเฉยต่อค่าที่ไม่รองรับตามแต่ละผู้ให้บริการ OPENCLAW_DOCS_MARKER:paramClose:

    durationSecondsnumber

    ระยะเวลาเป้าหมายเป็นวินาที (ปัดเป็นค่าที่ใกล้ที่สุดซึ่งผู้ให้บริการรองรับ)

    sizestring
    audioboolean

    เปิดใช้เสียงที่สร้างขึ้นในเอาต์พุตเมื่อรองรับ แตกต่างจาก audioRef* (อินพุต)

    watermarkboolean

    adaptive เป็นค่าเซนทิเนลเฉพาะของผู้ให้บริการ โดยจะถูกส่งต่อไปตามที่ระบุให้แก่ ผู้ให้บริการที่ประกาศ adaptive ในความสามารถของตน (เช่น BytePlus Seedance ใช้ค่านี้เพื่อตรวจหาอัตราส่วนโดยอัตโนมัติจากมิติของรูปภาพ อินพุต) ผู้ให้บริการที่ไม่ได้ประกาศค่านี้จะแสดงค่าผ่าน details.ignoredOverrides ในผลลัพธ์ของเครื่องมือ เพื่อให้มองเห็นการละทิ้งค่า

    ขั้นสูง

    action"generate" | "status" | "list"default: generate

    "status" ส่งคืนงานของเซสชันปัจจุบัน ส่วน "list" ใช้ตรวจสอบผู้ให้บริการ

    OPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9Im1vZGVsIiB0eXBlPSJzdHJpbmci แทนที่ผู้ให้บริการ/โมเดล (เช่น runway/gen4.5) OPENCLAW_DOCS_MARKER:paramClose:

    filenamestring

    OPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9InRpbWVvdXRNcyIgdHlwZT0ibnVtYmVyIg ระยะหมดเวลาของการดำเนินการกับผู้ให้บริการเป็นมิลลิวินาทีซึ่งระบุหรือไม่ก็ได้ หากไม่ระบุ OpenClaw จะใช้ agents.defaults.videoGenerationModel.timeoutMs หากมีการกำหนดค่าไว้ มิฉะนั้นจะใช้ค่าเริ่มต้นของผู้ให้บริการที่ผู้เขียน plugin กำหนดไว้ หากมี OPENCLAW_DOCS_MARKER:paramClose:

    providerOptionsobject

    ตัวเลือกเฉพาะของผู้ให้บริการในรูปแบบออบเจ็กต์ JSON (เช่น {"seed": 42, "draft": true}) ผู้ให้บริการที่ประกาศสคีมาแบบมีชนิดข้อมูลจะตรวจสอบคีย์และชนิดข้อมูล คีย์ที่ไม่รู้จัก หรือชนิดข้อมูลที่ไม่ตรงกันจะทำให้ข้ามตัวเลือกผู้ให้บริการนั้นระหว่างการใช้ทางเลือกสำรอง ผู้ให้บริการที่ไม่มี สคีมาที่ประกาศไว้จะได้รับตัวเลือกตามที่ระบุ เรียกใช้ video_generate action=list เพื่อดูว่าแต่ละผู้ให้บริการยอมรับสิ่งใด

    อินพุตอ้างอิงใช้เลือกโหมดรันไทม์:

    • ไม่มีสื่ออ้างอิง -> generate
    • มีรูปภาพอ้างอิงใด ๆ -> imageToVideo
    • มีวิดีโออ้างอิงใด ๆ -> videoToVideo
    • อินพุตเสียงอ้างอิง ไม่ เปลี่ยนโหมดที่กำหนดได้ โดยจะถูกนำไปใช้ เพิ่มเติมจากโหมดที่การอ้างอิงรูปภาพ/วิดีโอเลือกไว้ และทำงานเฉพาะ กับผู้ให้บริการที่ประกาศ maxInputAudios

    การใช้การอ้างอิงรูปภาพและวิดีโอร่วมกันไม่ใช่พื้นผิวความสามารถที่ใช้ร่วมกันอย่างเสถียร ควรใช้การอ้างอิงเพียงประเภทเดียวต่อคำขอ

    ทางเลือกสำรองและตัวเลือกแบบมีชนิดข้อมูล

    การตรวจสอบความสามารถบางอย่างจะเกิดขึ้นที่ชั้นทางเลือกสำรอง แทนที่จะเป็นขอบเขตของเครื่องมือ ดังนั้นคำขอที่เกินขีดจำกัดของผู้ให้บริการหลักยังคงสามารถ ทำงานกับผู้ให้บริการสำรองที่มีความสามารถได้:

    • ตัวเลือกที่ใช้งานอยู่ซึ่งไม่ได้ประกาศ maxInputAudios (หรือ 0) จะถูกข้ามเมื่อ คำขอมีเสียงอ้างอิง จากนั้นจะลองตัวเลือกถัดไป การป้องกันเดียวกันนี้ ใช้กับจำนวนการอ้างอิงรูปภาพและวิดีโอโดยเทียบกับ maxInputImages/maxInputVideos
    • maxDurationSeconds ของตัวเลือกที่ใช้งานอยู่ต่ำกว่า durationSeconds ที่ร้องขอ และไม่มีรายการ supportedDurationSeconds ที่ประกาศไว้ -> ข้าม
    • คำขอมี providerOptions และตัวเลือกที่ใช้งานอยู่ประกาศ สคีมา providerOptions แบบมีชนิดข้อมูลอย่างชัดเจน -> ข้ามหากคีย์ที่ระบุ ไม่มีอยู่ในสคีมา หรือชนิดของค่าไม่ตรงกัน ผู้ให้บริการที่ไม่มี สคีมาที่ประกาศไว้จะได้รับตัวเลือกตามที่ระบุ (การส่งผ่านที่ เข้ากันได้ย้อนหลัง) ผู้ให้บริการสามารถเลือกไม่รับตัวเลือกของผู้ให้บริการทั้งหมดได้โดย ประกาศสคีมาว่าง (capabilities.providerOptions: {}) ซึ่ง จะทำให้ข้ามเช่นเดียวกับกรณีชนิดข้อมูลไม่ตรงกัน

    เหตุผลการข้ามครั้งแรกในคำขอจะบันทึกที่ warn เพื่อให้ผู้ปฏิบัติงานเห็นว่า ผู้ให้บริการหลักถูกข้ามเมื่อใด ส่วนการข้ามครั้งถัดไปจะบันทึกที่ debug เพื่อ ไม่ให้เชนทางเลือกสำรองที่ยาวสร้างบันทึกมากเกินไป หากตัวเลือกทั้งหมดถูกข้าม ข้อผิดพลาดแบบรวมจะมีเหตุผลการข้ามของแต่ละตัวเลือก

    การดำเนินการ

    การดำเนินการ สิ่งที่ดำเนินการ
    generate ค่าเริ่มต้น สร้างวิดีโอจากพรอมต์ที่ระบุและอินพุตอ้างอิงที่ระบุหรือไม่ก็ได้
    status ตรวจสอบสถานะของงานวิดีโอที่กำลังดำเนินอยู่สำหรับเซสชันปัจจุบัน โดยไม่เริ่มการสร้างใหม่
    list แสดงผู้ให้บริการ โมเดล และความสามารถที่พร้อมใช้งาน

    การเลือกโมเดล

    OpenClaw จะกำหนดโมเดลตามลำดับต่อไปนี้:

    1. พารามิเตอร์เครื่องมือ model - หากเอเจนต์ระบุไว้ในการเรียก
    2. videoGenerationModel.primary จากการกำหนดค่า
    3. videoGenerationModel.fallbacks ตามลำดับ
    4. การตรวจหาอัตโนมัติ - ผู้ให้บริการที่มีข้อมูลรับรองความถูกต้องที่ใช้ได้ โดยเริ่มจาก ผู้ให้บริการเริ่มต้นปัจจุบัน แล้วตามด้วยผู้ให้บริการที่เหลือตามลำดับ ตัวอักษร

    หากผู้ให้บริการล้มเหลว ระบบจะลองตัวเลือกถัดไปโดยอัตโนมัติ หาก ตัวเลือกทั้งหมดล้มเหลว ข้อผิดพลาดจะมีรายละเอียดจากแต่ละครั้งที่ลอง

    ตั้งค่า agents.defaults.mediaGenerationAutoProviderFallback: false เพื่อใช้ เฉพาะรายการ model, primary และ fallbacks ที่ระบุอย่างชัดเจน

    json5
    {  agents: {    defaults: {      videoGenerationModel: {        primary: "google/veo-3.1-fast-generate-preview",        fallbacks: ["runway/gen4.5", "qwen/wan2.6-t2v"],        timeoutMs: 180000, // การแทนที่ระยะหมดเวลาของคำขอผู้ให้บริการต่อเครื่องมือซึ่งระบุหรือไม่ก็ได้      },    },  },}

    หมายเหตุเกี่ยวกับผู้ให้บริการ

    Alibaba

    ใช้ปลายทางแบบอะซิงโครนัสของ DashScope / Model Studio รูปภาพและ วิดีโออ้างอิงต้องเป็น URL http(s) ระยะไกล

    BytePlus (รวมมาให้)

    รหัสผู้ให้บริการ: byteplus

    โมเดล: seedance-1-0-pro-250528 (ค่าเริ่มต้น), seedance-1-5-pro-251215

    ใช้ API content[] แบบรวม รองรับรูปภาพอินพุตสูงสุด 2 ภาพ (first_frame + last_frame) ส่งรูปภาพตามตำแหน่งหรือตั้งค่า role ของแต่ละรูปภาพอย่างชัดเจน

    คีย์ providerOptions ที่รองรับ: seed (ตัวเลข), draft (บูลีน - บังคับเป็น 480p), camera_fixed (บูลีน)

    BytePlus Seedance 1.5 plugin

    ต้องใช้ plugin @openclaw/byteplus-modelark (ภายนอก ไม่ได้รวมมาให้) รหัสผู้ให้บริการ: byteplus-seedance15 โมเดล: seedance-1-5-pro-251215

    ใช้ API content[] แบบรวม รองรับรูปภาพอินพุตสูงสุด 2 ภาพ (first_frame + last_frame) อินพุตทั้งหมดต้องเป็น URL https:// ระยะไกล ตั้งค่า role: "first_frame" / "last_frame" ในแต่ละรูปภาพ หรือ ส่งรูปภาพตามตำแหน่ง

    aspectRatio: "adaptive" ตรวจหาอัตราส่วนโดยอัตโนมัติจากรูปภาพอินพุต audio: true จับคู่กับ generate_audio ส่วน providerOptions.seed (ตัวเลข) จะถูกส่งต่อ

    BytePlus Seedance 2.0

    ต้องใช้ plugin @openclaw/byteplus-modelark (ภายนอก ไม่ได้รวมมาให้) รหัสผู้ให้บริการ: byteplus-seedance2 โมเดล: dreamina-seedance-2-0-260128, dreamina-seedance-2-0-fast-260128

    ใช้ API content[] แบบรวม รองรับรูปภาพอ้างอิงสูงสุด 9 ภาพ วิดีโออ้างอิง 3 รายการ และเสียงอ้างอิง 3 รายการ อินพุตทั้งหมดต้องเป็น URL https:// ระยะไกล ตั้งค่า role ในแต่ละแอสเซต - ค่าที่รองรับ: "first_frame", "last_frame", "reference_image", "reference_video", "reference_audio"

    aspectRatio: "adaptive" ตรวจหาอัตราส่วนโดยอัตโนมัติจากรูปภาพอินพุต audio: true จับคู่กับ generate_audio ส่วน providerOptions.seed (ตัวเลข) จะถูกส่งต่อ

    ComfyUI

    การดำเนินการภายในเครื่องหรือบนคลาวด์ที่ขับเคลื่อนด้วยเวิร์กโฟลว์ รองรับการแปลงข้อความเป็นวิดีโอและ รูปภาพเป็นวิดีโอผ่านกราฟที่กำหนดค่าไว้

    fal

    ใช้โฟลว์ที่มีคิวรองรับสำหรับงานที่ใช้เวลานาน โดยค่าเริ่มต้น OpenClaw จะรอสูงสุด 20 นาทีก่อนถือว่างานในคิว fal ที่กำลังดำเนินการหมดเวลา โมเดลวิดีโอ fal ส่วนใหญ่ยอมรับการอ้างอิงรูปภาพเพียงรูปเดียว โมเดล Seedance 2.0 สำหรับแปลงข้อมูลอ้างอิงเป็นวิดีโอยอมรับรูปภาพสูงสุด 9 รูป วิดีโอ 3 รายการ และข้อมูลอ้างอิงเสียง 3 รายการ โดยมี ไฟล์อ้างอิงรวมได้ไม่เกิน 12 ไฟล์

    Google (Gemini / Veo)

    รองรับการอ้างอิงรูปภาพหนึ่งรูปหรือวิดีโอหนึ่งรายการ คำขอให้สร้างเสียงจะ ถูกละเว้นพร้อมคำเตือนบนเส้นทาง Gemini API เนื่องจาก API นั้นปฏิเสธ พารามิเตอร์ generateAudio สำหรับการสร้างวิดีโอ Veo ในปัจจุบัน

    MiniMax

    รองรับการอ้างอิงรูปภาพเพียงรูปเดียว MiniMax ยอมรับความละเอียด 768P และ 1080P คำขอเช่น 720P จะถูกปรับให้เป็นค่าที่รองรับซึ่งใกล้เคียงที่สุด ก่อนส่ง

    OpenAI

    ส่งต่อเฉพาะการแทนที่ size เท่านั้น การแทนที่รูปแบบอื่น (aspectRatio, resolution, audio, watermark) จะถูกละเว้นพร้อม คำเตือน

    OpenRouter

    ใช้ API /videos แบบอะซิงโครนัสของ OpenRouter โดย OpenClaw จะส่ง งาน ตรวจสอบ polling_url เป็นระยะ และดาวน์โหลด unsigned_urls หรือ ปลายทางเนื้อหางานที่ระบุไว้ในเอกสาร ค่าเริ่มต้น google/veo-3.1-fast ที่มาพร้อมระบบ ระบุระยะเวลา 4/6/8 วินาที ความละเอียด 720P/1080P และ อัตราส่วนภาพ 16:9/9:16

    Qwen

    ใช้แบ็กเอนด์ DashScope เดียวกับ Alibaba อินพุตอ้างอิงต้องเป็น URL http(s) ระยะไกล โดยไฟล์ภายในเครื่องจะถูกปฏิเสธล่วงหน้า

    Runway

    รองรับไฟล์ภายในเครื่องผ่าน URI ข้อมูล การแปลงวิดีโอเป็นวิดีโอต้องใช้ runway/gen4_aleph การทำงานแบบข้อความเท่านั้นรองรับอัตราส่วนภาพ 16:9 และ 9:16

    Together

    รองรับการอ้างอิงรูปภาพเพียงรูปเดียว

    Vydra

    ใช้ https://www.vydra.ai/api/v1 โดยตรงเพื่อหลีกเลี่ยงการเปลี่ยนเส้นทาง ที่ทำให้ข้อมูลรับรองการยืนยันตัวตนสูญหาย veo3 ที่มาพร้อมระบบรองรับเฉพาะการแปลงข้อความเป็นวิดีโอ ส่วน kling ต้องใช้ URL รูปภาพระยะไกล

    xAI

    โมเดลเริ่มต้น grok-imagine-video รองรับการแปลงข้อความเป็นวิดีโอ การแปลงรูปภาพเฟรมแรก รูปเดียวเป็นวิดีโอ อินพุต reference_image สูงสุด 7 รายการผ่าน xAI reference_images และโฟลว์แก้ไข/ขยายวิดีโอระยะไกล การสร้างมีค่าเริ่มต้น เป็น 480P ส่วนการแปลงรูปภาพเดียวเป็นวิดีโอจะสืบทอดอัตราส่วนของต้นฉบับเมื่อ ไม่ได้ระบุ aspectRatio การแก้ไข/ขยายวิดีโอจะสืบทอดรูปทรงของอินพุตและ ไม่ยอมรับการแทนที่อัตราส่วนภาพหรือความละเอียด การขยายรองรับ 2-10 วินาที

    grok-imagine-video-1.5 รองรับเฉพาะการแปลงรูปภาพเป็นวิดีโอ: ต้องระบุรูปภาพหนึ่งรูปพอดี รองรับระยะเวลา 1-15 วินาที และ 480P, 720P หรือ 1080P โดยมีค่าเริ่มต้นเป็น 480P; ให้ละเว้น aspectRatio เพื่อสืบทอดอัตราส่วนของรูปภาพต้นฉบับ ตัวระบุ รุ่นตัวอย่างและรุ่น 1.5 ที่ระบุวันที่จะได้รับการตรวจสอบแบบเดียวกันและถูกส่งต่อ โดยไม่เปลี่ยนแปลง

    โหมดความสามารถของผู้ให้บริการ

    สัญญาการสร้างวิดีโอที่ใช้ร่วมกันรองรับความสามารถเฉพาะโหมด แทนที่จะรองรับเฉพาะขีดจำกัดรวมแบบแบน การใช้งานผู้ให้บริการใหม่ ควรเลือกใช้บล็อกโหมดอย่างชัดเจน:

    typescript
    capabilities: {  generate: {    maxVideos: 1,    maxDurationSeconds: 10,    supportsResolution: true,  },  imageToVideo: {    enabled: true,    maxVideos: 1,    maxInputImages: 1,    maxInputImagesByModel: { "provider/reference-to-video": 9 },    maxDurationSeconds: 5,  },  videoToVideo: {    enabled: true,    maxVideos: 1,    maxInputVideos: 1,    maxDurationSeconds: 5,  },}

    ฟิลด์รวมแบบแบน เช่น maxInputImages และ maxInputVideos ไม่ เพียงพอสำหรับระบุการรองรับโหมดการแปลง ผู้ให้บริการควร ประกาศ generate, imageToVideo และ videoToVideo อย่างชัดเจน เพื่อให้การทดสอบแบบสด การทดสอบสัญญา และเครื่องมือ video_generate ที่ใช้ร่วมกันสามารถตรวจสอบ การรองรับโหมดได้อย่างกำหนดแน่นอน

    เมื่อโมเดลหนึ่งของผู้ให้บริการรองรับอินพุตอ้างอิงได้กว้างกว่า โมเดลอื่น ให้ใช้ maxInputImagesByModel, maxInputVideosByModel หรือ maxInputAudiosByModel แทนการเพิ่มขีดจำกัดของทั้งโหมด

    การทดสอบแบบสด

    ความครอบคลุมแบบสดที่เลือกเปิดใช้ได้สำหรับผู้ให้บริการร่วมที่มาพร้อมระบบ:

    bash
    OPENCLAW_LIVE_TEST=1 pnpm test:live -- extensions/video-generation-providers.live.test.ts

    ตัวหุ้มของรีโพ:

    bash
    pnpm test:live:media video

    โดยค่าเริ่มต้น ไฟล์การทดสอบแบบสดนี้ใช้ตัวแปรสภาพแวดล้อมของผู้ให้บริการที่ส่งออกไว้แล้วก่อน โปรไฟล์การยืนยันตัวตนที่จัดเก็บไว้ และดำเนินการทดสอบควันแบบปลอดภัยสำหรับรีลีสเป็นค่าเริ่มต้น:

    • generate สำหรับผู้ให้บริการที่ไม่ใช่ FAL ทุกรายในชุดทดสอบ
    • พรอมต์ lobster หนึ่งวินาที
    • ขีดจำกัดการดำเนินการต่อผู้ให้บริการจาก OPENCLAW_LIVE_VIDEO_GENERATION_TIMEOUT_MS (ค่าเริ่มต้นคือ 180000)

    FAL ต้องเลือกเปิดใช้ เนื่องจากความหน่วงของคิวฝั่งผู้ให้บริการอาจกินเวลา ของรีลีสเป็นส่วนใหญ่:

    bash
    pnpm test:live:media video --video-providers fal

    ตั้งค่า OPENCLAW_LIVE_VIDEO_GENERATION_FULL_MODES=1 เพื่อเรียกใช้ โหมดการแปลงที่ประกาศไว้เพิ่มเติม ซึ่งชุดทดสอบร่วมสามารถดำเนินการได้อย่างปลอดภัยด้วยสื่อภายในเครื่อง:

    • imageToVideo เมื่อ capabilities.imageToVideo.enabled
    • videoToVideo เมื่อ capabilities.videoToVideo.enabled และ ผู้ให้บริการ/โมเดลยอมรับอินพุตวิดีโอภายในเครื่องที่รองรับด้วยบัฟเฟอร์ใน ชุดทดสอบร่วม

    ปัจจุบันเลนสด videoToVideo ที่ใช้ร่วมกันครอบคลุม runway เฉพาะเมื่อ เลือก runway/gen4_aleph

    การกำหนดค่า

    ตั้งค่าโมเดลสร้างวิดีโอเริ่มต้นในการกำหนดค่า OpenClaw:

    json5
    {  agents: {    defaults: {      videoGenerationModel: {        primary: "qwen/wan2.6-t2v",        fallbacks: ["qwen/wan2.6-r2v-flash"],      },    },  },}

    หรือผ่าน CLI:

    bash
    openclaw config set agents.defaults.videoGenerationModel.primary "qwen/wan2.6-t2v"

    ที่เกี่ยวข้อง

    Was this useful?
    On this page

    On this page