Tools
การสร้างวิดีโอ
เอเจนต์ OpenClaw สร้างวิดีโอจากพรอมต์ข้อความ รูปภาพอ้างอิง หรือ
วิดีโอที่มีอยู่ผ่าน video_generate รองรับแบ็กเอนด์ผู้ให้บริการ
16 ราย โดยเอเจนต์จะเลือกรายที่เหมาะสมโดยอัตโนมัติตามการกำหนดค่าและ
คีย์ API ที่มีอยู่
video_generate มีโหมดรันไทม์สามโหมด ซึ่งพิจารณาจากอินพุตอ้างอิง
ในการเรียกใช้:
generate- ไม่มีสื่ออ้างอิง (ข้อความเป็นวิดีโอ)imageToVideo- รูปภาพอ้างอิงอย่างน้อยหนึ่งรูปvideoToVideo- วิดีโออ้างอิงอย่างน้อยหนึ่งรายการ
ผู้ให้บริการอาจรองรับโหมดเหล่านี้เพียงบางส่วน เครื่องมือจะตรวจสอบ
โหมดที่ใช้งานอยู่ก่อนส่งคำขอ และรายงานโหมดที่รองรับใน action=list
เริ่มต้นอย่างรวดเร็ว
กำหนดค่าการยืนยันตัวตน
ตั้งค่าคีย์ API สำหรับผู้ให้บริการที่รองรับรายใดก็ได้:
export GEMINI_API_KEY="your-key"เลือกโมเดลเริ่มต้น (ไม่บังคับ)
openclaw config set agents.defaults.videoGenerationModel.primary "google/veo-3.1-fast-generate-preview"สั่งเอเจนต์
สร้างวิดีโอแบบภาพยนตร์ความยาว 5 วินาที เป็นภาพล็อบสเตอร์ที่เป็นมิตรกำลังโต้คลื่นยามพระอาทิตย์ตก
เอเจนต์จะเรียก video_generate โดยอัตโนมัติ ไม่จำเป็นต้องเพิ่มเครื่องมือ
ลงในรายการที่อนุญาต
การสร้างแบบอะซิงโครนัสทำงานอย่างไร
การสร้างวิดีโอเป็นแบบอะซิงโครนัส:
- OpenClaw ส่งคำขอไปยังผู้ให้บริการและคืนรหัสงานทันที
- ผู้ให้บริการประมวลผลงานในเบื้องหลัง (โดยทั่วไปใช้เวลา 30 วินาทีถึงหลายนาที ขึ้นอยู่กับผู้ให้บริการและความละเอียด ส่วนผู้ให้บริการที่ใช้คิวและทำงานช้าอาจใช้เวลาจนถึงระยะหมดเวลาที่กำหนดค่าไว้)
- เมื่อวิดีโอพร้อมแล้ว OpenClaw จะปลุกเซสชันเดิมด้วยเหตุการณ์เสร็จสิ้นภายใน
- เอเจนต์จะรายงานผ่านโหมดตอบกลับที่มองเห็นได้ตามปกติของเซสชัน:
ตอบกลับสุดท้ายโดยอัตโนมัติ หรือ
message(action="send")เมื่อเซสชันกำหนดให้ใช้ เครื่องมือส่งข้อความ หากเซสชันของผู้ร้องขอไม่ได้ใช้งาน หรือการปลุกล้มเหลวและ สื่อที่สร้างขึ้นยังไม่อยู่ในการตอบกลับเมื่อเสร็จสิ้น OpenClaw จะส่ง ทางเลือกสำรองโดยตรงแบบทำซ้ำได้อย่างปลอดภัยพร้อมสื่อ
ระหว่างที่งานกำลังดำเนินการ การเรียก video_generate ซ้ำใน
เซสชันเดียวกันจะคืนสถานะงานปัจจุบันแทนการเริ่ม
สร้างใหม่ ใช้ action: "status" เพื่อตรวจสอบโดยไม่ทริกเกอร์การ
สร้างใหม่ หรือใช้ openclaw tasks list / openclaw tasks show <lookup> จาก
CLI (ดู งานเบื้องหลัง)
นอกการทำงานของเอเจนต์ที่มีเซสชันรองรับ (เช่น การเรียกใช้เครื่องมือโดยตรง) เครื่องมือจะใช้การสร้างแบบอินไลน์เป็นทางเลือกสำรองและคืนพาธสื่อสุดท้าย ภายในรอบเดียวกัน
ไฟล์วิดีโอที่สร้างขึ้นจะบันทึกไว้ในพื้นที่จัดเก็บสื่อที่ OpenClaw จัดการเมื่อ
ผู้ให้บริการคืนค่าเป็นไบต์ ขีดจำกัดเริ่มต้นคือ 16MB (ขีดจำกัดสื่อวิดีโอที่ใช้ร่วมกัน);
agents.defaults.mediaMaxMb จะเพิ่มขีดจำกัดสำหรับงานเรนเดอร์ที่ใหญ่ขึ้น เมื่อ
ผู้ให้บริการคืน URL เอาต์พุตที่โฮสต์ไว้ด้วย OpenClaw จะส่ง URL นั้นแทน
การทำให้งานล้มเหลว หากการจัดเก็บในเครื่องปฏิเสธไฟล์ที่มีขนาดใหญ่เกินไป
วงจรชีวิตของงาน
| สถานะ | ความหมาย |
|---|---|
queued |
สร้างงานแล้ว กำลังรอให้ผู้ให้บริการยอมรับงาน |
running |
ผู้ให้บริการกำลังประมวลผล (โดยทั่วไปใช้เวลา 30 วินาทีถึงหลายนาที ขึ้นอยู่กับผู้ให้บริการและความละเอียด) |
succeeded |
วิดีโอพร้อมแล้ว เอเจนต์จะตื่นและโพสต์วิดีโอลงในการสนทนา |
failed |
ผู้ให้บริการเกิดข้อผิดพลาดหรือหมดเวลา เอเจนต์จะตื่นพร้อมรายละเอียดข้อผิดพลาด |
ตรวจสอบสถานะจาก CLI:
openclaw tasks listopenclaw tasks show <lookup>openclaw tasks cancel <lookup>ผู้ให้บริการที่รองรับ
| ผู้ให้บริการ | โมเดลเริ่มต้น | ข้อความ | รูปภาพอ้างอิง | วิดีโออ้างอิง | การยืนยันตัวตน |
|---|---|---|---|---|---|
| Alibaba | wan2.6-t2v |
✓ | ได้ (URL ระยะไกล) | ได้ (URL ระยะไกล) | MODELSTUDIO_API_KEY |
| BytePlus (รวมมาให้) | seedance-1-0-pro-250528 |
✓ | สูงสุด 2 รูป (เฟรมแรก + เฟรมสุดท้าย) | - | BYTEPLUS_API_KEY |
| Plugin BytePlus 1.5 | seedance-1-5-pro-251215 |
✓ | สูงสุด 2 รูป (เฟรมแรก + เฟรมสุดท้ายผ่านบทบาท) | - | BYTEPLUS_API_KEY |
| BytePlus Seedance 2.0 | dreamina-seedance-2-0-260128 |
✓ | รูปภาพอ้างอิงสูงสุด 9 รูป | วิดีโอสูงสุด 3 รายการ | BYTEPLUS_API_KEY |
| ComfyUI | workflow |
✓ | 1 รูป | - | COMFY_API_KEY หรือ COMFY_CLOUD_API_KEY |
| DeepInfra | Pixverse/Pixverse-T2V |
✓ | - | - | DEEPINFRA_API_KEY |
| fal | fal-ai/minimax/video-01-live |
✓ | 1 รูป; สูงสุด 9 รูปเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ | สูงสุด 3 วิดีโอเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ | FAL_KEY |
veo-3.1-fast-generate-preview |
✓ | 1 รูป | 1 วิดีโอ | GEMINI_API_KEY |
|
| MiniMax | MiniMax-Hailuo-2.3 |
✓ | 1 รูป | - | MINIMAX_API_KEY หรือ MiniMax OAuth |
| OpenAI | sora-2 |
✓ | 1 รูป | 1 วิดีโอ | OPENAI_API_KEY |
| OpenRouter | google/veo-3.1-fast |
✓ | สูงสุด 4 รูป (เฟรมแรก/สุดท้ายหรือรูปอ้างอิง) | - | OPENROUTER_API_KEY |
| Qwen | wan2.6-t2v |
✓ | ได้ (URL ระยะไกล) | ได้ (URL ระยะไกล) | QWEN_API_KEY |
| Runway | gen4.5 |
✓ | 1 รูป | 1 วิดีโอ | RUNWAYML_API_SECRET |
| Together | Wan-AI/Wan2.2-T2V-A14B |
✓ | เฉพาะ Wan-AI/Wan2.2-I2V-A14B |
- | TOGETHER_API_KEY |
| Vydra | veo3 |
✓ | 1 รูป (kling) |
- | VYDRA_API_KEY |
| xAI | grok-imagine-video |
✓ | Classic: 1 เฟรมแรกหรือรูปอ้างอิง 7 รูป; 1.5: 1 เฟรม | Classic: 1 วิดีโอ | XAI_API_KEY |
ผู้ให้บริการบางรายรองรับตัวแปรสภาพแวดล้อมสำหรับคีย์ API เพิ่มเติมหรือชื่ออื่น โปรดดู รายละเอียดในหน้าผู้ให้บริการแต่ละราย
เรียกใช้ video_generate action=list เพื่อตรวจสอบผู้ให้บริการ โมเดล และ
โหมดรันไทม์ที่พร้อมใช้งานขณะรันไทม์
เมทริกซ์ความสามารถ
สัญญาโหมดที่ระบุชัดเจนซึ่งใช้โดย video_generate การทดสอบสัญญา และ
การกวาดตรวจสอบแบบสดที่ใช้ร่วมกัน:
| ผู้ให้บริการ | generate |
imageToVideo |
videoToVideo |
เลนการทดสอบสดที่ใช้ร่วมกันในปัจจุบัน |
|---|---|---|---|---|
| Alibaba | ✓ | ✓ | ✓ | generate, imageToVideo; ข้าม videoToVideo เนื่องจากผู้ให้บริการนี้ต้องใช้ URL วิดีโอ http(s) ระยะไกล |
| BytePlus | ✓ | ✓ | - | generate, imageToVideo |
| ComfyUI | ✓ | ✓ | - | ไม่อยู่ในการกวาดตรวจสอบที่ใช้ร่วมกัน การครอบคลุมเฉพาะเวิร์กโฟลว์อยู่ในการทดสอบ Comfy |
| DeepInfra | ✓ | - | - | generate; สคีมาวิดีโอแบบเนทีฟของ DeepInfra เป็นข้อความเป็นวิดีโอในสัญญา Plugin |
| fal | ✓ | ✓ | ✓ | generate, imageToVideo; ใช้ videoToVideo เฉพาะเมื่อใช้ Seedance แบบอ้างอิงเป็นวิดีโอ |
| ✓ | ✓ | ✓ | generate, imageToVideo; ข้าม videoToVideo ที่ใช้ร่วมกัน เนื่องจากการกวาดตรวจสอบ Gemini/Veo ที่รองรับด้วยบัฟเฟอร์ในปัจจุบันไม่ยอมรับอินพุตดังกล่าว |
|
| MiniMax | ✓ | ✓ | - | generate, imageToVideo |
| OpenAI | ✓ | ✓ | ✓ | generate, imageToVideo; ข้าม videoToVideo ที่ใช้ร่วมกัน เนื่องจากเส้นทางองค์กร/อินพุตนี้ต้องใช้สิทธิ์แก้ไขวิดีโอฝั่งผู้ให้บริการในปัจจุบัน |
| OpenRouter | ✓ | ✓ | - | generate, imageToVideo |
| Qwen | ✓ | ✓ | ✓ | generate, imageToVideo; ข้าม videoToVideo เนื่องจากผู้ให้บริการนี้ต้องใช้ URL วิดีโอ http(s) ระยะไกล |
| Runway | ✓ | ✓ | ✓ | generate, imageToVideo; videoToVideo จะทำงานเฉพาะเมื่อโมเดลที่เลือกคือ runway/gen4_aleph |
| Together | ✓ | ✓ | - | generate, imageToVideo |
| Vydra | ✓ | ✓ | - | generate; ข้าม imageToVideo ที่ใช้ร่วมกัน เนื่องจาก veo3 ที่รวมมาให้รองรับเฉพาะข้อความ และ kling ที่รวมมาให้ต้องใช้ URL รูปภาพระยะไกล |
| xAI | ✓ | ✓ | ✓ | Classic รองรับทุกโหมด; Video 1.5 รองรับเฉพาะรูปภาพเป็นวิดีโอ; อินพุต MP4 ระยะไกลทำให้ videoToVideo ไม่รวมอยู่ในการกวาดตรวจสอบที่ใช้ร่วมกัน |
พารามิเตอร์ของเครื่องมือ
จำเป็น
promptstringrequiredคำอธิบายแบบข้อความของวิดีโอที่จะสร้าง จำเป็นสำหรับ action: "generate"
อินพุตเนื้อหา
imagestringimagesstring[]imageRolesstring[]คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการรูปภาพที่รวมแล้ว
ค่ามาตรฐาน: first_frame, last_frame, reference_image
videostringvideosstring[]videoRolesstring[]คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการวิดีโอที่รวมแล้ว
ค่ามาตรฐาน: reference_video
audioRefstringเสียงอ้างอิงหนึ่งรายการ (พาธหรือ URL) ใช้สำหรับเพลงพื้นหลังหรือเสียงพูด อ้างอิงเมื่อผู้ให้บริการรองรับอินพุตเสียง
audioRefsstring[]audioRolesstring[]คำแนะนำบทบาทตามตำแหน่งซึ่งระบุหรือไม่ก็ได้ โดยเรียงคู่ขนานกับรายการเสียงที่รวมแล้ว
ค่ามาตรฐาน: reference_audio
การควบคุมรูปแบบ
aspectRatiostringคำแนะนำอัตราส่วนภาพ เช่น 1:1, 16:9, 9:16, adaptive หรือค่าเฉพาะของผู้ให้บริการ OpenClaw จะปรับให้เป็นรูปแบบมาตรฐานหรือเพิกเฉยต่อค่าที่ไม่รองรับตามแต่ละผู้ให้บริการ
OPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9InJlc29sdXRpb24iIHR5cGU9InN0cmluZyI
คำแนะนำความละเอียด เช่น 360P, 480P, 540P, 720P, 768P, 1080P, 4K หรือค่าเฉพาะของผู้ให้บริการ OpenClaw จะปรับให้เป็นรูปแบบมาตรฐานหรือเพิกเฉยต่อค่าที่ไม่รองรับตามแต่ละผู้ให้บริการ
OPENCLAW_DOCS_MARKER:paramClose:
durationSecondsnumberระยะเวลาเป้าหมายเป็นวินาที (ปัดเป็นค่าที่ใกล้ที่สุดซึ่งผู้ให้บริการรองรับ)
sizestringaudiobooleanเปิดใช้เสียงที่สร้างขึ้นในเอาต์พุตเมื่อรองรับ แตกต่างจาก audioRef* (อินพุต)
watermarkbooleanadaptive เป็นค่าเซนทิเนลเฉพาะของผู้ให้บริการ โดยจะถูกส่งต่อไปตามที่ระบุให้แก่
ผู้ให้บริการที่ประกาศ adaptive ในความสามารถของตน (เช่น BytePlus
Seedance ใช้ค่านี้เพื่อตรวจหาอัตราส่วนโดยอัตโนมัติจากมิติของรูปภาพ
อินพุต) ผู้ให้บริการที่ไม่ได้ประกาศค่านี้จะแสดงค่าผ่าน
details.ignoredOverrides ในผลลัพธ์ของเครื่องมือ เพื่อให้มองเห็นการละทิ้งค่า
ขั้นสูง
action"generate" | "status" | "list"default: generate"status" ส่งคืนงานของเซสชันปัจจุบัน ส่วน "list" ใช้ตรวจสอบผู้ให้บริการ
OPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9Im1vZGVsIiB0eXBlPSJzdHJpbmci
แทนที่ผู้ให้บริการ/โมเดล (เช่น runway/gen4.5)
OPENCLAW_DOCS_MARKER:paramClose:
filenamestringOPENCLAW_DOCS_MARKER:paramOpen:IHBhdGg9InRpbWVvdXRNcyIgdHlwZT0ibnVtYmVyIg
ระยะหมดเวลาของการดำเนินการกับผู้ให้บริการเป็นมิลลิวินาทีซึ่งระบุหรือไม่ก็ได้ หากไม่ระบุ OpenClaw จะใช้ agents.defaults.videoGenerationModel.timeoutMs หากมีการกำหนดค่าไว้ มิฉะนั้นจะใช้ค่าเริ่มต้นของผู้ให้บริการที่ผู้เขียน plugin กำหนดไว้ หากมี
OPENCLAW_DOCS_MARKER:paramClose:
providerOptionsobjectตัวเลือกเฉพาะของผู้ให้บริการในรูปแบบออบเจ็กต์ JSON (เช่น {"seed": 42, "draft": true})
ผู้ให้บริการที่ประกาศสคีมาแบบมีชนิดข้อมูลจะตรวจสอบคีย์และชนิดข้อมูล คีย์ที่ไม่รู้จัก
หรือชนิดข้อมูลที่ไม่ตรงกันจะทำให้ข้ามตัวเลือกผู้ให้บริการนั้นระหว่างการใช้ทางเลือกสำรอง ผู้ให้บริการที่ไม่มี
สคีมาที่ประกาศไว้จะได้รับตัวเลือกตามที่ระบุ เรียกใช้ video_generate action=list
เพื่อดูว่าแต่ละผู้ให้บริการยอมรับสิ่งใด
อินพุตอ้างอิงใช้เลือกโหมดรันไทม์:
- ไม่มีสื่ออ้างอิง ->
generate - มีรูปภาพอ้างอิงใด ๆ ->
imageToVideo - มีวิดีโออ้างอิงใด ๆ ->
videoToVideo - อินพุตเสียงอ้างอิง ไม่ เปลี่ยนโหมดที่กำหนดได้ โดยจะถูกนำไปใช้
เพิ่มเติมจากโหมดที่การอ้างอิงรูปภาพ/วิดีโอเลือกไว้ และทำงานเฉพาะ
กับผู้ให้บริการที่ประกาศ
maxInputAudios
การใช้การอ้างอิงรูปภาพและวิดีโอร่วมกันไม่ใช่พื้นผิวความสามารถที่ใช้ร่วมกันอย่างเสถียร ควรใช้การอ้างอิงเพียงประเภทเดียวต่อคำขอ
ทางเลือกสำรองและตัวเลือกแบบมีชนิดข้อมูล
การตรวจสอบความสามารถบางอย่างจะเกิดขึ้นที่ชั้นทางเลือกสำรอง แทนที่จะเป็นขอบเขตของเครื่องมือ ดังนั้นคำขอที่เกินขีดจำกัดของผู้ให้บริการหลักยังคงสามารถ ทำงานกับผู้ให้บริการสำรองที่มีความสามารถได้:
- ตัวเลือกที่ใช้งานอยู่ซึ่งไม่ได้ประกาศ
maxInputAudios(หรือ0) จะถูกข้ามเมื่อ คำขอมีเสียงอ้างอิง จากนั้นจะลองตัวเลือกถัดไป การป้องกันเดียวกันนี้ ใช้กับจำนวนการอ้างอิงรูปภาพและวิดีโอโดยเทียบกับmaxInputImages/maxInputVideos maxDurationSecondsของตัวเลือกที่ใช้งานอยู่ต่ำกว่าdurationSecondsที่ร้องขอ และไม่มีรายการsupportedDurationSecondsที่ประกาศไว้ -> ข้าม- คำขอมี
providerOptionsและตัวเลือกที่ใช้งานอยู่ประกาศ สคีมาproviderOptionsแบบมีชนิดข้อมูลอย่างชัดเจน -> ข้ามหากคีย์ที่ระบุ ไม่มีอยู่ในสคีมา หรือชนิดของค่าไม่ตรงกัน ผู้ให้บริการที่ไม่มี สคีมาที่ประกาศไว้จะได้รับตัวเลือกตามที่ระบุ (การส่งผ่านที่ เข้ากันได้ย้อนหลัง) ผู้ให้บริการสามารถเลือกไม่รับตัวเลือกของผู้ให้บริการทั้งหมดได้โดย ประกาศสคีมาว่าง (capabilities.providerOptions: {}) ซึ่ง จะทำให้ข้ามเช่นเดียวกับกรณีชนิดข้อมูลไม่ตรงกัน
เหตุผลการข้ามครั้งแรกในคำขอจะบันทึกที่ warn เพื่อให้ผู้ปฏิบัติงานเห็นว่า
ผู้ให้บริการหลักถูกข้ามเมื่อใด ส่วนการข้ามครั้งถัดไปจะบันทึกที่ debug เพื่อ
ไม่ให้เชนทางเลือกสำรองที่ยาวสร้างบันทึกมากเกินไป หากตัวเลือกทั้งหมดถูกข้าม
ข้อผิดพลาดแบบรวมจะมีเหตุผลการข้ามของแต่ละตัวเลือก
การดำเนินการ
| การดำเนินการ | สิ่งที่ดำเนินการ |
|---|---|
generate |
ค่าเริ่มต้น สร้างวิดีโอจากพรอมต์ที่ระบุและอินพุตอ้างอิงที่ระบุหรือไม่ก็ได้ |
status |
ตรวจสอบสถานะของงานวิดีโอที่กำลังดำเนินอยู่สำหรับเซสชันปัจจุบัน โดยไม่เริ่มการสร้างใหม่ |
list |
แสดงผู้ให้บริการ โมเดล และความสามารถที่พร้อมใช้งาน |
การเลือกโมเดล
OpenClaw จะกำหนดโมเดลตามลำดับต่อไปนี้:
- พารามิเตอร์เครื่องมือ
model- หากเอเจนต์ระบุไว้ในการเรียก videoGenerationModel.primaryจากการกำหนดค่าvideoGenerationModel.fallbacksตามลำดับ- การตรวจหาอัตโนมัติ - ผู้ให้บริการที่มีข้อมูลรับรองความถูกต้องที่ใช้ได้ โดยเริ่มจาก ผู้ให้บริการเริ่มต้นปัจจุบัน แล้วตามด้วยผู้ให้บริการที่เหลือตามลำดับ ตัวอักษร
หากผู้ให้บริการล้มเหลว ระบบจะลองตัวเลือกถัดไปโดยอัตโนมัติ หาก ตัวเลือกทั้งหมดล้มเหลว ข้อผิดพลาดจะมีรายละเอียดจากแต่ละครั้งที่ลอง
ตั้งค่า agents.defaults.mediaGenerationAutoProviderFallback: false เพื่อใช้
เฉพาะรายการ model, primary และ fallbacks ที่ระบุอย่างชัดเจน
{ agents: { defaults: { videoGenerationModel: { primary: "google/veo-3.1-fast-generate-preview", fallbacks: ["runway/gen4.5", "qwen/wan2.6-t2v"], timeoutMs: 180000, // การแทนที่ระยะหมดเวลาของคำขอผู้ให้บริการต่อเครื่องมือซึ่งระบุหรือไม่ก็ได้ }, }, },}หมายเหตุเกี่ยวกับผู้ให้บริการ
Alibaba
ใช้ปลายทางแบบอะซิงโครนัสของ DashScope / Model Studio รูปภาพและ
วิดีโออ้างอิงต้องเป็น URL http(s) ระยะไกล
BytePlus (รวมมาให้)
รหัสผู้ให้บริการ: byteplus
โมเดล: seedance-1-0-pro-250528 (ค่าเริ่มต้น),
seedance-1-5-pro-251215
ใช้ API content[] แบบรวม รองรับรูปภาพอินพุตสูงสุด 2 ภาพ
(first_frame + last_frame) ส่งรูปภาพตามตำแหน่งหรือตั้งค่า
role ของแต่ละรูปภาพอย่างชัดเจน
คีย์ providerOptions ที่รองรับ: seed (ตัวเลข), draft (บูลีน -
บังคับเป็น 480p), camera_fixed (บูลีน)
BytePlus Seedance 1.5 plugin
ต้องใช้ plugin @openclaw/byteplus-modelark
(ภายนอก ไม่ได้รวมมาให้) รหัสผู้ให้บริการ: byteplus-seedance15 โมเดล:
seedance-1-5-pro-251215
ใช้ API content[] แบบรวม รองรับรูปภาพอินพุตสูงสุด 2 ภาพ
(first_frame + last_frame) อินพุตทั้งหมดต้องเป็น URL
https:// ระยะไกล ตั้งค่า role: "first_frame" / "last_frame" ในแต่ละรูปภาพ หรือ
ส่งรูปภาพตามตำแหน่ง
aspectRatio: "adaptive" ตรวจหาอัตราส่วนโดยอัตโนมัติจากรูปภาพอินพุต
audio: true จับคู่กับ generate_audio ส่วน providerOptions.seed
(ตัวเลข) จะถูกส่งต่อ
BytePlus Seedance 2.0
ต้องใช้ plugin @openclaw/byteplus-modelark
(ภายนอก ไม่ได้รวมมาให้) รหัสผู้ให้บริการ: byteplus-seedance2 โมเดล:
dreamina-seedance-2-0-260128,
dreamina-seedance-2-0-fast-260128
ใช้ API content[] แบบรวม รองรับรูปภาพอ้างอิงสูงสุด 9 ภาพ
วิดีโออ้างอิง 3 รายการ และเสียงอ้างอิง 3 รายการ อินพุตทั้งหมดต้องเป็น URL
https:// ระยะไกล ตั้งค่า role ในแต่ละแอสเซต - ค่าที่รองรับ:
"first_frame", "last_frame", "reference_image",
"reference_video", "reference_audio"
aspectRatio: "adaptive" ตรวจหาอัตราส่วนโดยอัตโนมัติจากรูปภาพอินพุต
audio: true จับคู่กับ generate_audio ส่วน providerOptions.seed
(ตัวเลข) จะถูกส่งต่อ
ComfyUI
การดำเนินการภายในเครื่องหรือบนคลาวด์ที่ขับเคลื่อนด้วยเวิร์กโฟลว์ รองรับการแปลงข้อความเป็นวิดีโอและ รูปภาพเป็นวิดีโอผ่านกราฟที่กำหนดค่าไว้
fal
ใช้โฟลว์ที่มีคิวรองรับสำหรับงานที่ใช้เวลานาน โดยค่าเริ่มต้น OpenClaw จะรอสูงสุด 20 นาทีก่อนถือว่างานในคิว fal ที่กำลังดำเนินการหมดเวลา โมเดลวิดีโอ fal ส่วนใหญ่ยอมรับการอ้างอิงรูปภาพเพียงรูปเดียว โมเดล Seedance 2.0 สำหรับแปลงข้อมูลอ้างอิงเป็นวิดีโอยอมรับรูปภาพสูงสุด 9 รูป วิดีโอ 3 รายการ และข้อมูลอ้างอิงเสียง 3 รายการ โดยมี ไฟล์อ้างอิงรวมได้ไม่เกิน 12 ไฟล์
Google (Gemini / Veo)
รองรับการอ้างอิงรูปภาพหนึ่งรูปหรือวิดีโอหนึ่งรายการ คำขอให้สร้างเสียงจะ
ถูกละเว้นพร้อมคำเตือนบนเส้นทาง Gemini API เนื่องจาก API นั้นปฏิเสธ
พารามิเตอร์ generateAudio สำหรับการสร้างวิดีโอ Veo ในปัจจุบัน
MiniMax
รองรับการอ้างอิงรูปภาพเพียงรูปเดียว MiniMax ยอมรับความละเอียด 768P และ 1080P
คำขอเช่น 720P จะถูกปรับให้เป็นค่าที่รองรับซึ่งใกล้เคียงที่สุด
ก่อนส่ง
OpenAI
ส่งต่อเฉพาะการแทนที่ size เท่านั้น การแทนที่รูปแบบอื่น
(aspectRatio, resolution, audio, watermark) จะถูกละเว้นพร้อม
คำเตือน
OpenRouter
ใช้ API /videos แบบอะซิงโครนัสของ OpenRouter โดย OpenClaw จะส่ง
งาน ตรวจสอบ polling_url เป็นระยะ และดาวน์โหลด unsigned_urls หรือ
ปลายทางเนื้อหางานที่ระบุไว้ในเอกสาร ค่าเริ่มต้น google/veo-3.1-fast ที่มาพร้อมระบบ
ระบุระยะเวลา 4/6/8 วินาที ความละเอียด 720P/1080P และ
อัตราส่วนภาพ 16:9/9:16
Qwen
ใช้แบ็กเอนด์ DashScope เดียวกับ Alibaba อินพุตอ้างอิงต้องเป็น URL
http(s) ระยะไกล โดยไฟล์ภายในเครื่องจะถูกปฏิเสธล่วงหน้า
Runway
รองรับไฟล์ภายในเครื่องผ่าน URI ข้อมูล การแปลงวิดีโอเป็นวิดีโอต้องใช้
runway/gen4_aleph การทำงานแบบข้อความเท่านั้นรองรับอัตราส่วนภาพ
16:9 และ 9:16
Together
รองรับการอ้างอิงรูปภาพเพียงรูปเดียว
Vydra
ใช้ https://www.vydra.ai/api/v1 โดยตรงเพื่อหลีกเลี่ยงการเปลี่ยนเส้นทาง
ที่ทำให้ข้อมูลรับรองการยืนยันตัวตนสูญหาย veo3 ที่มาพร้อมระบบรองรับเฉพาะการแปลงข้อความเป็นวิดีโอ ส่วน kling ต้องใช้
URL รูปภาพระยะไกล
xAI
โมเดลเริ่มต้น grok-imagine-video รองรับการแปลงข้อความเป็นวิดีโอ การแปลงรูปภาพเฟรมแรก
รูปเดียวเป็นวิดีโอ อินพุต reference_image สูงสุด 7 รายการผ่าน xAI
reference_images และโฟลว์แก้ไข/ขยายวิดีโอระยะไกล การสร้างมีค่าเริ่มต้น
เป็น 480P ส่วนการแปลงรูปภาพเดียวเป็นวิดีโอจะสืบทอดอัตราส่วนของต้นฉบับเมื่อ
ไม่ได้ระบุ aspectRatio การแก้ไข/ขยายวิดีโอจะสืบทอดรูปทรงของอินพุตและ
ไม่ยอมรับการแทนที่อัตราส่วนภาพหรือความละเอียด การขยายรองรับ 2-10
วินาที
grok-imagine-video-1.5 รองรับเฉพาะการแปลงรูปภาพเป็นวิดีโอ: ต้องระบุรูปภาพหนึ่งรูปพอดี
รองรับระยะเวลา 1-15 วินาที และ 480P, 720P หรือ 1080P โดยมีค่าเริ่มต้นเป็น
480P; ให้ละเว้น aspectRatio เพื่อสืบทอดอัตราส่วนของรูปภาพต้นฉบับ ตัวระบุ
รุ่นตัวอย่างและรุ่น 1.5 ที่ระบุวันที่จะได้รับการตรวจสอบแบบเดียวกันและถูกส่งต่อ
โดยไม่เปลี่ยนแปลง
โหมดความสามารถของผู้ให้บริการ
สัญญาการสร้างวิดีโอที่ใช้ร่วมกันรองรับความสามารถเฉพาะโหมด แทนที่จะรองรับเฉพาะขีดจำกัดรวมแบบแบน การใช้งานผู้ให้บริการใหม่ ควรเลือกใช้บล็อกโหมดอย่างชัดเจน:
capabilities: { generate: { maxVideos: 1, maxDurationSeconds: 10, supportsResolution: true, }, imageToVideo: { enabled: true, maxVideos: 1, maxInputImages: 1, maxInputImagesByModel: { "provider/reference-to-video": 9 }, maxDurationSeconds: 5, }, videoToVideo: { enabled: true, maxVideos: 1, maxInputVideos: 1, maxDurationSeconds: 5, },}ฟิลด์รวมแบบแบน เช่น maxInputImages และ maxInputVideos
ไม่ เพียงพอสำหรับระบุการรองรับโหมดการแปลง ผู้ให้บริการควร
ประกาศ generate, imageToVideo และ videoToVideo อย่างชัดเจน เพื่อให้การทดสอบแบบสด
การทดสอบสัญญา และเครื่องมือ video_generate ที่ใช้ร่วมกันสามารถตรวจสอบ
การรองรับโหมดได้อย่างกำหนดแน่นอน
เมื่อโมเดลหนึ่งของผู้ให้บริการรองรับอินพุตอ้างอิงได้กว้างกว่า
โมเดลอื่น ให้ใช้ maxInputImagesByModel, maxInputVideosByModel หรือ
maxInputAudiosByModel แทนการเพิ่มขีดจำกัดของทั้งโหมด
การทดสอบแบบสด
ความครอบคลุมแบบสดที่เลือกเปิดใช้ได้สำหรับผู้ให้บริการร่วมที่มาพร้อมระบบ:
OPENCLAW_LIVE_TEST=1 pnpm test:live -- extensions/video-generation-providers.live.test.tsตัวหุ้มของรีโพ:
pnpm test:live:media videoโดยค่าเริ่มต้น ไฟล์การทดสอบแบบสดนี้ใช้ตัวแปรสภาพแวดล้อมของผู้ให้บริการที่ส่งออกไว้แล้วก่อน โปรไฟล์การยืนยันตัวตนที่จัดเก็บไว้ และดำเนินการทดสอบควันแบบปลอดภัยสำหรับรีลีสเป็นค่าเริ่มต้น:
generateสำหรับผู้ให้บริการที่ไม่ใช่ FAL ทุกรายในชุดทดสอบ- พรอมต์ lobster หนึ่งวินาที
- ขีดจำกัดการดำเนินการต่อผู้ให้บริการจาก
OPENCLAW_LIVE_VIDEO_GENERATION_TIMEOUT_MS(ค่าเริ่มต้นคือ180000)
FAL ต้องเลือกเปิดใช้ เนื่องจากความหน่วงของคิวฝั่งผู้ให้บริการอาจกินเวลา ของรีลีสเป็นส่วนใหญ่:
pnpm test:live:media video --video-providers falตั้งค่า OPENCLAW_LIVE_VIDEO_GENERATION_FULL_MODES=1 เพื่อเรียกใช้
โหมดการแปลงที่ประกาศไว้เพิ่มเติม ซึ่งชุดทดสอบร่วมสามารถดำเนินการได้อย่างปลอดภัยด้วยสื่อภายในเครื่อง:
imageToVideoเมื่อcapabilities.imageToVideo.enabledvideoToVideoเมื่อcapabilities.videoToVideo.enabledและ ผู้ให้บริการ/โมเดลยอมรับอินพุตวิดีโอภายในเครื่องที่รองรับด้วยบัฟเฟอร์ใน ชุดทดสอบร่วม
ปัจจุบันเลนสด videoToVideo ที่ใช้ร่วมกันครอบคลุม runway เฉพาะเมื่อ
เลือก runway/gen4_aleph
การกำหนดค่า
ตั้งค่าโมเดลสร้างวิดีโอเริ่มต้นในการกำหนดค่า OpenClaw:
{ agents: { defaults: { videoGenerationModel: { primary: "qwen/wan2.6-t2v", fallbacks: ["qwen/wan2.6-r2v-flash"], }, }, },}หรือผ่าน CLI:
openclaw config set agents.defaults.videoGenerationModel.primary "qwen/wan2.6-t2v"ที่เกี่ยวข้อง
- Alibaba Model Studio
- งานเบื้องหลัง - การติดตามงานสำหรับการสร้างวิดีโอแบบอะซิงโครนัส
- BytePlus
- ComfyUI
- ข้อมูลอ้างอิงการกำหนดค่า
- fal
- Google (Gemini)
- MiniMax
- โมเดล
- OpenAI
- Qwen
- Runway
- Together AI
- ภาพรวมเครื่องมือ
- Vydra
- xAI