AI Video đều đã có API: Seedance, Veo, Runway — Gọi thẳng từ MCP
Seedance, Veo, Runway, Kling — tất cả đều đã có REST API. MCP native thì hiếm, nhưng một MCP server tổng hợp trên fal.ai/Replicate cho bạn tất cả cùng lúc. Kèm pipeline "bài viết → video" hoàn chỉnh.
Có. Hầu hết các mô hình AI Video hàng đầu hiện nay đều đã cung cấp REST API, và hệ sinh thái MCP (Model Context Protocol) đang cho phép gọi thẳng các công cụ này từ trợ lý AI như Claude Desktop, Cursor hay Gemini. Tóm gọn: API giờ là chuyện mặc định; MCP native vẫn còn hiếm, nhưng bạn hầu như không cần — một MCP server tổng hợp đặt trên fal.ai hoặc Replicate là đủ để truy cập gần như mọi mô hình cùng lúc.
Dưới đây là tình trạng thực tế của từng cái tên, kèm pipeline tôi sẽ thực sự dựng nếu mục tiêu là "chuyển bài viết thành video bằng code".
Seedance (ByteDance) có API không?
API: CÓ. Dòng Seedance của ByteDance — từ Seedance 1.0 đến các phiên bản mới hơn — đã có mặt trên các nền tảng phân phối API lớn: fal.ai, Replicate và Magic Hour. Bạn gửi prompt, ảnh gốc, kèm audio nếu muốn, và nhận về video chất lượng cinema qua REST API thuần.
MCP: Không trực tiếp. Chưa có MCP Server chính thức từ ByteDance. Nhưng điều này ít quan trọng hơn bạn nghĩ: chỉ cần một MCP wrapper trỏ vào endpoint fal.ai hoặc Replicate là agent của bạn đã có Seedance như một tool gọi được, chỉ với vài dòng config.
Gemini / Google có tạo video không? (Câu trả lời là Veo)
API: CÓ — nhưng mô hình là Veo, không phải Gemini. Google không sinh video bên trong mô hình ngôn ngữ thuần túy. Việc tạo video nằm ở Veo, gọi qua Google Cloud Vertex AI (hoặc Gemini Enterprise Agent Platform). Hỗ trợ cả Text-to-Video lẫn Image-to-Video.
MCP: CÓ, thông qua bộ MCP tools của GCP. Cả cộng đồng mã nguồn mở lẫn Google Cloud đều đã có MCP Server cho phép LLM gọi API Vertex AI — nghĩa là sinh ảnh/video bằng Veo có thể truy cập từ agent mà không cần tự viết cầu nối.
Có thể tự động hóa CapCut bằng code không?
API & MCP: CÓ — nhưng qua cộng đồng, không phải ByteDance.
- API chính thức: CapCut cố ý tập trung vào ứng dụng người dùng cuối và Web UI. Các API thương mại trực tiếp từ ByteDance chủ yếu đi qua BytePlus.
- CapCutAPI mã nguồn mở + MCP: Trên GitHub đã có các dự án mã nguồn mở (nổi bật là CapCutAPI) hỗ trợ đồng thời RESTful HTTP API và MCP Protocol native. Đây mới là phần thú vị: nó cho phép bạn thao tác trực tiếp với timeline — chèn nhạc, hiệu ứng, text, subtitle — và tự động tạo file dự án (draft) CapCut bằng MCP.
Sự khác biệt này rất quan trọng. Seedance và Veo sinh footage. CapCutAPI lắp ráp footage. Chúng giải quyết hai nửa khác nhau của bài toán.
Các "ông lớn" AI Video khác thì sao?
| Công cụ | API chính thức? | Hỗ trợ MCP? | Ghi chú |
|---|---|---|---|
| Runway (Gen-2 / Gen-3) | Có | Third-party | REST API rất mạnh cho cả Text-to-Video và Image-to-Video |
| Luma Dream Machine | Có | Third-party | Luma API chính thức, tốc độ render nhanh |
| Kling AI (Kuaishou) | Có | Qua aggregators | API chính thức + fal.ai/Replicate; chuyển động chân thực hàng đầu |
| Pika Labs | Có | Không | Có API cho developer để tích hợp hiệu ứng video |
| Haiper AI | Có | Có | API rất tốt cho video ngắn và animation |
Quy luật đã rõ: API là điều kiện tối thiểu trong năm 2026. MCP mới là điểm khác biệt, và phần lớn nhà cung cấp đang "thuê ngoài" phần này cho các aggregator.
Nên dựng pipeline "bài viết → video" như thế nào?
Có hai kiến trúc khả thi, tùy mức độ kiểm soát bạn muốn.
Phương án 1: Agent điều khiển (để Claude hoặc Cursor tự gọi tool)
Dùng một MCP server tổng hợp — fal-ai-mcp hoặc replicate-mcp. Một kết nối MCP duy nhất cho bạn đồng thời Seedance, Flux, Runway và Kling, thay vì phải duy trì năm tích hợp riêng lẻ.
Bổ sung CapCut MCP / Open CapCut API khi bạn muốn xếp hình ảnh và âm thanh có sẵn lên timeline CapCut thay vì render nguyên bản bằng AI. Đây là con đường rẻ hơn — bạn trả tiền cho việc lắp ráp, không phải cho việc sinh nội dung.
Phương án 2: Pipeline backend tự động hoàn toàn
Nếu bạn muốn một pipeline xác định, do code làm chủ, không có agent xen vào:
- Giọng đọc (TTS): ElevenLabs API, hoặc Edge-TTS nếu cần miễn phí.
- Sinh ảnh / B-roll: Flux.1 API hoặc Midjourney API.
- Sinh video motion: Seedance qua fal.ai, hoặc Veo qua Vertex AI.
- Engine ghép dựng: Remotion (React/TypeScript — bạn viết video như viết component) hoặc FFmpeg để nối âm thanh, video và chữ thành thành phẩm.
Khuyến nghị của tôi: hãy bắt đầu với lớp rendering của Phương án 2 ngay cả khi bạn dùng lớp generation của Phương án 1. Remotion cho bạn video có version control và tái tạo được. Một agent tự ứng biến timeline thì không.
Điều đa số mọi người làm sai
Các team đầu tư quá nhiều vào mô hình sinh video và quá ít vào lớp lắp ráp. Seedance hay Runway là cuộc tranh luận chất lượng chỉ chiếm khoảng 10% chất lượng đầu ra. Việc pipeline của bạn có render lại đúng y video đó sau khi sửa kịch bản hay không mới chiếm 90% còn lại.
Chọn aggregator, đừng chọn mô hình. Rồi tự làm chủ renderer của bạn.
FAQ
Seedance có MCP Server chính thức không? Không. ByteDance chưa phát hành. Hãy truy cập qua fal.ai hoặc Replicate rồi bọc endpoint đó bằng một MCP server.
Gemini có sinh video trực tiếp không? Không. Mô hình video của Google là Veo, gọi qua Vertex AI. Gemini là lớp ngôn ngữ, không phải bộ sinh video.
Cách rẻ nhất để cho AI agent khả năng làm video là gì? Một MCP server tổng hợp (fal-ai-mcp hoặc replicate-mcp). Nó expose hàng chục mô hình — gồm Seedance, Flux, Runway, Kling — chỉ qua một tích hợp duy nhất.
Tự động hóa CapCut có được hỗ trợ chính thức không? Không trực tiếp từ ByteDance. Hãy dùng dự án mã nguồn mở CapCutAPI (hỗ trợ cả REST lẫn MCP native), hoặc đi qua BytePlus nếu cần API thương mại.
Remotion hay FFmpeg để render cuối? Remotion nếu team bạn viết React và muốn video dạng component, có version control. FFmpeg nếu bạn cần tốc độ thô và ít phụ thuộc.
#AIVideo #MCP #Seedance #Veo #Runway #CapCut #Remotion #FFmpeg #AIAgents #DevTools
✍️ Tác giả: Do Ngoc Hoan Founder of CookConnects.ca & Wizy.ca. Kết nối khoảng cách giữa thuật toán tiên tiến và thực thi kinh doanh. Tôi viết cho những founder kỹ thuật muốn mở rộng tầm ảnh hưởng bằng AI và kỹ thuật vững chắc.