Tạo Ảnh Trước, Dựng Video Sau: Quy Trình 5 Giai Đoạn Chặn Đốt Credit AI

Quy trình làm video AI qua năm giai đoạn, cùng quy tắc ở giai đoạn 4 giúp chặn đốt credit: đừng prompt thẳng ra video, hãy tạo ảnh trước. Kèm bảy đề xuất cải thiện.

Tạo Ảnh Trước, Dựng Video Sau: Quy Trình 5 Giai Đoạn Chặn Đốt Credit AI

Wizy sản xuất video AI theo năm giai đoạn: ý tưởng, kịch bản, chia cảnh, tạo ảnh rồi mới dựng video, và hoàn thiện âm thanh. Quy tắc tiết kiệm tiền nhất nằm ở giai đoạn 4 — đừng bao giờ prompt thẳng ra video. Hãy tạo ảnh tĩnh trước, duyệt ảnh, rồi mới cho ảnh đã duyệt chuyển động. Tạo video tốn credit cao hơn tạo ảnh rất nhiều, và một clip bạn loại bỏ vẫn tốn đúng bằng một clip bạn giữ lại.

Dưới đây là quy trình đang chạy hiện tại, kèm bảy đề xuất cải thiện của tôi.

Năm giai đoạn nhìn một lượt

Giai đoạn Công việc Công cụ Đầu ra
1. Ý tưởng Xác định chủ đề, mục tiêu, đối tượng xem, thông điệp chính Gemini Ý tưởng video
2. Kịch bản Hook → Nội dung → Cao trào → CTA NotebookLM, Gemini Kịch bản hoàn chỉnh
3. Chia cảnh Tách thành từng scene; xác định nhân vật, bối cảnh, hành động Whisk AI, CapCut Pro Storyboard / danh sách cảnh
4. Ảnh → video Prompt chi tiết cho từng cảnh; tạo ảnh trước rồi mới dựng Veo, Runway, Gemini, CapCut Pro Video từng scene
5. Âm thanh & hiệu ứng Khớp tiếng, nhạc nền, ambience, chỉnh màu, phụ đề CapCut, ElevenLabs Video hoàn chỉnh

Giai đoạn 1: Ý tưởng — chốt thông điệp trước khi mở công cụ

Mỗi video bắt đầu bằng việc gọi tên bốn thứ: chủ đề, mục tiêu, đối tượng xem, và một thông điệp chính. Nguồn thường là thứ đã có sẵn — một bài blog, một buổi khai trương, một chương trình khuyến mãi. Gemini biến nguyên liệu thô đó thành hướng kịch bản đầu tiên.

Kỷ luật ở đây là biết bớt đi. Một video mang hai thông điệp thì rốt cuộc không mang thông điệp nào.

Giai đoạn 2: Kịch bản — Hook → Nội dung → Cao trào → CTA

Kịch bản đi theo bốn nhịp cố định. Hook phải giành được ba giây đầu, nội dung đưa ra phần cốt lõi, cao trào chốt lại điểm chạm về cảm xúc hoặc lý lẽ, và CTA nói thẳng cho người xem biết cần làm gì tiếp theo.

NotebookLM gánh phần nặng ở giai đoạn này: đưa cho nó nguồn sẵn có — link bài viết, video, hình ảnh — nó dựng được cả bố cục video chứ không chỉ ra văn xuôi. Nội dung chữ đã có biến thành ý tưởng video thô mà không phải bắt đầu từ trang giấy trắng.

Giai đoạn 3: Chia cảnh — nơi rẻ nhất để giết một video dở

Kịch bản được cắt thành từng scene, mỗi scene xác định rõ nhân vật, bối cảnh và hành động. Khi đã có sẵn video thô, đội chọn ra những đoạn tiềm năng và giữ lại âm thanh gốc làm mốc thời lượng để dựng lại cảnh sau đó.

Giai đoạn này cho ra storyboard. Đây cũng là điểm cuối cùng mà việc đổi ý còn miễn phí.

Giai đoạn 4: Tạo ảnh trước, chuyển động sau — quy tắc giữ ngân sách

Đây là thói quen giá trị nhất trong cả quy trình, và đáng được nói thẳng:

Viết prompt chi tiết cho từng cảnh. Tạo ảnh AI trước. Ghép các ảnh đã duyệt thành video. Đừng prompt thẳng ra video.

Hai lý do nó hiệu quả:

  1. Chi phí. Tạo video đốt credit với tốc độ cao hơn tạo ảnh rất nhiều. Lặp trên ảnh tĩnh nghĩa là bạn sai với giá rẻ, và chỉ tiêu credit video cho những khung hình đã được duyệt.
  2. Kiểm soát. Một tấm ảnh có thể xem, sửa và tạo lại trong vài giây. Khi chuyển động đã nướng vào rồi, sửa một chi tiết đồng nghĩa với tạo lại cả clip.

Hệ quả kèm theo: prompt phải đủ chi tiết để thành công ngay lần đầu. Prompt mơ hồ không hề miễn phí — nó chỉ là cách tiêu credit chậm hơn.

Giai đoạn 5: Âm thanh và hiệu ứng — nơi video hay thành video xong

Giai đoạn cuối khớp giọng đọc AI với hình, rồi phủ lên nhạc nền, hiệu ứng âm thanh và ambience. Màu, ánh sáng, tương phản được chỉnh; lỗi do AI sinh ra bị soi và loại; phụ đề được thêm vào và soát lại.

Phụ đề không phải thứ làm cho có. Phần lớn video ngắn được xem trong trạng thái tắt tiếng.

Bảy đề xuất cải thiện của tôi

Quy trình trên đã vững. Đây là những lỗ hổng tôi sẽ bịt lại.

1. Thêm Giai đoạn 0: một dòng brief kèm chỉ số thành công

Quy trình bắt đầu từ "ý tưởng" nhưng chưa bao giờ định nghĩa thế nào là xong. Trước tiên hãy viết một dòng: đối tượng xem, một thông điệp, nền tảng và thời lượng, và chỉ số quyết định thành công — tỷ lệ xem hết, lượt click, lượt trả lời. Thiếu nó, giai đoạn 5 không có bài kiểm tra nghiệm thu và "xong" trở thành chuyện cảm tính.

2. Khoá nhân vật và phong cách trước giai đoạn 4, không phải trong lúc làm

Lỗi phổ biến nhất của video AI là trôi nhận diện: cùng một người nhưng mặt ở cảnh 2 khác mặt ở cảnh 5. Hãy dựng một style bible nhỏ trước — bộ ảnh tham chiếu nhân vật đã khoá, bảng màu, quy ước ống kính và ánh sáng — rồi đưa những ảnh tham chiếu đó vào mọi lần tạo cảnh. Sửa trôi nhận diện sau khi đã dựng đồng nghĩa với tạo lại nguyên cảnh.

3. Đặt một cửa duyệt của con người giữa giai đoạn 3 và 4

Việc duyệt storyboard phải là bước bắt buộc và được ghi rõ. Mỗi giờ bỏ ra tạo hình cho một cảnh rốt cuộc bị cắt là tiền chi ra để chứng minh điều mà storyboard đã biết từ trước.

4. Đặt quy ước tên file và ghi shot log

scene_04_v03 tốt hơn final_final_2. Hãy ghi lại prompt nào cho ra shot nào đã được duyệt. Không có nó, ba ngày sau muốn dựng lại cũng không tái tạo được, và cả đội đi làm lại đúng một cảnh hai lần.

5. Xây thư viện prompt

Những prompt đã cho ra shot được duyệt là tài sản tích luỹ — và là đầu ra bị đánh giá thấp nhất của cả quy trình. Hãy lưu lại những prompt thắng kèm ghi chú nó giải quyết được vấn đề gì. Sau hai mươi video, thư viện này còn đáng giá hơn bất kỳ gói subscription nào.

6. Khoá giọng đọc trước khi tạo hình

Với video ngắn thì càng đúng: hãy thu hoặc tạo giọng đọc trước, rồi cắt danh sách shot theo đúng nhịp đọc thật. Tạo hình trước rồi mới phát hiện lời đọc dài hơn bốn giây sẽ buộc phải dựng lại — đúng thứ mà quy tắc "ảnh trước" sinh ra để tránh.

7. Thêm Giai đoạn 6: phân phối

Hiện quy trình dừng ở "video hoàn chỉnh", mà đó lại là chỗ giá trị còn chưa được thu về. Một bản master nên đẻ ra các bản cắt dọc, thumbnail, caption riêng cho từng nền tảng, và lịch đăng. Với nội dung tiếng Việt, thêm một bước soát dấu bắt buộc — phụ đề tự động sai dấu tiếng Việt gần như chắc chắn.

Và một con số cần theo dõi hơn tất cả: chi phí trên mỗi phút video hoàn chỉnh, tính cả những lần tạo bị loại. Đây là con số duy nhất cho bạn biết quy trình đang thật sự tốt lên hay chỉ đang bận rộn hơn.

FAQ

Vì sao phải tạo ảnh trước thay vì prompt thẳng ra video? Vì credit video đắt hơn credit ảnh rất nhiều tính trên mỗi giây, và một clip bị loại vẫn tốn đúng bằng clip được nhận. Lặp trên ảnh tĩnh giúp bạn sai với giá rẻ, rồi chỉ tiêu credit video cho khung hình đã duyệt.

Rủi ro chất lượng lớn nhất của quy trình video AI là gì? Trôi nhận diện và trôi phong cách giữa các cảnh. Hãy khoá ảnh tham chiếu nhân vật và phong cách hình ảnh trước khi tạo bất kỳ cảnh nào, rồi đưa các tham chiếu đó vào mọi lần tạo.

Bước duyệt của con người nên đặt ở đâu? Ở storyboard, giữa bước chia cảnh và bước tạo hình. Đó là điểm cuối cùng mà đổi hướng không tốn gì.

Các công cụ này có xử lý được tiếng Việt không? Giọng đọc và phụ đề đều chạy được, nhưng phụ đề tiếng Việt tự động sai dấu đủ thường xuyên để bước soát tay phải là bắt buộc, không phải tuỳ chọn.

Một đội làm video nên theo dõi chỉ số nào? Chi phí trên mỗi phút video hoàn chỉnh, tính cả các lần tạo bị loại. Nó phơi ra phần lãng phí mà cách tính ngân sách theo từng video che mất.


✍️ Tác giả: Do Ngoc Hoan Founder of CookConnects.ca & Wizy.ca. Kết nối khoảng cách giữa thuật toán tiên tiến và thực thi kinh doanh. Tôi viết cho những founder kỹ thuật muốn mở rộng tầm ảnh hưởng bằng AI và kỹ thuật vững chắc.

← Blog