Thư giãn cuối tuần cùng KumaClouds
KumaClouds làm một bài hướng dẫn tạo video từ ảnh. Bài này phù hợp với anh chị nào đang bán hàng online và cần một clip giới thiệu sản phẩm.
Cụ thể: từ một tấm ảnh sản phẩm ra một clip dọc 10 giây, có người mẫu và có lời thoại tiếng Việt. Công cụ là Grok của xAI, làm trong hai bước.
Anh chị có thể làm tương tự. Muốn tối ưu cho đẹp hơn thì chỉnh lại prompt cho hợp với sản phẩm của mình, hoặc cần hướng dẫn thêm thì liên hệ KumaClouds.
📄 Prompt bước 1 — tạo ảnh người mẫu (PDF) — dùng khi có ảnh sản phẩm của mình
🎥 Prompt bước 2 — tạo video (PDF) — chỉ muốn thử nhanh thì vào thẳng đây
🖼️ Ảnh mẫu để thử ngay — ảnh do Grok tạo, dùng thoải mái
🎬 Tải clip KumaClouds đã làm (10s, 11MB)
Nói trước cho rõ: mục tiêu bài này là để anh chị thấy việc tạo video bằng Grok nhanh và dễ tới mức nào — không phải chạy đi chạy lại hàng chục lượt để ép ra kết quả hoàn hảo. Tất cả những gì trong bài đều là kết quả thử nhanh.
KumaClouds thực hiện bài thử này bằng tài khoản SuperGrok. Giao diện, lựa chọn và giới hạn có thể khác tùy tài khoản của anh chị.
Cần chuẩn bị gì
1. Một tài khoản tại grok.com. Bắt buộc. Về gói cước và giới hạn số video mỗi ngày, anh chị xem thẳng trong ứng dụng — các mức này thay đổi thường xuyên nên đừng tin con số cụ thể ở bất kỳ bài viết nào, kể cả bài này.
2. Một tấm ảnh sản phẩm. Ảnh nhà cung cấp gửi cũng được. Chưa có gì để thử thì tải ảnh mẫu ở trên, dùng luôn cho bước 2.
3. ChatGPT hoặc Claude — có thì tốt, không có cũng không sao. Prompt đã soạn sẵn hết rồi.
Sao không dùng Veo của Google? Veo cũng làm được video từ ảnh và chất lượng rất tốt. Chỉ là với tài khoản của chúng tôi thì đưa ảnh vào không chạy, thử nhiều lần vẫn báo lỗi, và chúng tôi không xác định được vì sao — có thể do khu vực, do gói tài khoản, hoặc do thao tác chưa đúng. Grok thì chạy ngay nên bài này dùng Grok. Ai đang dùng Veo thuận lợi thì cứ giữ cách của mình, các bước bên dưới vẫn áp dụng được.
Hai khái niệm cần phân biệt
Text to video — gõ mô tả bằng chữ, AI dựng ra clip hoàn toàn mới. Sản phẩm trong clip là thứ AI tưởng tượng, không phải hàng của anh chị.
Image to video — đưa vào một tấm ảnh có sẵn, mô tả anh chị muốn nó cử động thế nào. Khung hình giữ nguyên, chỉ có chuyển động là AI thêm vào.
Với quảng cáo bán hàng thì gần như luôn dùng image to video. Grok hỗ trợ cả hai kiểu.
Bước 0: Tải ảnh lên và chọn thiết lập
Vào https://grok.com/imagine, bấm dấu + ở khung chat, rồi bấm nút Upload để tải ảnh mẫu lên.
Ở thanh dưới cùng chọn ba thứ: chế độ Image, Quality thay vì Speed, và tỉ lệ 9:16. Thấy tùy chọn số bản (×4) thì cứ để nguyên — ra bốn tấm một lần thì dễ chọn hơn.
Bước 1: Từ ảnh sản phẩm ra ảnh có người mẫu mặc
Mở file PDF prompt bước 1 đã tải, copy phần prompt trong khung, dán vào, chạy.
Ảnh ra sẽ là người mẫu mặc một chiếc váy dựng theo đặc điểm chiếc váy trong ảnh gốc — đúng màu, đúng chất liệu, đúng kiểu cổ, đúng phom dáng — trong một bối cảnh sang trọng, và không mang theo watermark của ảnh gốc. Nói cho chính xác: prompt không xoá watermark khỏi ảnh cũ, mà tạo ra một ảnh hoàn toàn mới và yêu cầu AI đừng vẽ lại watermark vào đó.
Đây là kết quả thử nhanh, nên chiếc váy là bản dựng lại chứ không phải bản sao từng chi tiết. Nếu định dùng để bán đúng món đó, anh chị so lại với sản phẩm thật trước khi đăng.
Prompt viết bằng tiếng Anh — mô hình hiểu chắc tay hơn ở những mô tả chi tiết kiểu này. Lời thoại tiếng Việt vẫn viết tiếng Việt, nằm ở bước 2.
Bước 2: Từ ảnh vừa có ra video
Chọn tấm ảnh ưng ý nhất, bấm Make Video. Ở thanh dưới chọn 720p, thời lượng 10s, bật tiếng. Rồi dán prompt trong file PDF prompt bước 2.
Phần đáng nghịch nhất nằm ở đây: trong prompt có một câu tiếng Việt đặt trong ngoặc kép — đó là câu người mẫu sẽ nói. Đổi thành câu chào hàng của anh chị. File prompt có kèm cách đổi sang giọng miền Bắc.
Muốn xem trước ra thế nào thì tải clip mẫu ở đầu bài.
Đừng kỳ vọng lần đầu là ra
Chạy vài lần rồi chọn bản ưng nhất. Chuyện này bình thường với mọi công cụ loại này, không phải do anh chị làm sai.
Clip méo tay chân, mặt biến dạng. Gần như luôn do nhồi quá nhiều chuyển động vào mười giây. Giảm bớt động tác trong phần `Action flow` rồi chạy lại.
Clip nhìn nghiệp dư dù ảnh đẹp. Thường do thiếu mô tả máy quay. Một câu "máy quay đứng yên, không zoom, không rung" là khác hẳn.
Sửa mãi không khá lên. Vì đang đổi năm chỗ cùng lúc. Đổi một yếu tố thôi, chạy lại, xem thay đổi thế nào.
Vài điều nên tránh
- Chỉ dùng ảnh sản phẩm anh chị thật sự bán, hoặc ảnh mình có quyền dùng. Đừng lấy ảnh của shop khác rồi dựng lại thành của mình.
- So sánh sản phẩm trong clip với hàng thật trước khi đăng.
- Đừng dùng gương mặt người thật khi chưa xin phép. Người mẫu do AI tạo thì không có vấn đề này.
- Đừng gán lời chứng thực cho người không nói câu đó.
- Nhiều nền tảng gắn dấu nhận diện nội dung AI vào video xuất ra. Cứ coi như người xem biết đây là clip AI, và làm nội dung sao cho biết cũng không sao.
Cách trên là cách nhanh nhất để có kết quả trong buổi chiều, và đủ dùng cho phần lớn bài đăng thường ngày.
Còn để làm ra một bộ video sản phẩm đồng nhất — cùng một người mẫu qua nhiều clip, cùng tông màu, cùng bố cục, chạy được thành chiến dịch chứ không phải vài clip lẻ — thì cần cách làm bài bản hơn, và cần hiểu vì sao mỗi câu trong prompt lại ở đó. Phần đó để một bài khác.
Anh chị cứ làm thử cái đơn giản trước đã. Cuối tuần mà.