Cách tạo Avatar AI bằng Google Flow và Gemini Omni Flash: hướng dẫn chi tiết 5 bước
Có thể bạn chưa biết: hiện tại bạn hoàn toàn có thể tạo một MC ảo nói bằng chính giọng của mình, khớp khẩu hình gần như tuyệt đối, mà không cần đứng trước máy quay hay thuê studio. Công cụ để làm việc đó là Google Flow kết hợp với Gemini Omni Flash, model AI video mới nhất của Google ra mắt tại Google I/O tháng 5 năm 2026.
Trong bài viết này, mình chia sẻ toàn bộ quy trình tạo Avatar AI bằng Google Flow mà mình đã tự tay thử nghiệm, kèm những giới hạn thực tế mà bạn cần biết trước khi bắt tay vào làm.
Avatar AI trong Google Flow là gì?
Avatar AI là một phiên bản số của chính bạn, được tạo ra từ hình ảnh và giọng nói thật. Sau khi tạo xong, bạn có thể dùng avatar này để sản xuất video mà không cần quay lại từ đầu mỗi lần. Đây là tính năng đi kèm Gemini Omni Flash, và Google Flow là nơi bạn thao tác thuận tiện nhất vì có đầy đủ công cụ ghép nhiều cảnh, thư viện nguyên liệu và tùy chỉnh giọng nói.
Điểm khác biệt so với các công cụ tạo video AI trước đây nằm ở chỗ Gemini Omni Flash tạo hình ảnh và âm thanh trong cùng một lần xử lý, nên khẩu hình và giọng nói đồng bộ tự nhiên thay vì phải ghép thủ công.
Cần chuẩn bị gì trước khi bắt đầu
- Một tài khoản Google có quyền truy cập Google Flow tại địa chỉ labs.google/flow
- Máy tính có webcam và micro để thực hiện bước xác minh danh tính
- Kịch bản nội dung bạn muốn avatar đọc, chuẩn bị sẵn dưới dạng văn bản
- Khoảng 30 đến 45 phút cho lần làm đầu tiên
Một lưu ý quan trọng: Google yêu cầu bạn phải đủ 18 tuổi và tính năng Avatar có thể bị giới hạn ở một số quốc gia trong giai đoạn triển khai. Nếu bạn không thấy tùy chọn Avatar, hãy kiểm tra lại khu vực tài khoản và gói dịch vụ đang dùng.
5 bước tạo Avatar AI bằng Google Flow
Bước 1: Chuẩn bị background và ảnh nhân vật
Trước khi tạo avatar, bạn cần có bối cảnh cho nhân vật đứng trong đó. Với video dạng bình luận hoặc dẫn chương trình, một trường quay ảo là lựa chọn hợp lý.
Bạn tạo ảnh background trường quay trước, sau đó ghép ảnh nhân vật vào đúng bối cảnh đó. Bước này quyết định phần lớn cảm giác chuyên nghiệp của video cuối cùng. Nếu ánh sáng của nhân vật không khớp với ánh sáng của background, người xem sẽ nhận ra ngay dù không nói được vì sao.
Kinh nghiệm của mình là mô tả rõ hướng ánh sáng trong prompt tạo ảnh, ví dụ ánh sáng chính từ bên trái, tông màu ấm, để cả background và nhân vật cùng tuân theo một quy chuẩn.
Bước 2: Tạo nhân vật Avatar AI
Đây là bước quan trọng nhất, gồm ba thành phần cần khai báo:
- Hình ảnh nhân vật: ngoại hình, trang phục, độ tuổi, phong thái
- Mô tả nhân vật: tính cách, phong cách nói chuyện, vai trò trong video
- Giọng nói: giọng thật của bạn được ghi lại và lưu trữ để tái sử dụng
Ở phần giọng nói, Google có một bước xác minh danh tính khá đặc biệt: bạn phải quay video chính mình và đọc to một dãy số hiện trên màn hình. Đây là cơ chế chống deepfake, đảm bảo chỉ bạn mới dùng được avatar của chính mình. Sau khi hoàn tất, hình ảnh và giọng nói được lưu lại và bạn không cần tải lên tài liệu tham chiếu ở những lần sau.
Phần mô tả nhân vật thường bị bỏ qua nhưng lại ảnh hưởng rất nhiều đến kết quả. Nếu bạn chỉ viết chung chung, avatar sẽ nói với ngữ điệu trung tính và thiếu sức sống. Hãy mô tả cụ thể như một MC năng động, nói nhanh, hay nhấn mạnh ở cuối câu, và bạn sẽ thấy khác biệt rõ rệt.
Bước 3: Chuẩn bị nội dung cho avatar
Avatar chỉ nói đúng những gì bạn viết ra, nên chất lượng kịch bản quyết định chất lượng video. Với video dạng bình luận hay dẫn chương trình, bạn nên chia nội dung thành từng đoạn ngắn thay vì viết liền một mạch.
Lý do liên quan trực tiếp tới giới hạn kỹ thuật ở bước tiếp theo, mình sẽ nói rõ ngay bên dưới.
Bước 4: Tạo video bằng Google Flow
Đây là lúc bạn ghép tất cả lại: nhân vật avatar, giọng nói, bối cảnh và nội dung. Nhưng có hai giới hạn bạn phải nắm trước khi làm, nếu không sẽ mất rất nhiều thời gian và tài nguyên:
- Mỗi clip tối đa 10 giây. Đây là giới hạn triển khai của Google nhằm cân đối tài nguyên tính toán, không phải giới hạn của model. Muốn có video dài, bạn phải tạo nhiều clip rồi nối lại.
- Độ phân giải gốc là 720p. Hiện chưa có tùy chọn 1080p hay 4K.
Google Flow hỗ trợ nối cảnh nên bạn có thể tạo chuỗi clip liên tiếp mà nhân vật vẫn giữ được sự nhất quán về ngoại hình và ánh sáng. Nguyên tắc quan trọng: đừng tạo lại từ đầu khi muốn sửa một chi tiết nhỏ. Hãy dùng cơ chế chỉnh sửa bằng hội thoại, mô tả điều bạn muốn thay đổi và giữ nguyên phần còn lại. Cách này vừa tiết kiệm tài nguyên vừa giữ được nền âm thanh đã đạt yêu cầu.
Một lỗi phổ biến khác là chuyển qua lại giữa các model khác nhau trong cùng một dự án. Khi đó phong cách hình ảnh sẽ trôi dần và các clip nối vào nhau trông không đồng bộ.
Bước 5: Kiểm tra và xuất bản
Trước khi xuất bản, bạn nên nghe lại toàn bộ và so sánh giọng avatar với giọng thật của mình. Những đoạn có từ nước ngoài hoặc tên riêng thường là chỗ khẩu hình dễ lệch nhất.
Có một điểm bạn cần biết và nên chủ động công khai với khán giả hoặc khách hàng: mọi video tạo ra đều mang watermark SynthID của Google. Đây là dấu ẩn không nhìn thấy được nhưng có thể xác minh qua ứng dụng Gemini, trình duyệt Chrome và Google Search. Không có tùy chọn tắt watermark này. Nếu bạn làm nội dung cho khách hàng có yêu cầu về minh bạch nội dung AI, hãy trao đổi trước.
Ứng dụng thực tế cho doanh nghiệp
Với 15 năm làm phần mềm và hơn một năm tập trung vào AI Automation, mình đánh giá giá trị thật của công nghệ này nằm ở khả năng sản xuất số lượng lớn với chi phí gần như không đổi. Cụ thể:
- Content Creator: xây kênh mà không cần lộ mặt, giải quyết rào cản tâm lý lớn nhất của nhiều người muốn làm nội dung
- Marketing và Sales: tạo video giới thiệu sản phẩm hàng loạt, mỗi sản phẩm một video mà không phải quay dựng lại
- Thương mại điện tử: sản xuất video mô tả sản phẩm cho danh mục hàng nghìn mã mà chi phí không tăng theo số lượng
- Đào tạo nội bộ: chuyển tài liệu hướng dẫn thành video, cập nhật nội dung mà không cần mời lại người quay
Điều mình muốn nhấn mạnh là công cụ này chưa thay thế được video quay thật ở những nội dung cần cảm xúc mạnh hoặc thời lượng dài. Nó mạnh nhất ở nhóm nội dung ngắn, lặp đi lặp lại, số lượng lớn. Đó chính là chỗ tự động hoá tạo ra giá trị đo lường được.
Đưa Avatar AI vào quy trình doanh nghiệp
Nếu bạn muốn áp dụng vào doanh nghiệp chứ không chỉ làm thử, mình gợi ý đi theo bốn bước quen thuộc trong framework AI hoá doanh nghiệp mà mình vẫn dùng khi tư vấn:
- Tiếp cận: rà lại quy trình sản xuất video hiện tại, xem mỗi tháng tốn bao nhiêu giờ và bao nhiêu chi phí
- Thử nghiệm: làm thử 5 đến 10 video bằng Avatar AI, đo thời gian và so sánh với cách cũ
- Ứng dụng: nếu kết quả tốt, mở rộng cho toàn bộ danh mục nội dung phù hợp
- Nâng cấp: kết nối với các bước khác như tự động sinh kịch bản và tự động đăng bài để tạo thành quy trình khép kín
Đừng bắt đầu bằng việc chuyển toàn bộ sang AI. Hãy chọn một nhóm nội dung nhỏ, đo kết quả thật, rồi mới quyết định mở rộng.
Xem hướng dẫn chi tiết bằng video
Bài viết này tóm tắt quy trình, còn toàn bộ thao tác trên máy tính kèm prompt sử dụng mình đã quay thành video hướng dẫn đầy đủ. Bạn có thể mở video song song với màn hình làm việc để làm theo từng bước.
Kết luận
Tạo Avatar AI bằng Google Flow không khó về mặt thao tác. Phần khó nằm ở chỗ hiểu rõ giới hạn của công cụ để không kỳ vọng sai, và biết đặt nó vào đúng chỗ trong quy trình kinh doanh để tạo ra giá trị đo lường được.
Nếu doanh nghiệp của bạn đang muốn tự động hoá khâu sản xuất nội dung hoặc bất kỳ quy trình lặp đi lặp lại nào, bạn có thể để lại bình luận bên dưới hoặc liên hệ với mình để trao đổi cụ thể hơn.