Trong Bài học 2, bạn đã trình bày 4 loại công cụ video AI. Giờ đây, bạn sẽ làm việc với các tính năng AI cụ thể giúp tiết kiệm thời gian nhiều nhất - những tính năng biến hàng giờ chỉnh sửa thủ công thành vài phút.
Chúng ta đang tập trung vào 4 quy trình công việc mà mọi người chỉnh sửa video đều thực hiện lặp đi lặp lại:
Chỉnh sửa dựa trên transcript (Descript)
Tự động tạo phụ đề (CapCut, Descript)
Phân loại màu AI (DaVinci Resolve, Premiere Pro)
Mở rộng sáng tạo (Premiere Pro)
Chỉnh sửa dựa trên transcript trong Descript
Chỉnh sửa video truyền thống hoạt động như thế này: Xem đoạn phim, tìm những phần hay trên timeline, cắt những phần xấu, sắp xếp lại những gì còn lại. Đó là trực quan - bạn đang làm việc với dạng sóng và thumbnail.
Descript lật ngược hoàn toàn điều này. Nó chép lại video của bạn, sau đó cho phép bạn chỉnh sửa video bằng cách chỉnh sửa văn bản.
Quy trình làm việc:
Nhập video của bạn → Mô tả sẽ tự động chép lại video đó
Đọc transcript → đánh dấu một câu → xóa nó → quá trình cắt video xảy ra
Sắp xếp lại các đoạn trong transcript → sắp xếp lại các video clip trên timeline
Xóa các từ đệm → mỗi ừm, ừ, như, bạn biết sẽ biến mất trong một hành động
Tại sao điều này lại quan trọng: Đối với video có đầu người biết nói - hướng dẫn, phỏng vấn, podcast, thuyết trình - việc chỉnh sửa transcript nhanh hơn 3-5 lần so với chỉnh sửa timeline. Bạn đang đọc và xóa văn bản thay vì lướt qua timeline.
Overdub đưa nó đi xa hơn. Ghi lại từ vựng trong giọng nói của bạn (1.000 từ trong gói miễn phí) và Descript có thể tạo ra âm thanh mới trong giọng nói của bạn từ văn bản đã nhập. Viết sai một số liệu thống kê? Nhập số chính xác và Overdub sẽ thay thế âm thanh mà không cần ghi lại.
Kiểm tra nhanh: Bạn đã ghi lại phần hướng dẫn dài 30 phút nhưng nhận ra ở phút thứ 22 bạn đã nói "$500" trong khi con số chính xác là "$5.000". Trong chỉnh sửa truyền thống, bạn sẽ ghi lại phần đó, khớp mức âm thanh và cắt nó vào. Trong Descript, bạn sẽ làm gì?
Câu trả lời: Tìm văn bản "500" trong transcript, chọn văn bản đó, nhập "5.000" và để Overdub tạo ra âm thanh đã sửa trong giọng nói của bạn. Một phút thay vì 20 phút.
Tự động tạo phụ đề: Tiết kiệm thời gian
Tự động tạo phụ đề là tính năng AI duy nhất có mức độ áp dụng cao nhất trên tất cả các công cụ chỉnh sửa. Và vì lý do chính đáng - phụ đề giúp tăng thời gian xem lên 12% trên nền tảng xã hội và phụ đề thủ công cho một video dài 10 phút sẽ mất 30-45 phút.
CapCut (Miễn phí):
Nhập video → nhấn Auto Captions → chọn ngôn ngữ
Phụ đề xuất hiện trên timeline, được đồng bộ hóa với âm thanh
Chọn kiểu phụ đề (hơn 50 template có hình động)
Xem lại và sửa mọi lỗi phiên âm
Xuất với phụ đề cố định hoặc dưới dạng file SRT
Descript ($24/tháng Pro):
Nhập video → transcript được tạo tự động
Chú thích bắt nguồn từ cùng transcript mà bạn đang chỉnh sửa
Tạo kiểu cho chú thích với các template (đánh dấu từng từ, karaoke, v.v...)
Chỉnh sửa chú thích bằng cách chỉnh sửa văn bản - các thay đổi tự động đồng bộ
Premiere Pro ($22,99/tháng):
Mở trình tự của bạn → Bảng chú thích → Chép lại trình tự
Xem lại transcript, sửa lỗi
Tạo chú thích từ transcript → chọn thời gian/kiểu
Xuất dưới dạng SRT, được nhúng hoặc ghi sẵn
Độ chính xác của cả ba công cụ đều đạt trên 95% để có âm thanh tiếng Anh rõ ràng. Độ chính xác giảm khi có điểm nhấn nặng, loa chồng chéo hoặc tiếng ồn xung quanh - hãy luôn xem xét trước khi xuất bản.
Chỉnh màu bằng AI
Chỉnh màu từng là một kỹ năng chuyên môn đòi hỏi nhiều năm rèn luyện. AI không thay thế hoàn toàn kỹ năng này, nhưng nó đảm nhận các công đoạn mang tính kỹ thuật - như đồng bộ màu giữa các clip, chỉnh độ sáng (exposure) và tạo sự đồng nhất về phong cách - để bạn có thể tập trung vào các quyết định sáng tạo.
DaVinci Resolve - Color Match:
Mở trang Color → chọn clip mẫu
Chọn các clip cần đồng bộ màu
Sử dụng tính năng Color Match → AI sẽ phân tích độ sáng (luminance), sắc độ (chrominance) và độ bão hòa (saturation)
Tinh chỉnh kết quả thủ công nếu cần.
Công cụ Neural Engine của DaVinci (có trong bản Studio, giá 295 USD trả một lần) bổ sung tính năng Magic Mask - cho phép chọn người hoặc vật thể, sau đó AI sẽ tự động bám theo đối tượng đó trong suốt clip để bạn có thể chỉnh màu riêng cho thành phần đó. Ví dụ, tách khuôn mặt ra và làm sáng nó mà không ảnh hưởng đến hậu cảnh.
Premiere Pro - Lumetri Color Match:
Mở bảng Lumetri Color → chọn chế độ "Comparison View"
Chọn khung hình mẫu
Nhấn "Apply Match" → Premiere sẽ tự động điều chỉnh clip hiện tại
Điều chỉnh cường độ bằng thanh trượt.
Quy trình làm việc hiệu quả: Chọn clip có ánh sáng tốt nhất làm mẫu. Áp dụng tính năng khớp màu bằng AI cho tất cả các clip còn lại trong cùng một buổi quay. Sau đó, áp dụng một LUT (bảng tra cứu màu) sáng tạo để tạo ra phong cách màu cuối cùng. Cách xử lý hàng loạt này giúp rút ngắn thời gian chỉnh màu từ 2 giờ xuống còn 15 phút.
Kiểm tra nhanh: Bạn quay một cuộc phỏng vấn ngoài trời. 10 phút đầu quay dưới ánh nắng trực tiếp; 10 phút sau, mây kéo đến và ánh sáng thay đổi đáng kể. Giải pháp hỗ trợ bởi AI là gì?
Trả lời: Hãy chọn một khung hình có độ sáng chuẩn từ đoạn quay lúc trời nắng làm mẫu khớp màu. Áp dụng tính năng AI Color Match cho các clip quay lúc trời nhiều mây - AI sẽ tự động điều chỉnh độ sáng, cân bằng trắng và tông màu sao cho tương đồng. Kết quả có thể không hoàn hảo tuyệt đối (do hướng sáng đã thay đổi), nhưng nó giúp bạn đạt được 80% yêu cầu chỉ trong vài giây, thay vì phải chỉnh màu thủ công cho từng clip quay lúc trời nhiều mây.
Tính năng Generative Extend trong Premiere Pro
Tính năng Generative Extend của Premiere Pro giúp tạo ra các khung hình mới ở phần đầu hoặc phần cuối của clip. AI sẽ phân tích các dữ liệu có sẵn trong cảnh quay - bao gồm chuyển động, ánh sáng, hậu cảnh và âm thanh - để tạo ra nội dung mới phù hợp và đồng nhất.
Giữ nguyên khung hình cuối trong khi âm thanh vẫn đang chạy
Lấp đầy khoảng trống ngắn giữa các lần cắt cảnh
Kéo dài cảnh B-roll để khớp với phần lời bình dài hơn
Hạn chế:
Các cảnh có chuyển động hoặc hành động phức tạp
Kéo dài đoạn hội thoại (công cụ không tạo ra lời thoại mới)
Cảnh quay có camera di chuyển nhanh
Kéo dài quá 3-4 giây
Quy trình thực hiện:
Chọn mép của clip trên timeline
Nhấp chuột phải → Chọn Generative Extend
Chọn số lượng khung hình muốn thêm
Premiere tạo phần mở rộng → Xem trước kết quả
Chấp nhận hoặc tạo lại để có kết quả khác
Hãy coi đây là một giải pháp an toàn cho quá trình sáng tạo. Clip B-roll dài 14 giây của bạn cần khớp với 17 giây lời bình? Hãy kéo dài nó thêm 3 giây thay vì phải tìm clip khác hoặc dùng kỹ thuật jump cut.
Những điểm chính cần lưu ý
Chỉnh sửa dựa trên transcript (Descript) nhanh hơn gấp 3-5 lần so với chỉnh sửa trên timeline đối với nội dung dạng "talking-head" (người nói trực diện) - hãy chỉnh sửa văn bản thay vì dạng sóng âm thanh
Tự động tạo phụ đề (CapCut bản miễn phí, Descript, Premiere) với độ chính xác trên 95% là tính năng AI mang lại hiệu quả cao nhất
Tính năng khớp màu bằng AI (DaVinci Resolve, Premiere Pro) cho phép xử lý hàng loạt các cảnh quay, thay vì phải chỉnh màu thủ công từng clip như trước đây
Generative Extend (Premiere Pro) tạo ra các khung hình phù hợp để kéo dài clip thêm vài giây - một giải pháp an toàn cho sáng tạo
Các tính năng này bổ trợ cho nhau: Một dự án sử dụng cả 4 tính năng trên có thể giảm thời gian biên tập xuống 50% hoặc hơn
Hãy thử ngay: Script ưu tiên chỉnh sửa + Bước kiểm tra chất lượng
Mở ChatGPT, Claude hoặc Gemini và dán nội dung này vào. Hãy dùng nó để lên kế hoạch chỉnh sửa TRƯỚC KHI mở Descript/Premiere - phần lớn thời gian thường bị lãng phí trên timeline do chưa xác định rõ câu chuyện ngay từ đầu.
Hãy đóng vai trò là đạo diễn dựng phim kiêm người kiểm soát chất lượng (QA) của tôi. Tôi đã có tư liệu thô và sản phẩm đầu ra mong muốn. Hãy lên kế hoạch dựng phim, sau đó cung cấp cho tôi một danh sách kiểm tra QA để tôi thực hiện trước khi xuất video.
Thông tin về dự án:
- Sản phẩm đầu ra (nền tảng + định dạng + thời lượng): []
- Tư liệu gốc (quay trực diện/phỏng vấn/quay màn hình/sự kiện/hướng dẫn/quảng cáo): []
- Thời lượng tư liệu thô: []
- Chất lượng âm thanh (mic cài áo/mic máy quay/âm thanh hiện trường/nhiều tạp âm): []
- Có cần phụ đề không? (yêu cầu của nền tảng): []
- Nhân vật trong khung hình (chỉ mình tôi/khách mời phỏng vấn có sự đồng ý/trẻ em/người nơi công cộng/khách hàng): []
- Âm nhạc / Hiệu ứng âm thanh (SFX) (thư viện có bản quyền/miễn phí bản quyền/do khách hàng cung cấp): []
- Công cụ dựng phim dự kiến: []
- Hạn chót (deadline): []
Phần 1 - Kế hoạch cắt dựng (trước khi bắt đầu thao tác trên timeline)
1. Hook - Điểm thu hút (3 giây đầu) — câu nói hoặc hình ảnh nào sẽ níu chân người xem ngay lập tức
2. Promise - Lời hứa/Giá trị (giây thứ 3–10) — người xem sẽ học được gì hoặc cảm nhận ra sao nếu tiếp tục xem
3. Cấu trúc các phần (chương) — chia làm 3–5 phần, mỗi phần truyền tải một ý chính gói gọn trong một câu
4. Một yếu tố có thể loại bỏ — nội dung lan man nào tôi nên cắt bỏ dù rất thích nó
5. Kế hoạch nhịp độ — đoạn nào cần đẩy nhanh tốc độ, đoạn nào cần khoảng lặng để người xem "thở"
6. Nhu cầu về B-roll (cảnh chèn) — các cảnh quay cụ thể cần chèn + vị trí chèn, hoặc đánh dấu vị trí cần thêm B-roll
7. Đồ họa chú thích (callout) — văn bản hoặc mũi tên hiển thị trên màn hình giúp người xem dễ hiểu nội dung hơn; ...
8. Phần kết (Outro) — hành động cụ thể mà tôi muốn người xem thực hiện (chỉ một hành động duy nhất)
Phần 2 - Các thao tác chỉnh sửa bằng AI cho từng công cụ
Đối với phần mềm chỉnh sửa đã chọn, liệt kê các tính năng AI cụ thể cần sử dụng:
- Nếu dùng Descript: cắt ghép dựa trên transcript, tính năng Studio Sound để làm sạch âm thanh, ngưỡng loại bỏ từ thừa (filler-word) (thấp = tự nhiên, cao = nghe như máy/cứng nhắc)
- Nếu dùng Premiere Pro: Enhance Speech (tăng cường chất lượng giọng nói), Generative Extend (mở rộng cảnh bằng AI) để lấp đầy khoảng trống B-roll, Auto Reframe (tự động căn khung) cho các phiên bản video dọc, Text-Based Editing (chỉnh sửa dựa trên văn bản)
- Nếu dùng DaVinci Resolve: AI Relight (điều chỉnh ánh sáng bằng AI) / Magic Mask / Color Match (khớp màu dựa trên cảnh tham chiếu), Voice Isolation (tách giọng nói khỏi tạp âm)
- Nếu dùng CapCut: Smart Captions (phụ đề thông minh), auto-beat-sync (khớp nhịp tự động), xóa phông nền
Đối với mỗi tính năng: 1 câu nêu rõ "sử dụng khi nào" + 1 câu nêu rõ "không nên sử dụng khi nào".
Phần 3 - Kế hoạch xuất file đa định dạng
- Thông số kỹ thuật bản gốc (nền tảng / LUFS / độ phân giải / tốc độ khung hình)
- Các phiên bản phái sinh (video dọc ngắn, bản có phụ đề không tiếng, bản cắt quảng cáo dưới 15 giây) — loại nào lấy từ bản gốc, loại nào cần dựng lại
Phần 4 - Kiểm soát chất lượng (QA) trước khi xuất file (10 hạng mục)
Thực hiện TRƯỚC khi kết xuất:
1. 3 giây đầu (hook) vẫn thu hút ngay cả khi tắt tiếng (đa số người xem mạng xã hội tắt tiếng)
2. Có phụ đề, nội dung chính xác và dễ đọc trên thiết bị di động
3. Âm thanh đã được chuẩn hóa theo mức LUFS mục tiêu của nền tảng
4. Không có khoảng lặng chết > 1,5 giây (trừ các nhịp ngắt có chủ đích)
5. Các đoạn jump cut có lý do hợp lý (không chỉ là cắt bỏ phần thừa gây ra tiếng "bộp" khó chịu)
6. Hình ảnh bổ trợ (B-roll) che phủ mọi đoạn lời bình khi không có hình người nói trên màn hình
7. Tên, chức danh, giá cả, ngày tháng đã được đối chiếu với nguồn (AI thường viết sai các thông tin này)
8. Chữ hiển thị dưới màn hình khớp với lời nhân vật thực sự nói
9. Nhạc nền được giảm âm lượng để không át lời thoại quan trọng
10. Lời kêu gọi hành động (CTA) ở phần kết rõ ràng + khung hình cuối dùng tốt làm thumbnail
Phần 5 - Kiểm tra quyền và công bố thông tin
- Mọi nhân vật trong khung hình đã ký giấy cho phép sử dụng hình ảnh (hoặc chỉ có mình tôi)
- Nhạc và hiệu ứng âm thanh (SFX) có giấy phép sử dụng cho kênh phân phối đó
- Không sử dụng tư liệu/thương hiệu có bản quyền mà không có giấy phép
- Đã gắn nhãn công bố AI theo quy định nền tảng nếu video sử dụng hình ảnh, giọng nói clone hoặc nhân vật tổng hợp do AI tạo ra
- Đối với trẻ em trong khung hình: có sự đồng ý của phụ huynh + không dùng AI chỉnh sửa khuôn mặt/cơ thể
- Đối với dự án khách hàng: sản phẩm bàn giao và thông tin công bố sử dụng AI phải khớp với phạm vi công việc đã ký trong SOW (Bảng mô tả công việc)
QUY TẮC BẮT BUỘC:
- Tuyệt đối không thêm các cảnh do AI tạo ra có thể gây hiểu lầm về sự kiện, địa điểm hoặc con người thực tế
- Tuyệt đối không sử dụng giọng nói/hình ảnh của người đã khuất hoặc người nổi tiếng khi chưa có văn bản ủy quyền
- Tuyệt đối không tự động lồng tiếng giọng người thật sang ngôn ngữ khác nếu không có sự đồng ý bằng văn bản của họ — ngay cả khi công cụ như HeyGen thực hiện rất dễ dàng
- Tuyệt đối không gỡ bỏ nhãn công bố AI của nền tảng "để thử xem tương tác có tốt hơn không" — đó là hành vi vi phạm chính sách
- Đối với báo chí hoặc phim tài liệu: không dùng AI để mở rộng/lấp đầy các khoảnh khắc quan trọng — những khoảnh khắc đó phải là thật
- Đối với quảng cáo và nội dung được tài trợ: lưu giữ thư mục bằng chứng (giấy phép sử dụng hình ảnh, giấy phép nội dung, câu lệnh AI/prompt, các phiên bản) trên 5 năm
- Nếu dự án thuộc lĩnh vực chịu sự quản lý chặt chẽ (y tế, tài chính, pháp lý, chính trị), khuyến nghị sử dụng người thật để đọc lời bình (thay vì giọng AI mô phỏng) và công khai rõ ràng việc sử dụng AI trong sản phẩm bàn giao.
Cách điền thông tin: Thay thế các phần trong ngoặc vuông [] hoặc những nội dung giữ chỗ bằng thông tin cụ thể từ tình huống thực tế của bạn. Đầu vào mơ hồ sẽ cho ra kết quả mơ hồ - hãy đưa ra thông tin cụ thể.
Những gì bạn sẽ nhận được: Một kế hoạch chỉnh sửa chi tiết trước khi lên timeline, các thao tác AI cụ thể cần thực hiện cho từng công cụ, quy trình kiểm tra chất lượng (QA) gồm 10 bước trước khi xuất file, cùng các lưu ý về bản quyền và công bố thông tin - giúp sản phẩm cuối cùng hoàn thiện nhanh hơn VÀ đáp ứng tốt các yêu cầu từ khán giả, nền tảng cũng như quy trình duyệt của khách hàng.
Cách xử lý kết quả: Lưu lại nội dung phản hồi vào ứng dụng ghi chú. Chọn ra một gợi ý mang lại hiệu quả cao nhất và thực hiện ngay trong tuần này - đừng cố gắng làm tất cả mọi thứ cùng lúc.
Nếu kết quả chưa đạt yêu cầu: Nếu các gợi ý có vẻ chung chung, hãy dán nội dung sau để yêu cầu chỉnh sửa: "Hãy đưa ra thông tin cụ thể hơn dựa trên bối cảnh thực tế của tôi. Bỏ qua những lời khuyên chung chung". Nếu AI bỏ sót các chi tiết quan trọng mà bạn đã cung cấp, hãy bổ sung thêm: "Bạn đã bỏ sót [X] trong bối cảnh của tôi - hãy thực hiện lại và coi đó là yêu cầu bắt buộc hàng đầu".
Câu 1:
Video phỏng vấn của khách hàng dài 14 phút 58 giây, nhưng yêu cầu thành phẩm phải chính xác là 15 phút 00 giây. Bạn cần thêm 2 giây nữa. Tính năng AI nào giải quyết được vấn đề này?
GIẢI THÍCH:
Generative Extend phân tích clip hiện có - về chuyển động, ánh sáng, hậu cảnh, âm thanh - và tạo ra các khung hình mới để tiếp nối cảnh quay một cách liền mạch. Tính năng này hoạt động hiệu quả nhất khi kéo dài thêm vài giây cho các cảnh quay tĩnh hoặc chuyển động chậm. Nó không tạo ra lời thoại hay hành động mới, nhưng lại cực kỳ hiệu quả khi cần kéo dài cảnh quay cuối, giữ lại khoảnh khắc biểu cảm hoặc lấp đầy một khoảng trống ngắn. Chỉ riêng tính năng này cũng đủ để thuyết phục nhiều biên tập viên đăng ký sử dụng Premiere Pro.
Câu 2:
Bạn đang chỉnh màu cho 15 đoạn phim từ cùng một buổi quay, nhưng điều kiện ánh sáng lại thay đổi giữa các lần quay. AI có thể giúp gì trong trường hợp này?
GIẢI THÍCH:
Tính năng khớp màu bằng AI sẽ phân tích hồ sơ màu sắc của khung hình mẫu (độ phơi sáng, cân bằng trắng, độ bão hòa, độ sáng) và điều chỉnh từng đoạn phim mục tiêu sao cho tương đồng. Trong DaVinci Resolve, tính năng này có tên là Color Match nằm trong trang Color. Trong Premiere Pro, tính năng này nằm ở mục Lumetri Color > Color Match. Cả hai đều hoạt động hiệu quả nhất khi các đoạn clip có cùng chủ thể - AI cần những điểm tham chiếu hình ảnh để thực hiện việc đồng bộ màu sắc một cách chính xác. Quy trình này giúp rút ngắn thời gian chỉnh màu thủ công từ 2 giờ xuống còn 5 phút thao tác hàng loạt.
Câu 3:
Bạn đã ghi âm một cuộc phỏng vấn dài 20 phút với 47 từ đệm kiểu như "ừm", "ờ" rải rác xuyên suốt. Cách nhanh nhất để loại bỏ chúng là gì?
GIẢI THÍCH:
Descript chuyển đổi video của bạn thành văn bản và nhận diện mọi từ đệm (như "ừm", "ờ", "kiểu như", "bạn biết đấy", "đại loại là"). Chỉ cần một cú nhấp chuột là có thể xóa sạch chúng và lấp đầy các khoảng trống trên timeline. Công việc vốn tốn 30-60 phút chỉnh sửa thủ công nay chỉ mất khoảng 5 giây. Kết quả nghe rất tự nhiên vì Descript vẫn giữ được nhịp điệu tự nhiên xung quanh mỗi điểm cắt. Đây là một trong những tính năng mà một khi đã dùng thử, bạn sẽ không muốn quay lại cách chỉnh sửa thủ công nữa.
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây: