Teaser 30s hoàn chỉnh
ComfyUI + LTX-2.5 + ngôn ngữ điện ảnh + dựng Kdenlive — sản phẩm đầu tiên 9:16.
Lộ trình hằng ngày 90 phút, thiết kế riêng cho DGX Spark (GB10 · 128GB unified): ComfyUI, LTX-2.5, MiniMax H3, Wan 2.2, FLUX.2, Kdenlive. Mỗi ngày một sản phẩm thật, 4 mốc kiểm chứng chất lượng, toàn bộ video tutorial đã kiểm chứng link.
30 ngày90’/ngày04 mốc30+ video kiểm chứng100% local
ComfyUI + LTX-2.5 + ngôn ngữ điện ảnh + dựng Kdenlive — sản phẩm đầu tiên 9:16.
MiniMax H3 R2V giữ nhân vật nhất quán, voice over Audacity, retention editing.
Wan 2.2 + upscale/VFI + color + batch API — 3 lane model trong một cảnh liền mạch.
Series 5 tập, xuất bản đa nền tảng, batch render qua API, kế hoạch 90 ngày. Kết thúc khóa = bắt đầu kênh.
Giáo án cá nhân hóa — soạn ngày 2026-08-26, dựa trên khảo sát trực tiếp máy của bạn. Mục tiêu: từ số 0 → tự sản xuất được series video AI ngắn (60–90s) có nhân vật nhất quán, âm thanh, color, xuất bản đa nền tảng — toàn bộ chạy local trên chính thiết bị này.
| Hạng mục | Giá trị thực tế trên máy của bạn |
|---|---|
| Máy | NVIDIA DGX Spark — GB10 (SM 12.1), ARM64, Ubuntu 24.04 (Cụm 2× Spark sẵn sàng qua QSFP 200 Gb/s) |
| Bộ nhớ hợp nhất | 121.6 GiB unified, bandwidth ~273 GB/s |
| Ổ đĩa trống | ~1.9 TB NVMe |
| ComfyUI | 0.33.0 tại ~/comfy/ComfyUI, venv
Python 3.11, port 8188 |
| Node tùy chỉnh | ComfyUI-KJNodes, ComfyUI-LTXVideo ✅ |
| LTX-2.5 (workhorse) | ✅ Đủ bộ: transformer INT8 ConvRot 21GB + Gemma4 TE 15GB + latent upscaler + video/audio VAE |
| MiniMax H3 (nhân vật + audio) | ✅ Đủ bộ: fl2va + ref2va INT8 pruned (20GB mỗi chiếc) + Qwen3-VL TE + video/audio VAE |
| Wan 2.2 (lane chất lượng) | ❌ Chưa tải — Ngày 15 sẽ tải (script có sẵn URL) |
| FLUX.2 (lane tạo ảnh — keyframe) | ❌ Chưa có model ảnh nào — Phụ lục H có lệnh tải (Dev FP8 + Klein 9B) |
| Dựng phim | Kdenlive ✅, Blender ✅, OBS ✅, Audacity ✅, ffmpeg 6.1 ✅ |
| Workflow mẫu | workflows/official/ có H3 t2v/i2v/r2v + Wan2.2 +
Hunyuan 1.5 (JSON hợp lệ) |
| Script hỗ trợ | scripts/launch_comfy_video.sh,
download_video_models.sh,
preflight_video_node.sh,
scaffold_project_structure.sh,
dual_node_batch_dispatcher.py |
Hệ quả máy học của bạn (ghi nhớ suốt khóa):
Mỗi ngày = 90 phút, chia 4 pha:
| Pha | Thời gian | Việc |
|---|---|---|
| Xem | 20' | Xem video ở tốc độ 1.25–1.5×, dừng lại khi gặp thao tác trên ComfyUI |
| Chép tóm tắt | 10' | Tự viết 3–5 dòng tóm tắt vào Obsidian/vault (đừng chép lại của giáo án — viết bằng ngôn ngữ của bạn) |
| Thực hành | 50' | Làm bài thực hành trên máy — ngày nào cũng ra sản phẩm |
| Log | 10' | Ghi seed, prompt, thời gian render, lỗi gặp phải vào bảng theo dõi |
4 quy tắc:
notes_errors.md
kèm cách sửa.Mục tiêu cuối khóa (Ngày 30): xuất bản Tập 1 của series AI có nhân vật riêng — 60–90s, 9:16 + 16:9, có voice over, nhạc, caption, thumbnail — cùng hệ thống batch tự động để ra các tập sau mỗi tuần.
TUẦN 1 (N1–7) NỀN MÓNG: ComfyUI + LTX-2.5 + ngôn ngữ điện ảnh + Kdenlive
★ Mốc 1 (N7): Teaser 30s 9:16 hoàn toàn local
TUẦN 2 (N8–14) NHÂN VẬT & TIẾNG: MiniMax H3 R2V + voice over + retention editing
★ Mốc 2 (N14): Tập pilot 60s có nhân vật nhất quán
TUẦN 3 (N15–21) CHẤT LƯỢNG & QUY MÔ: Wan 2.2 + upscale/VFI + color + batch API
★ Mốc 3 (N21): Cảnh 3-shot điện ảnh hoàn chỉnh
TUẦN 4 (N22–30) SẢN XUẤT SERIES: kịch bản → batch → dựng → master → xuất bản
★ Mốc 4 (N30): CAPSTONE — Tập 1 lên sóng + pipeline tự động
Hiểu cấu trúc project, khởi động được ComfyUI, render được clip đầu tiên bằng LTX-2.5.
Video:
Tóm tắt nhanh:
~/Documents/Vid/scripts/launch_comfy_video.sh → mở
http://localhost:8188.Thực hành:
bash ~/Documents/Vid/scripts/scaffold_project_structure.sh
(nếu chưa có) — kiểm tra thư mục labs/ có sẵn
day01_sample_project.bash ~/Documents/Vid/scripts/preflight_video_node.sh — đọc
output, hiểu nó check gì (swap, memory).bash ~/Documents/Vid/scripts/launch_comfy_video.sh &
rồi mở browser.models/diffusion_models/ — chỉ
cần chọn đúng file trong node.Giao nộp: 1 file mp4 đầu tiên + ghi chú thời gian cold/warm vào log. ✅ Checklist: [ ] ComfyUI chạy ổn định [ ] Render xong không OOM [ ] Hiểu 5 node chính của workflow LTX.
Không copy template: hiểu từng node, tự dựng workflow T2V từ trắng.
Video:
Tóm tắt nhanh:
Thực hành:
workflows/my_ltx_t2v_v1.json.Giao nộp: workflow JSON tự dựng + 3 render cùng prompt khác seed. ✅ Checklist: [ ] Dựng lại từ trắng không nhìn template [ ] Giải thích được từng dây nối.
Nắm từ vựng shot — thứ bạn sẽ dùng làm prompt và làm shotlist suốt khóa.
Video:
Tóm tắt nhanh:
Thực hành:
python3 ~/Documents/Vid/scripts/generate_framing_test_guides.py
— tạo overlay 9:16, mở file PNG xem vùng an toàn.Giao nộp: bảng 10 shot-call (khung hình → tên shot) + file overlay 9:16 đã tạo. ✅ Checklist: [ ] Gọi đúng ≥8/10 shot [ ] Nhớ 3 vùng an toàn của 9:16 (top/bottom UI).
Viết prompt có cấu trúc — kỹ năng chuyển prompt thành đúng shot trong đầu.
Video:
Tóm tắt nhanh — công thức 6 lớp (thứ tự cố định):
shot on 35mm, shallow depth of field, cinematic color grade)Thực hành:
Giao nộp: file prompts_day04.md (6
prompt) + 6 clip + bảng tự chấm. ✅ Checklist: [ ] ≥4/6
clip khớp ý định prompt [ ] Có 1 clip fail — viết 1 dòng vì sao
fail.
Bật chế độ mạnh nhất của LTX: từ ảnh tĩnh → video, kiểm soát điểm đầu–cuối.
Video:
Tóm tắt nhanh:
Thực hành:
Giao nộp: 3 clip I2V + 1 clip first-last + 1 dòng nhận xét mỗi clip. ✅ Checklist: [ ] Hiểu khi nào dùng T2V, khi nào dùng I2V [ ] Two-stage chạy đúng pipeline.
Cắt ghép các clip AI tuần này thành video có nhịp — mở editor địa phương.
Video:
Tóm tắt nhanh:
S cắt, Space play,
Z/Shift+Z zoom timeline, Del xóa
(ripple), Ctrl+Z thôi.Thực hành:
03_GRAPHICS hoặc
01_FOOTAGE trong lab) → dựng 1 teaser ~30s: chọn 8–10 take
đẹp nhất, cắt nhịp theo cảm giác.Giao nộp: file dự án Kdenlive .kdenlive
+ bản render nháp 30s. ✅ Checklist: [ ] Biết dùng
proxy [ ] ≥8 cut [ ] Xuất được file không lỗi codec.
Tổng hợp tuần 1 thành sản phẩm duy nhất, có tiêu chuẩn chất lượng.
Video: không video mới — hôm nay làm lại từ kiến thức đã có (ngày tổng hợp không học cái mới).
Tóm tắt nhanh — rubric Mốc 1:
Thực hành:
Giao nộp: teaser 30s + postmortem vào vault. ✅ Checklist: [ ] Đủ 5 rubric [ ] Đăng lên 1 kênh riêng tư (unlisted) xem trên điện thoại — kiểm tra crop/caption.
Chạy được H3 T2V + I2V local (model đã tải sẵn 40GB trên máy).
Video:
Tóm tắt nhanh:
workflows/official/video_minimax_h3_t2v.json và
..._i2v.json — kéo vào ComfyUI.minimax_h3_fl2va_pruned_int8_convrot.safetensors) + text
encoder Qwen3-VL + 2 VAE (video fp16, audio fp32) — tất cả đã nằm đúng
thư mục.minimax_h3_turbo_v4_step600_ema.safetensors, 780MB): điểm
ngọt chất lượng/tốc độ (~1.5–2.5 phút @480p trên Spark, 4 bước ~1 phút
chỉ dùng preview).github.com/OpenVDN/vdn-minimax-h3).nvlabs.github.io/Sana/Sol-Engine/Sol-H3-Spark/):
--use-sage-attention mặc định với H3 trên
Spark (sinh noise); flex_attention lỗi trên SM12.1 → chỉ
dùng Triton kernel đã patch; nếu nối 2 Spark phải cấu hình QSFP RoCE MTU
9000 + FastVideo Ray SP=2 (tránh để rơi về TCP fallback 5.5 GB/s).Thực hành:
Giao nộp: 2 clip H3 (T2V + I2V) + log thời gian. ✅ Checklist: [ ] Không OOM với H3 20GB [ ] Audio xuất đúng stereo [ ] Đã chạy 1 clip với Turbo LoRA 4 bước và ghi thời gian.
Khóa nhân vật — năng lực lõi để làm series có cast cố định.
Video:
Tóm tắt nhanh:
Thực hành:
character_dna.md: identity block (chỉ đặc điểm ổn
định: tượng, mắt, tóc, vóc dáng, trang phục, 1–2 phụ kiện bất biến) —
dán nguyên văn vào mọi prompt; mỗi shot chỉ đổi 1 biến.ComfyUI_LC123 (Skin Beauty + Lighting
Control — xem Phụ lục H4).Giao nộp: character sheet + ảnh reference + 3 clip cùng nhân vật. ✅ Checklist: [ ] 3 clip nhận ra cùng 1 người [ ] Trang phục không đổi bất ngờ [ ] Reference pack có 4 ảnh đúng vai trò [ ] Đã dùng keyframe tĩnh cho ≥1 shot [ ] Có 1 frame tốt được chain lại vào pack.
Nâng cao (khi cần bám sát hơn): IC-LoRA Ingredients của LTX-2.5 (1 sheet điều khiển nhiều nhân vật + bối cảnh), extension
ComfyUI-LTX2.5-MSR(5 ảnh độc lập cho 5 chủ thể), hoặc train character LoRA riêng (15–30 ảnh, weight 0.7–0.9) — để sau capstone.
Ngày "kỹ sư": đo dữ liệu thật của máy bạn, thay lý thuyết bằng con số của chính mình.
Video: xem lại 10 phút workflow nào còn vướng (không học mới). Ngày thực hành thuần túy.
Tóm tắt nhanh:
Thực hành:
time (hoặc log ComfyUI) cho: LTX T2V
5s@640×352, LTX two-stage 5s@1280×704, H3 T2V 5s@480p. Mỗi cấu hình chạy
3 lần sau lần warm-up.benchmarks.md), tính
clip-phút/giờ cho từng lane.Giao nộp: bảng benchmark 3×3 + 1 đoạn kết luận 5 dòng. ✅ Checklist: [ ] Số liệu 3 lần chênh <10% [ ] Kết luận nói được: episode 60s 6 hero-shot mất bao lâu.
Có giọng đọc chuyên nghiệp cho video — bằng Audacity đã cài sẵn.
Video:
Tóm tắt nhanh — chuỗi xử lý voice over chuẩn:
Thực hành:
templates/day03_av_script_template_vi.md) — thu 3 take,
chọn take tốt nhất.Giao nộp: file WAV đã xử lý + 1 dòng so sánh trước/sau. ✅ Checklist: [ ] Không còn noise nền nghe được [ ] Peak ≤ −1dB [ ] Đọc không vấp.
Ghép 3 lớp tiếng: dialogue (voice over) + sound effects + music.
Video:
Tóm tắt nhanh:
Thực hành:
/usr/share/sounds hoặc
nguồn free như freesound.org).Giao nộp: teaser 30s bản 3 lớp âm thanh. ✅ Checklist: [ ] Voice nghe rõ mọi câu [ ] Không có clip nhạc cắt giữa chừng (fade đủ) [ ] Xuất file audio không méo rè.
Học ngôn ngữ cắt giữ chân — biến video "xem được" thành video "xem hết".
Video: hôm nay là bài đọc nhanh (ngắn hơn video, hiệu quả hơn cho chủ đề này):
Tóm tắt nhanh — 6 vũ khí chính:
Thực hành:
Giao nộp: teaser bản B + bảng so sánh A/B (số cut, độ dài take trung bình). ✅ Checklist: [ ] Bản B có ≥12 cut/30s [ ] Hook nằm trong 3s đầu [ ] Caption on từ giây 0.
Tổng hợp tuần 2: nhân vật R2V + voice over + retention editing = tập pilot thật.
Video: không học mới — ngày sản xuất.
Tóm tắt nhanh — cấu trúc 60s chuẩn:
Thực hành:
templates/day03_av_script_template_vi.md.Giao nộp: pilot 60s 9:16 + kịch bản + postmortem 5 dòng. ✅ Checklist: [ ] Nhân vật nhất quán 100% shot [ ] Hook 3s có force [ ] Voice rõ, mix 3 lớp đúng.
Tải và chạy được Wan 2.2 14B fp8 trên máy — lane cho shot đẹp nhất.
Video:
Tóm tắt nhanh:
workflows/official/video_wan2_2_14B_t2v.json; tài liệu: https://docs.comfy.org/tutorials/video/wan/wan2_2scripts/download_video_models.sh (đã xác minh
URL 2026-08-20); một số LoRA nằm repo gated — script đã ghi resolve URL
còn sống.Thực hành:
Giao nộp: 2 clip Wan (full steps vs 4-step) + số liệu thời gian. ✅ Checklist: [ ] Models load hết (không node đỏ) [ ] Có quyết định cấu hình mặc định bằng số liệu.
Làm chủ cú máy chuẩn điện ảnh — chuyển từ "đoán mò chuyển động" sang "mô phỏng thế giới thực" với 6 bậc tự do (6-DoF), không lo méo phòng khi lia máy.
Video & Tài liệu:
Tóm tắt nhanh — Bí quyết World Model (học từ Runway GWM Worlds 2):
Wan2.2-Fun-A14B-Control-Camera /
5B): Đưa đường ray máy quay (Pan, Tilt, Zoom,
Dolly, Orbit, Crane) trực tiếp vào ComfyUI qua Camera Control Codes. Bạn
vẽ đường ray máy quay như đạo diễn thực thụ, model giữ nguyên cấu trúc
bối cảnh.Thực hành:
Giao nộp: 2 clip camera control (Dolly + Orbit) + 1 ghi chú so sánh độ ổn định không gian. ✅ Checklist: [ ] Cú máy đi đúng hướng mong muốn [ ] Kiến trúc tường/cửa sổ không bị uốn lượn khi camera di chuyển.
Biến clip 480–720p thành 1080p mượt 60fps — tăng chất lượng cảm nhận giá trị.
Video/Tài liệu:
models/frame_interpolation/ (FILM/RIFE có URL trong
scripts/download_video_models.sh)Tóm tắt nhanh:
Thực hành:
Giao nộp: 1 clip trước/sau hậu kỳ + quyết định pipeline mặc định. ✅ Checklist: [ ] Không thấy artifact mới sau hậu kỳ [ ] 60fps mượt không morph.
Da đẹp, tông thống nhất — bước làm video "trông có tiền".
Video:
Tóm tắt nhanh — thứ tự không được đảo:
.cube) hoặc chọn tông
thủ công. LUT đắp lên footage chưa correct = rác.Thực hành:
Giao nộp: 3 clip đã match + 1 bản có grade + still trước/sau. ✅ Checklist: [ ] Da không xanh/tím [ ] Không clip nào "tự khác" giữa chuỗi [ ] Đã dùng scope, không trust mắt trần.
Ngủ để máy làm việc: hàng loạt shot chạy qua API không chạm tay.
Video/Tài liệu:
Tóm tắt nhanh:
/prompt →
poll /history/{prompt_id} → tải kết quả.MiniMax-H3-Spark-GB10.md): load model resident trong 128GB
RAM, online FP8, pipeline uint8 GPU output preparation + direct planar
H.264 muxing, bắn job qua
curl -X POST /v1/videos/sync.scripts/dual_node_batch_dispatcher.py (dispatcher
round-robin — chạy được trên 1 node),
scripts/launch_comfy_video.sh.prompt_id, seed,
prompt, cấu hình vào CSV — để truy vết và tái lập.Thực hành:
jobs.csv (prompt, seed) → POST từng
job → tải mp4 về 06_EXPORTS/batch/.Giao nộp: script batch + 6 clip tự động + jobs.csv log. ✅ Checklist: [ ] Script chạy hết queue không treo [ ] Mỗi clip truy ngược được seed/prompt.
Trượt ở đâu bù ở đó; xong sớm thì chuẩn hóa — ngày không có bài mới bắt buộc.
Video: tùy chọn — xem lại video nào bạn còn "lơ mơ" trong 3 tuần.
Việc thực hành (chọn theo nhu cầu):
YYYYMMDD_lane_shot_desc_seed.mp4; prompt lưu kèm file
.txt cùng tên.workflows/my/.spark_pair_env.sh), thử
nghiệm recipe FastVideo FastH3 2-Spark Pair
(basic_fasth3.py --num-gpus 2 --execution-backend ray --vsa-kernel triton --no-fa4 --parallel-vae)
để kiểm chứng render clip dài 14.4s (345 frames) hoặc giảm thời gian
768p xuống 292s.Giao nộp: cây thư mục kho asset gọn gàng + danh sách checklist còn thiếu = 0. ✅ Checklist: [ ] Không file "untitled" [ ] 5 workflow production đã lưu [ ] Tất cả mốc trước có sản phẩm.
Tổng hợp cả khóa kỹ thuật: 3 shot đẹp nhất từ 3 lane, hậu kỳ đầy đủ.
Video: không học mới — ngày sản xuất đỉnh của tuần 3.
Tóm tắt nhanh — rubric Mốc 3:
Thực hành:
Giao nộp: cảnh 3-shot 15–20s + rubric tự chấm + phản hồi khách quan. ✅ Checklist: [ ] 3 lane cùng xuất hiện [ ] Color khớp [ ] Audio phục vụ cảnh.
Định hình sản phẩm dài hạn: series AI của bạn có format lặp lại được.
Video:
Tóm tắt nhanh:
templates/episode-brief.md): mục tiêu, hook, CTA, ngân sách
shot.Thực hành:
Giao nộp: 1 trang định vị series + 5 episode brief. ✅ Checklist: [ ] Format có yếu tố lặp rõ [ ] Tập 1 có hook viết ra lời cụ thể.
Dịch kịch bản thành danh sách shot có ngân sách — kế hoạch sản xuất thật.
Video: dùng lại kiến thức Ngày 3 (Shot List Ep.1–2)
— xem lại đoạn nào cần. Tài liệu template:
templates/day03_storyboard_spec.md,
templates/episode-shotlist.csv.
Thực hành:
templates/day03_storyboard_grid.csv): mỗi panel = 1 shot
với cỡ shot + camera + prompt nháp.Giao nộp: shotlist CSV hoàn chỉnh tập 1 (8–12 shot). ✅ Checklist: [ ] Mỗi shot có lane + prompt + seed dự kiến [ ] Tổng thời gian máy ≤ 1 đêm batch.
Chạy toàn bộ shot tập 1 qua pipeline batch — giống ngày sản xuất thật.
Video: không cần. Hôm nay là ngày vận hành hệ thống đã xây (Ngày 19).
Thực hành:
jobs.csv đầy đủ prompt + seed + lane
+ cấu hình render.Giao nộp: ≥80% shot tập 1 render xong + log CSV. ✅ Checklist: [ ] Không job nào mất dấu [ ] Shot hero có ≥3 take để chọn.
Từ raw shot → episode có nhịp: đây là ngày tốn nhiều giờ ngồi nhất — đúng thế.
Video: không học mới. Áp dụng tổng hợp Kdenlive (N6, N12, N13, N18).
Thực hành:
Giao nộp: cut nháp hoàn chỉnh 60–90s của tập 1. ✅ Checklist: [ ] Đúng storyboard 90% [ ] Nhịp không take nào >4s tĩnh [ ] Voice sync picture.
Bản master đạt chuẩn kỹ thuật platform — không bị nén thảm hại.
Video: xem lại phần color Ngày 18 nếu cần; tài liệu chuẩn loudness: https://www.youtube.com/watch?v=qagiYvb_98o (workflow LUFS trong Audacity).
Tóm tắt nhanh — chuẩn xuất:
-c:v libx264 -crf 19 -preset slow -c:a aac -b:a 192k
).Thực hành:
loudnorm (phân
tích rồi áp 1 lần — không áp 2 lần liên tiếp).Giao nộp: 2 file master + bảng thông số xuất. ✅ Checklist: [ ] −14 LUFS ±1 [ ] Không banding ở nền tối [ ] Caption không bị UI che.
Gói bọc sản phẩm: thứ quyết định 80% tỉ lệ nhấp trước cả chất lượng video.
Video:
Tóm tắt nhanh:
Thực hành:
Giao nộp: bộ metadata hoàn chỉnh + thumbnail. ✅ Checklist: [ ] Tiêu đề ≤60 ký tự [ ] Thumbnail đọc được ở 120px [ ] Playlist đã tạo.
Lên sóng tập 1 — ngày quan trọng nhất không phải là render đẹp nhất mà là "giao hàng".
Video: xem lại phần policy/monetization trong https://www.youtube.com/watch?v=Bbjv9-00tv0 + đọc nhanh: https://virvid.ai/blog/monetize-faceless-ai-content-complete-guide-2026
Tóm tắt nhanh:
Thực hành:
upload_sop.md).Giao nộp: link tập 1 (ít nhất private/unlisted) + upload_sop.md. ✅ Checklist: [ ] Không lỗi audio/video sau khi platform xử lý [ ] Caption/caption kiểm tra trên mobile.
Đóng khoảng cách giữa "làm được 1 lần" và "làm được mỗi tuần".
Video: tùy chọn — rà lại bất kỳ video nào trong khóa theo nhu cầu.
Thực hành:
prompts_library.md: phân loại
[nhân vật | b-roll | hero | transition] kèm seed + cấu hình.Giao nộp: postmortem + prompts_library.md + benchmark cuối. ✅ Checklist: [ ] Có 1 SOP sản xuất 1 trang viết xong (từ kịch bản → xuất bản).
Kết thúc = bắt đầu: khóa học xong khi bạn có hệ thống chạy đều được.
Video: không. Hôm nay bạn là giáo viên của chính mình.
Thực hành:
monetization_strategy.md).Giao nộp cuối khóa:
# Khởi động ComfyUI (mặc định port 8188, bind LAN)
bash ~/Documents/Vid/scripts/launch_comfy_video.sh &
# Preflight ổn định (swap, clock, memory)
bash ~/Documents/Vid/scripts/preflight_video_node.sh
# Tải models (Wan 2.2, RIFE, FILM, upscale...)
bash ~/Documents/Vid/scripts/download_video_models.sh
# Chuẩn hóa loudness 1 bước (kiểm tra trước khi áp)
ffmpeg -i master.mp4 -af loudnorm=I=-14:TP=-1.5:LRA=11 -f null -
# áp: ffmpeg -i master.mp4 -af loudnorm=I=-14:TP=-1.5:LRA=11:print_format=summary -c:v copy out.mp4640×360 + 6–8 bước Turbo LoRA v4 + Sol
stack → RealESRGAN 2× ra 720p ≈ ~2m25s
(nhanh gấp 6× so với render 720p native ~14m35s, giữ vững khóa nhân vật
Ref2VA).--vsa-kernel triton --no-fa4 --parallel-vae):17n+5):
587s (~9.8 phút) @ 768×1344 (1 máy sẽ OOM do activation
memory).dual_node_batch_dispatcher.py) render liên tục ngày
đêm.--use-sage-attention với H3 (sinh noise); chỉ dùng Triton
kernel đã patch SM121; trên GB10 chạy FastVideo bắt buộc dùng
--vsa-kernel triton --no-fa4 (không có sm_100a hay
FlashAttention-4).| Nhu cầu | Lane | Vì sao |
|---|---|---|
| Siêu tốc 768p có tiếng (1 máy = 56s, 2 máy = 28s) | Sol-H3 (Official NVLabs 09/2026) | 56.17s E2E latency cho 5s 768p (1344×768) có audio; VAE Adapter tiết kiệm 24s; resident 116.9 GiB chừa 2.8 GiB headroom. |
| B-roll nhanh, nhiều take | LTX-2.5 two-stage (hoặc H3 FastH3 + TAEH3) | LTX: ~62s/clip 5s@1280×704. FastH3 + TAEH3: ~134s cho 5s@480p có tiếng trên 1 máy, ~119s trên 2 máy (TAEH3 decode ~1s, T2VA thuần text). |
| Nhân vật nhất quán / có tiếng (1 máy) | H3 R2V / I2V + Turbo LoRA v4 | 6–8 bước @480p ≈ 1.5–2.5 phút; mẹo 360p + RealESRGAN 2× ra 720p ≈ 2.5 phút (nhanh 6× so với 720p native, khóa mặt ổn định). |
| Chuẩn xuất sắc 1080p có tiếng (2 máy) | Decoupled Two-Pass (H3 544p → LTX 2.5 22B Upscale 2×) | Spark 1 sinh H3 544p + tiếng stereo; Spark 2 upscale LTX 2.5 22B lên 1080p. Pipeline liên tục ~2.5 phút/clip. |
| Denoising siêu tốc (Next-Gen) | Video Delta Net (VDN-H3 / OpenVDN) | Video Delta Attention 8 bước, tăng tốc 75×–90×, nhanh hơn thời gian phát, hỗ trợ Ulysses SP=2 trên cụm 2 máy. |
| Shot đẹp nhất, chuyển động phức tạp | Wan 2.2 (+lightx2v LoRA) | Chất lượng cao nhất, Apache 2.0. |
| Cú máy 6-DoF / Không gian 3D nhất quán | Wan 2.2 Fun Camera Control (hoặc SANA-WM 2.6B) | World Model: khóa hình học 3D, điều khiển chính xác Pan/Tilt/Zoom/Orbit/Dolly; SANA-WM sinh tới 60s 720p từ 1 ảnh. |
| Nối cảnh liền mạch | Wan First-Last Frame | Frame cuối = frame đầu cảnh sau. |
| Keyframe / ảnh nguồn / reference pack | FLUX.2 Dev NVFP4/FP8 (draft: Klein 9B) + LC123 Suite | Prompt adherence + multi-reference; khử da nhựa bằng LC Skin Beauty & chỉnh đèn bằng LC Lighting Control — Phụ lục H. |
| Dài >5s | 1 máy: Chain I2V (frame cuối → input) · 2 máy: FastVideo Ray SP=2 hoặc VDN Ulysses SP=2 render liên tục tới 14.4s (345f @ 768p, 587s). | Kỹ thuật infinite length hoặc Ray sequence parallel qua QSFP 200 Gb/s. |
[SHOT SIZE + ANGLE] of [SUBJECT: chi tiết cố định từ character DNA],
[ACTION: 1 câu hiện tại tiếp diễn], [CAMERA MOVE],
[LIGHTING], [ENVIRONMENT + THỜI GIAN], [STYLE: lens, film look].
Negative: [3–5 từ, ngắn].
| Triệu chứng | Nguyên nhân thường gặp | Xử lý |
|---|---|---|
| OOM khi load model | Model khác đang resident | Restart ComfyUI giữa 2 lane; load 1 lane 1 lúc |
| Chậm bất thường lần đầu | Cold load + page cache | Đo compute từ lần thứ 2 trở đi |
| Codec lỗi khi xuất H3 | Mismatch codec | Chọn codec tường minh trong SaveVideo node; smoke render trước batch |
| ComfyUI treo khi batch dài | Reserve RAM không đủ | Đảm bảo chạy với --reserve-vram 8 (script đã có) |
| Nhân vật đổi diện mạo | Reference ánh sáng khác shot | Chuẩn hóa ảnh reference; prompt ánh sáng cố định |
| Chủ đề | Video |
|---|---|
| ComfyUI cơ bản | RkxonDA9fH0 · kqVlmscvuNc · TQhIYT1ZYGQ · comfy.org/learning |
| LTX-2.5 | 6B9WSxi6j8E · 8_HwLqYRzVw · bTsreljvFQc · docs.comfy.org/tutorials/video/ltx/ltx-2-5 |
| Wan 2.2 | sUMTvhDrjYw · 7hUO6KhUsvQ · S4koFRZg8pE · 0CFt5GnOKAw · docs.comfy.org/tutorials/video/wan/wan2_2 |
| MiniMax H3 | r1PhGv-HDhA · lcmzsy5CdYc · a2IJ-sfI5Sg · Idg1PqBcr5c · d_wEd-fZcdg |
| Prompt | cIySbq74jnI · 2BpCk4d2Cc0 |
| Điện ảnh | AyML8xuKfoc · qQNiqzuXjoM · hUmZldt0DTg · 7LcjkrThtY8 |
| Kdenlive | YnSE9qgGui4 · zYD0b8LpiQA · nwl6RzymZVg · J4JmEFNFYqQ · kp.odysee.tv/@nuxttux |
| Audacity | PI0Stixht3Y · yzJ2VyYkmaA · 9hJR9mVo9D8 · qagiYvb_98o |
| Kênh & tiền | Bbjv9-00tv0 · Sj4r28PR84E · virvid.ai monetization 2026 |
| VFI | github.com/hzwer/ECCV2022-RIFE |
Video là sản phẩm YouTube — nếu 1 link chết vì xóa/đổi, tìm tiêu đề trong bảng trên trên YouTube là ra bản tương đương; giáo án không phụ thuộc 1 kênh duy nhất.
Dùng từ Ngày 21 (Mốc 3) trở đi. Nguyên tắc gốc: mỗi cảnh có 1 Scene Bible, mọi shot sinh ra từ nó.
Trộn reference trong R2V: gọi vai trò theo vị trí ("Picture 1–3 = Lan, Picture 4–5 = Hùng, Picture 6 = căn phòng"). LTX-2.5: dùng IC-LoRA Ingredients (1 sheet: hàng nhân vật + dải bối cảnh full-width) hoặc MSR (5 slot độc lập) để mọi shot cùng sinh từ 1 thế giới.
| Nguyên nhân | Cách trị |
|---|---|
| Camera move quá đà | Chỉ dùng static / slow push-in / handheld nhẹ. Cấm orbit, whip, dolly nhanh |
| Shot quá dài | 4–5s mỗi shot, nối trong edit. 15s liên tục là đủ thời gian mắt bắt lỗi |
| Turbo quá đà | Shot có kiến trúc phức tạp → 6–8 bước; chỉ CU đơn giản mới 4 bước |
| Quá nhiều biến động | 1 shot = 1 hành động. Hai người đi + xe chạy + cửa mở cùng shot = chắc chắn vỡ |
Runway GWM Worlds 2 thành công nhờ tách quy trình làm video thành 3 luồng dữ liệu độc lập. Áp dụng trực tiếp vào kịch bản AV Script để triệt tiêu hiện tượng méo không gian:
00:00 - 00:03: Nhân vật tiến về phía bàn gỗ bên cửa
sổ.00:03 - 00:05: Tiếng sấm chớp ngoài trời, đèn dầu bập
bùng.00:05 - 00:08: Lời thoại phát ra (sync audio).Máy bạn hiện không có model ảnh nào — lane này lấp khoảng trống đó. Chạy được trên bất kỳ máy GB10 nào (Spark hoặc GX10 thứ hai — cùng stack).
| Model | Dùng cho | Tốc độ đo trên GB10 |
|---|---|---|
| FLUX.2 Dev FP8 mixed (~32–40GB) | Ảnh final: keyframe, character sheet, establishing frame | chậm hơn NVFP4 ~3× |
| FLUX.2 Dev NVFP4 (nếu có trên repo) | Final + nhanh — tận dụng tensor core FP4 của GB10 | ~45s @1024²·28 bước (BF16 ~2.3') |
| FLUX.2 Klein 9B | Draft/preview, thử prompt & bố cục | 8 bước ≈ 10s @1024² (fp16 warm); Nunchaku quantize 2.5× |
| FLUX.2 Klein 4B distilled | Draft cực nhanh | ~1–4s |
# 1) Tải stack FLUX.2 Dev chính thức (template ComfyUI dùng đúng 3 file này)
pip install -U "huggingface_hub[cli]"
MSC=~/comfy/ComfyUI/models
huggingface-cli download Comfy-Org/flux2-dev \
split_files/diffusion_models/flux2_dev_fp8mixed.safetensors \
split_files/text_encoders/mistral_3_small_flux2_bf16.safetensors \
split_files/vae/flux2-vae.safetensors \
--local-dir /tmp/flux2
mv /tmp/flux2/split_files/diffusion_models/*.safetensors $MSC/diffusion_models/
mv /tmp/flux2/split_files/text_encoders/*.safetensors $MSC/text_encoders/
mv /tmp/flux2/split_files/vae/*.safetensors $MSC/vae/
# 2) Klein 9B (draft) — tải theo đúng danh sách file tại:
# https://docs.comfy.org/tutorials/flux/flux-2-klein
# 3) Trong ComfyUI: Workflows → Browse Templates → Image → Flux → Flux.2 Dev
# Tài liệu chính thức: https://docs.comfy.org/tutorials/flux/flux-2-devNếu 401/404: mở repo Comfy-Org/flux2-dev trên HF để
lấy đúng đường dẫn (repo chính thức đã xác minh 2026-08-26).
Klein 9B (thử 20–50 bố cục, ~10s/ảnh)
↓ lấy prompt/seed tốt
FLUX.2 Dev NVFP4/FP8 (final, 28 bước, guidance 4)
↓
┌─ Keyframe cho I2V (Ngày 5, 16, 24) ──→ LTX/Wan animate
├─ Character reference pack 4 ảnh (Ngày 9) ──→ H3 R2V
├─ Establishing frame bối cảnh (Phụ lục G1) ──→ mọi shot của cảnh
└─ Multi-reference prompt: "Use the face from image 1,
the outfit from image 2, the pose from image 3,
the lighting from image 4, place in <bối cảnh Scene Bible>"
↓
Hậu kỳ: upscale (Ngày 17) → color match
Chất lượng video AI bị giới hạn bởi chất lượng của ảnh Keyframe (Garbage In = Garbage Out). Để tránh video sinh ra bị biến thành hoạt hình nhựa sáp, ảnh Genesis Keyframe cần được xử lý qua bộ công cụ photorealism:
Cài đặt vào ComfyUI:
cd ~/comfy/ComfyUI/custom_nodes
git clone https://github.com/lonecatone23/ComfyUI_LC123_nodes.git(Bộ node viết thuần bằng Python, PyTorch CUDA và OpenCV, tương thích 100% với Linux ARM64 / GB10 trên DGX Spark mà không cần phụ thuộc binary Windows).
3 Node "vũ khí" cắm sau bước gen FLUX.2:
LC Skin Beauty ✨: Xử lý da trong
không gian màu CIELAB — triệt tiêu hoàn toàn lớp bóng nhựa/sáp thường
thấy của ảnh AI, bảo tồn chân thực kết cấu da và lỗ chân lông.LC Lighting Control : Tái tạo ánh sáng
(Relighting) bằng Normal Map + Depth Map (Depth Anything V2). Xoay nguồn
sáng (Key light, Rim light) và bóng đổ khớp chuẩn xác với
Lighting Contract trong Scene Bible (Phụ lục G1) mà
không cần render lại ảnh.FLUX.2 Klein 9B Refiner Pass : Chạy 1
lượt sampler thứ hai qua Klein 9B (denoise 0.25–0.35, chỉ mất ~4–10s
trên GB10) để tăng độ nét vi mô và khử artifacts trước khi đưa sang
I2V/R2V.LC Photo Style : Ép tông màu giả lập
color science của máy ảnh thực tế (Canon R5, Nikon Z7 II, Apple Log),
giúp toàn bộ các shot có cùng phong cách quang học.Giáo án này là local-first. Nhưng production thương mại (khách hàng, deadline, chất lượng đồng nhất) có lúc local chưa đủ — biết chỗ nào nên thuê là kỹ năng của producer, không phải sự phản bội tinh thần local 🦊.
| Việc | Local đủ tốt | Nên thuê |
|---|---|---|
| B-roll, ambient, phong cảnh | LTX-2.5 / Wan 2.2 ✅ | — |
| Hero shot có người + chuyển động phức tạp | yếu nhất | Seedance 2.5 / Kling / Veo |
| Voice over tiếng Việt | Qwen-TTS/CosyVoice tạm ổn | ElevenLabs v4 (clone + cảm xúc tốt hẳn) |
| Nhạc nền | ACE-Step (Music track) ✅ | ElevenMusic (khi cần master sẵn) |
| Đồ họa, pixel, UI, biểu đồ, chữ | Code vẽ từng frame — Phụ lục L ✅ | — (không cần AE) |
Kiến trúc: coding agent (Claude Code/Hermes) điều phối 5 bước, gọi model qua MCP; người chỉ làm direction + notes duyệt bản dựng.
| Bước | Làm gì | Tool |
|---|---|---|
| 1. RESEARCH | footage/ảnh tư liệu → dossier chữ làm single source of truth (mọi fact trace về nó) | agent + web search, miễn phí |
| 2. VOICE | narrator thiết kế + clone giọng nhân vật từ clip thật | Seed Audio / ElevenLabs v4 |
| 3. AI SHOTS | sinh dư ~20% rồi chọn; AI shot chỉ minh họa, archive thật làm xương sống | Seedance 2.5 (Higgsfield) hoặc lane local |
| 4. GRAPHICS | 100% code (Node.js/Remotion), không After Effects — sửa 1 dòng là ra bản mới | Remotion / HyperFrames |
| 5. EDIT/RENDER | N workers render song song (case thực: 120 shots, 10 workers, ~13 phút) | FFmpeg script |
Review loop bắt buộc: AI dựng xong v1 → người xem như khán giả → notes → v2. 9 nhóm lỗi kinh điển cần soi: flash frames (<2s), màu lệch brand, hình không khớp lời bình, 1 shot hold quá lâu, màn hình trống, footage lặp, thiếu tên người trong câu thoại, sai facts, nội dung minh họa sai vật lý/lịch sử. "AI đưa nó lên mức xem được; notes của người làm nó hay."
Đọc nhanh: cả hệ sinh thái không còn đua model — mọi cuộc cạnh tranh ở tầng điều phối. Chọn repo là chọn kiến trúc orchestration.
| Trại | Đại diện (⭐ 06/10/26) | Dùng khi |
|---|---|---|
| Skills cho coding agent (hợp máy này nhất — cài vào chính Hermes/Claude Code đang chạy) | OpenMontage 64.5k (12 pipelines, 700+ skills, AGPLv3, có đường full-free dùng stock/open archive); video-use 28.2k (browser-use — dựng/cắt bằng agent); video-shotcraft 10.4k (Remotion, 152 shot recipe cards); film-studio-skills (7 skills cài thẳng Hermes, shot cards 22 field) | Muốn pipeline điều khiển bằng chat ngay trong terminal |
| Nền tảng một-chạm | ViMax 12.6k (HKU: Director+Screenwriter+Producer agents, Web UI); NarratoAI 11.3k (video thuyết minh 1-chạm); Jellyfish 6.6k (cross-shot consistency); ArcReel 5.3k (xuất draft CapCut, cost tracking) | Volume cao, format ổn định (commentary, short drama) |
| Canvas đạo diễn | open-ai-canvas, open-storyboard-canvas | Muốn storyboard trực quan nối generation loop |
"Write HTML. Render video. Built for agents." — video là tài liệu HTML: clips/subs/timing/audio nằm trong elements → diffable, remixable, đúng sở trường coding agent. Chính là phiên bản thương mại hóa của "graphics in code" ở Phụ lục I.
| Model | Vai trò trong pipeline |
|---|---|
| Wan 2.7 | hero video mở, chất lượng dẫn đầu phe mở |
| LTX-2.3 | 4K + audio native, Apache 2.0, dọc 1080×1920 |
| HunyuanVideo 1.5 | nhanh (~75s/clip RTX 4090-equivalent lane), B-roll |
| ACE-Step (Music track) | nhạc nền local |
| HyperFrames/Remotion | graphics 0 đồng |
Stack tối đa-local tái hiện I2: dossier bằng agent (miễn phí) → TTS local (Qwen-TTS/CosyVoice) → shots qua ComfyUI (lane hiện có) → graphics HyperFrames → render FFmpeg parallel → checklist 9 notes trước khi xuất bản, công cụ nào cũng bắt buộc.
Hai bài rút được việc làm được trên farm này. Case prompt đo trên Seedance; cấu trúc câu chữ chuyển sang H3 / LTX / Wan, còn lane nào gánh shot nào vẫn theo Phụ lục B.
Nguồn: 卡尔的AI沃茨 — aesthetic tích lũy bằng cách chạy lại case, kho awesome-seedance. Miles Ma — bài thành video, cộng quy tắc tiết kiệm máy trong bình luận của thread đó.
| Mẫu một shot | Sổ tay cả tập | |
|---|---|---|
| Việc | điền prompt một clip | chia shot, chọn lane, khóa người, nối cảnh |
| Ở giáo án | Phụ lục C | mục K3 |
Đừng nhét tập 30–60 giây vào một prompt. Clip local khoảng 5 giây; cụm 2 máy khoảng 14 giây. Prompt viết cho 15–30 giây sẽ mất đoạn cuối.
Đặt lên trên công thức 6 lớp của Ngày 4.
Cách tập: lấy một case đã chạy ra hình đúng, đổi người hoặc đổi hành động, rồi xem kết quả đổi chỗ nào. Nhìn lý thuyết không bằng một lần đổi một biến.
WAV đã duyệt là thước thời gian. Đừng chia thời gian theo số chữ: hai câu cùng mười chữ không mất cùng một khoảng thời gian để đọc. Timecode trong mẫu AV chỉ là phác cho đến khi bước 4 thay bằng số đo.
templates/episode-brief.md):
nói cho ai, vướng ở đâu, dài bao nhiêu, xem xong làm gì.templates/episode-shotlist.csv. Mỗi beat
trả lời một câu: nghe câu này thì mắt phải thấy gì. Ưu tiên ảnh, biểu
đồ, quay màn hình, hoặc khung vẽ bằng code (Phụ lục L)
trước khi sinh clip.HyperFrames, Remotion và video-use đã có ở Phụ lục J. Đồ họa đừng đưa vào H3 — Phụ lục L. Dựng lại một video có sẵn — Phụ lục M. Tập của farm này vẫn đi Kdenlive + ComfyUI + OmniVoice. Vài tập dùng cùng thứ tự beat thì giữ nguyên cột đó. Tập 1 không thiết kế template chương trình mới.
Model chat không sinh video. Nó viết một hàm "giây thứ t thì vẽ gì". Một chương trình chụp 24 hoặc 60 khung mỗi giây, FFmpeg ghép thành mp4. Đó là sách lật.
Nguồn: xilo — Opus vẽ khung, không sinh video. Dùng cho đồ họa, giao diện, pixel, sơ đồ, chữ, sản phẩm dựng từ khối. Người thật và điệu nhảy phức tạp vẫn là H3 / Wan.
| Muốn | Code |
|---|---|
| Pixel, minh họa phẳng, nét | JavaScript + Canvas 2D |
| Quảng cáo phần mềm, UI mượt | HTML / CSS / SVG |
| Scanline TV, hạt phim, nước, hạt sáng | WebGL shader, phủ lên canvas |
| Camera đi trong không gian, logo khối, đám mây hạt | Three.js. Khối cơ bản thì code được. Máy thật thì đưa file 3D, đừng bắt code đẽo một cái điện thoại giống ảnh |
| Chì màu, màu nước, sáp | p5.js + p5.brush |
| Tập đã có chữ, ảnh, cắt | HyperFrames (theo timeline) hoặc Remotion (theo từng frame). Khung có sẵn ở Phụ lục J — đừng viết từ số 0 |
| Công thức, trục, hình biến đổi cho đúng | Manim. Nhìn sẽ mộc |
FFmpeg ghép hình và tiếng. Playwright chụp khung khi vẽ bằng trình duyệt. Tiếng nói vẫn là OmniVoice. Nhạc nền vẫn là ACE-Step khi cần một bài. Sóng tổng hợp bằng numpy chỉ cho tiếng bíp, click, một nốt.
Code vẽ người thật và vũ đạo rất kém. Tách việc: model video sinh người trên nền xanh, code xóa nền theo màu, rồi vẽ nền, chữ và khung. Nền và chữ đổi theo nhịp. Đoạn người không viết lại cho khớp beat.
Muốn ra thứ dùng được thì tách khối, và viết danh sách cấm. Không cấm thì ra mặc định: nền tối, chữ lớn giữa khung, cái gì cũng fade.
Trước khi code, hỏi phần còn thiếu: chủ đề, thời lượng, khung hình, màu, ảnh, nhạc. Thiếu thì dừng, không bịa. Đưa ba hướng khác nhau — style, loại code, từng cảnh, tiếng, thời gian render ước lượng. Mỗi hướng một khung hình, hoặc vài giây nếu thứ cần bán là chuyển động. Khóa một hướng thành brief rồi mới làm từng cảnh. Mỗi cảnh một ảnh tĩnh để tự xem.
Cấm cụ thể khi muốn tránh mặt hàng mẫu: không ease nảy, không nổ hạt, không glow, không gradient trên từng mảnh, không thứ gì trông như template.
Nguồn: 观默 — thần tác và phế phẩm cùng một model. Câu "làm một video 15 giây cho đã" chỉ nói việc cần làm. Phần trống bị điền bằng mặc định: chữ lớn giữa khung, gradient neon, mọi lớp fade cùng lúc. L4 cấm đúng cái mặc định đó.
Chất lượng là một tích: phán đoán thiết kế × ngôn ngữ chuyển động × chất liệu × nhịp và tiếng × render × tự xem. Một thừa số gần 0 thì cả đoạn thành slide. Cao cấp thường đến từ bớt tự do: một hình biến liên tục, ít màu, quá đà rất nhỏ, cấm mọi thứ cùng một động tác.
Đoạn không có lời: lưới nhịp → việc đoạn này phải làm → từng cảnh một việc → chủ, phụ, nền → lực, ánh sáng, tiếng → rồi mới code. 15 giây vẫn có mở, triển, khép. Đoạn có lời thì WAV đã duyệt vẫn là đồng hồ (K3).
Lệch pha. Chủ thể động trước. Lớp phụ trễ vài khung. Camera có thể trễ thêm. Bóng trễ nữa. Không lớp nào dùng chung một hàm thời gian. Nhiều chủ thể trên cùng một nhịp thì là khởi, đáp, cắt, rồi nhận — không phải mỗi đứa một bài. Một thời điểm một sự kiện chính.
Một cử động có nguyên nhân. Dự bị → kéo giãn → va → bẹp → quá đà → hồi → lớp phụ phản ứng. Bẹp và kéo đến từ tốc độ và xung lực, không phải một easing ngẫu nhiên. Vận tốc cuối của trạng thái này là vận tốc đầu của trạng thái sau. Một hình đi xuyên nhiều trạng thái. Quá đà chỉ ở chỗ năng lượng nói được, và nhỏ. Ease nảy trên mọi thứ vẫn cấm (L4).
Ánh sáng. Một hướng chủ xuyên suốt. Vật đứng yên thì vệt sáng, mặt chịu sáng và bóng đổ vẫn được chuyển. Va chạm lan ra môi trường theo lệch pha, không rung cả khung. Glow phủ lên mọi thứ vẫn cấm (L4).
Nhịp và tiếng. Dựng lưới nhịp trước. 120 BPM ở 60 khung/giây là khoảng 30 khung một nhịp. Không phải nhịp nào cũng phải có chuyện. Nhạc nền giữ đoạn và cảm xúc. Tiếng hiệu ứng mọc từ chuyển động: tốc độ ra tiếng vuốt, xung lực ra tiếng va, và nhường chỗ cho thông tin chính. Dự bị hơi sớm, va hơi lệch, mảnh vỡ hơi muộn. Tất cả dính một khung thì giả.
Xem từng khung trước khi nhận đoạn. Một reference nhìn được tiết kiệm hơn một prompt dài. Gallery: awesome-ai-motion.
Xem thêm, không cần cài để học mục này: awesome-claude-5-5-videos (bài gốc ghi tên awesome-opus-5-5-videos, repo đã đổi tên), kho awesome-ai-motion, ClaudeAnimationBase, PDoomVideo. ChatCut, Remotion và HyperFrames không cần cài thêm — đoạn chữ và ảnh vẫn đi Phụ lục J và Kdenlive.
Video gốc là đồng hồ cắt: bố cục, nhịp cắt, phụ đề, khung hình trong khung. Ảnh người chỉ thay danh tính.
Nguồn: 雪踏乌云 — đổi người, giữ nhịp, repo hypit. Bài dùng Hypit làm máy dựng. Farm này dựng bằng Kdenlive. Đừng cài Hypit chỉ để học mục này.
Việc này khác Phụ lục K và L. K viết tập từ một bài. L vẽ đồ họa bằng code. M bắt đầu từ một video có sẵn.
Ảnh một người, sáng đều, một người trong khung, mặt và trang phục rõ. Ảnh không chứa nhún vai, xoè tay, hay nhịp miệng của video gốc. Muốn động tác đó thì viết vào prompt. Không viết thì đừng chờ model tự bắt chước.
Khẩu hình và điệu bộ sẽ không khớp 1:1 trên H3. Kỳ vọng mặt và trang phục. Đừng hứa một bản diễn y nguyên.
Nói rõ khoảng giây. Mặc định 10–20 giây đầu, hoặc một cửa sổ ngắn mình chỉ. Không nói thì cả video dài sẽ bị lên kế hoạch. Mỗi plate xin khoảng 5 giây. Dựng ghép thành đúng cửa sổ đó.
Giữ tiếng gốc thì giữ luôn nhịp cắt của gốc. Đổi lời thì thu hoặc OmniVoice xong, duyệt WAV, rồi mới kê lại cắt và phụ đề. Đổi tiếng sau khi đã cắt là làm lại đồng hồ.
Liệt kê cảnh. Sinh hết khung tĩnh trước: người trong bối cảnh, rồi từng b-roll. Xem mặt, tóc, trang phục, cảnh có lạc không. Khung chưa đạt thì sửa khung. Chưa có video.
B-roll không có người dẫn, không có phụ đề, không có khung hình trong khung. Ba thứ đó thuộc Kdenlive, thêm lúc dựng.
Video chỉ chạy sau khi các khung tĩnh được gật. Plate đã đạt thì dùng lại, không sinh lại. Sản phẩm để lại là project Kdenlive cộng các plate, không chỉ một file mp4.
Giáo án này thay thế/gói lại các tài liệu cũ trong thư mục
(MASTER_30_DAY..., 30_DAY_STUDY_GUIDE...): giữ
làm tài liệu tra cứu sâu, còn giáo án này là lộ trình học hằng ngày.
Chúc 30 ngày hiệu quả — mỗi ngày 1 sản phẩm.