StoryMem video storytelling: Tạo video dài nhiều cảnh với AI

ByNgọc Trai MKT29/07/2026in GitHub Tools 0
story-mem

StoryMem là một repository GitHub cung cấp giải pháp tạo video dài nhiều cảnh dựa trên kịch bản văn bản, sử dụng mô hình diffusion có bộ nhớ để duy trì tính nhất quán của nhân vật. Repo này dành cho các nhà nghiên cứu AI, nhà làm phim và lập trình viên muốn tạo video kể chuyện tự động với chất lượng điện ảnh. Xem thêm tại StoryMem trên GitHub.

Thank you for reading this post, don't forget to subscribe!

Những điểm chính

  • StoryMem tạo video dài nhiều cảnh từ kịch bản văn bản với nhân vật nhất quán nhờ cơ chế bộ nhớ.
  • Dựa trên mô hình Wan2.2, sử dụng LoRA tinh chỉnh (M2V) để kết nối các shot.
  • Đi kèm bộ dữ liệu ST-Bench gồm 30 kịch bản và 300 prompt để đánh giá.
  • Hỗ trợ nhiều chế độ: T2V cho shot đầu, M2V cho các shot sau, MI2V/MM2V để kết nối mượt.
  • Mã nguồn mở, dễ cài đặt với Conda và Hugging Face.

StoryMem là gì và giải quyết vấn đề gì?

StoryMem là gì và giải quyết vấn đề gì?
StoryMem là gì và giải quyết vấn đề gì?

StoryMem là công cụ mã nguồn mở giúp tạo video dài (khoảng một phút) gồm nhiều cảnh quay từ một kịch bản có sẵn. Vấn đề chính mà StoryMem giải quyết là sự thiếu nhất quán giữa các cảnh trong video sinh tự động: nhân vật thay đổi diện mạo, bối cảnh lộn xộn. Repo này dùng bộ nhớ để lưu trữ keyframe từ các shot trước, điều kiện hóa quá trình sinh shot tiếp theo, giúp nhân vật và bối cảnh đồng nhất. Bạn có thể xem thêm tại repository gốc.

Những tính năng nổi bật của StoryMem

Những tính năng nổi bật của StoryMem
Những tính năng nổi bật của StoryMem

StoryMem sở hữu một số tính năng chính: sinh video dài nhiều cảnh với bộ nhớ, tích hợp nhiều chế độ M2V/MI2V/MM2V, đi kèm bộ dữ liệu ST-Bench, và dựa trên nền tảng Wan2.2 mạnh mẽ. Dưới đây là chi tiết từng điểm.

  • Sinh video dài nhiều cảnh: Từ 8 đến 12 shot, mỗi shot dài 5 giây, tạo video khoảng 1 phút.
  • Cơ chế bộ nhớ: Lưu tối đa 10 keyframe từ các shot trước để duy trì nhất quán nhân vật và bối cảnh.
  • Nhiều chế độ sinh: M2V (memory-to-video) mặc định; MI2V thêm khung hình đầu tiên; MM2V thêm 5 khung chuyển động đầu để kết nối liền mạch khi không có cắt cảnh.
  • ST-Bench: Bộ đánh giá chuẩn gồm 30 kịch bản đa dạng, mỗi kịch bản 8-12 shot, giúp so sánh kết quả.
  • Dựa trên Wan2.2: Sử dụng mô hình text-to-video và image-to-video tiên tiến, có sẵn trên Hugging Face.

Hướng dẫn cài đặt và sử dụng StoryMem

Hướng dẫn cài đặt và sử dụng StoryMem
Hướng dẫn cài đặt và sử dụng StoryMem

Để cài đặt StoryMem, bạn cần clone repo, tạo môi trường Conda với Python 3.11, cài đặt các gói phụ thuộc và tải mô hình từ Hugging Face. Sau đó chạy script chính với kịch bản JSON. Các bước chi tiết như sau:

  1. Clone repo: git clone --single-branch --branch main [email protected]:Kevin-thu/StoryMem.git
  2. Tạo môi trường: conda create -n storymem python=3.11 && conda activate storymem
  3. Cài thư viện: pip install -r requirements.txt && pip install flash_attn
  4. Tải mô hình Wan2.2 T2V-A14B, I2V-A14B và StoryMem M2V LoRA từ Hugging Face bằng huggingface-cli download. Chi tiết xem README.
  5. Chạy script: python run.py --story_script_path duong-dan-script.json --output_dir ./results. Bạn có thể thêm tham số như --size 832*480, --max_memory_size 10, --mi2v hoặc --mm2v tùy nhu cầu.

Ai nên dùng – ai không nên dùng StoryMem?

Ai nên dùng – ai không nên dùng StoryMem?
Ai nên dùng – ai không nên dùng StoryMem?

StoryMem phù hợp nhất với nhà nghiên cứu AI, lập trình viên thử nghiệm sinh video kể chuyện, người làm phim độc lập muốn tạo storyboard tự động. Tuy nhiên, nó không dành cho người không có kinh nghiệm lập trình (cần dòng lệnh) hoặc muốn sản xuất video thương mại ngay (chất lượng còn phụ thuộc mô hình nền). Hạn chế bao gồm yêu cầu GPU mạnh, thời gian sinh lâu, và kết quả chưa hoàn hảo ở chuyển động phức tạp.

Đối tượng phù hợp

Nhà nghiên cứu AI muốn thử nghiệm sinh video dài, lập trình viên muốn tích hợp pipeline kể chuyện tự động, người làm phim muốn tạo prototype nhanh.

Hạn chế cần lưu ý

Cần GPU tối thiểu 24GB VRAM (dựa trên yêu cầu của Wan2.2), thời gian sinh mỗi shot có thể vài phút, và chất lượng phụ thuộc nhiều vào mô hình nền.

Câu hỏi thường gặp

Làm thế nào để tạo kịch bản cho StoryMem?

Bạn có thể tự tạo file JSON theo mẫu có sẵn trong thư mục story/ hoặc dùng GPT-5 với system prompt được cung cấp trong README để sinh kịch bản gồm story_overview, scene_num, cut flag và video_prompts.

Tôi có cần GPU mạnh không?

Có, StoryMem dựa trên Wan2.2 yêu cầu GPU có ít nhất 24GB VRAM để chạy mô hình 14B tham số. GPU dòng RTX 3090/4090 hoặc A100 được khuyến nghị.

StoryMem có hỗ trợ tiếng Việt không?

Không trực tiếp. Kịch bản và prompt phải bằng tiếng Anh. Tuy nhiên, bạn có thể dịch kịch bản sang tiếng Anh trước khi chạy.

Dữ liệu ST-Bench có dùng lại được không?

Có, ST-Bench hoàn toàn có sẵn trong thư mục story/ và bạn có thể sử dụng để đánh giá hoặc so sánh các mô hình khác. Nó gồm 30 kịch bản đa dạng.

Làm sao để cải thiện độ nhất quán của nhân vật?

Bạn nên cung cấp mô tả nhân vật chi tiết và nhất quán trong mỗi video_prompt. Sử dụng chế độ MI2V hoặc MM2V để kết nối các shot mượt hơn, và tăng max_memory_size lên tối đa 10.

Kết luận

StoryMem là một dự án mã nguồn mở đầy hứa hẹn cho lĩnh vực sinh video kể chuyện dài với cơ chế bộ nhớ giúp duy trì sự nhất quán. Nếu bạn đang tìm kiếm một công cụ để thử nghiệm hoặc nghiên cứu sinh video đa cảnh, hãy truy cập StoryMem trên GitHub, sao chép repo và trải nghiệm ngay. Đừng quên để lại star nếu thấy hữu ích.

Related Posts