VideoRAG chat với video cực dài bằng AI là repo GitHub do nhóm HKUDS phát triển, phát hành kèm ứng dụng desktop Vimo để trải nghiệm trên macOS, Windows và Linux. Repo này giải quyết bài toán hiểu ngữ cảnh hàng trăm giờ video, phù hợp cho nhà nghiên cứu AI, lập trình viên và người dùng cần phân tích video chuyên sâu.
Thank you for reading this post, don't forget to subscribe!Những điểm chính
- VideoRAG là framework mã nguồn mở cho phép trò chuyện với video dài tới hàng trăm giờ, chạy được trên một GPU RTX 3090 24GB.
- Vimo là ứng dụng desktop đi kèm, hỗ trợ kéo thả video, đa định dạng MP4, MKV, AVI, dự kiến phát hành beta cho macOS Apple Silicon trước.
- Thuật toán VideoRAG dùng đồ thị tri thức đa phương thức và truy xuất thích ứng để kết hợp hình ảnh, âm thanh, lời nói và ngữ cảnh.
- Bộ benchmark LongerVideos gồm 164 video, 602 câu hỏi và hơn 134 giờ nội dung để đánh giá khả năng hiểu video dài.
- Dự án phù hợp với researchers, developers và người dùng chuyên sâu; nếu cần bản app đóng gói sẵn, bạn nên chờ bản beta Vimo.
VideoRAG là gì và giải quyết vấn đề gì?

VideoRAG là khung lập trình retrieval-augmented generation được thiết kế riêng cho video dài, giúp máy tính trả lời câu hỏi về nội dung hình ảnh, âm thanh và lời nói trong video. Vấn đề nó giải quyết là giới hạn ngữ cảnh của mô hình hiện tại: thay vì cắt video thành đoạn ngắn, VideoRAG duy trì hiểu biết xuyên suốt hàng trăm giờ.
Dự án do nhóm VideoRAG@HKUDS phát hành, tích hợp sẵn ứng dụng Vimo để người dùng kéo thả video và đặt câu hỏi. Bạn có thể xem toàn bộ mã nguồn và tài liệu tại repository VideoRAG trên GitHub.
Vimo có những tính năng nổi bật nào?

Vimo là ứng dụng desktop do nhóm VideoRAG xây dựng, cho phép bạn trò chuyện với video qua giao diện trực quan. Nhờ sử dụng VideoRAG, Vimo xử lý video từ clip ngắn tới nội dung dài hàng trăm giờ, kết hợp thông tin hình ảnh, âm thanh và ngữ cảnh để đưa ra câu trả lời có độ chính xác cao.
Các tính năng chính được nhóm giới thiệu gồm:
- Kéo thả video trực tiếp vào ứng dụng và đặt câu hỏi bằng ngôn ngữ tự nhiên.
- Hỗ trợ nhiều định dạng phổ biến như MP4, MKV, AVI.
- Chạy trên macOS, Windows và Linux; bản beta hiện chuẩn bị phát hành cho macOS Apple Silicon trước.
- Phân tích nhiều video cùng lúc, dùng truy xuất nâng cao để tìm phân cảnh chính xác.
- Xuất kết quả, gợi ý và tài liệu tham khảo để dùng sau.
VideoRAG hoạt động theo thuật toán nào?

VideoRAG không đơn thuần nạp toàn bộ video vào mô hình ngôn ngữ, mà xây dựng một hệ thống hai kênh gồm đồ thị tri thức đa phương thức, mã hóa ngữ cảnh phân cấp và cơ chế truy xuất thích ứng. Cách tiếp cận này giúp bảo toàn trật tự không gian – thời gian của các sự kiện trong video trong khi vẫn giữ chi phí tính toán ở mức khả thi.
Theo README, bốn thành phần chính của thuật toán là:
- Graph-Driven Knowledge Indexing: xây dựng đồ thị tri thức đa phương thức để lập chỉ mục video có cấu trúc.
- Hierarchical Context Encoding: mã hóa ngữ cảnh theo tầng bậc, giữ lại các mẫu hình không gian – thời gian trong chuỗi dài.
- Adaptive Retrieval: cơ chế truy xuất động, tối ưu riêng cho nội dung video.
- Cross-Video Understanding: mô hình hóa quan hệ ngữ nghĩa giữa nhiều video với nhau.
Nhờ kiến trúc này, VideoRAG có thể xử lý hàng trăm giờ video trên một GPU RTX 3090 24GB, đồng thời căn chỉnh câu hỏi dạng văn bản với nội dung hình ảnh và âm thanh.
VideoRAG hiệu quả đến đâu trên benchmark?

Nhóm tác giả xây dựng benchmark LongerVideos gồm 164 video, 602 câu hỏi và hơn 134,6 giờ nội dung để đo khả năng hiểu video dài. Kết quả cho thấy VideoRAG đạt điểm 60,2% trên nhánh long video của Video-MME, cao hơn mức 52,2% và 56,3% của các mô hình nền khi không và có phụ đề.
Chi tiết tập dữ liệu LongerVideos:
- Bài giảng: 12 bộ sưu tập, 135 video, 376 câu hỏi, khoảng 64,3 giờ.
- Phim tài liệu: 5 bộ sưu tập, 12 video, 114 câu hỏi, khoảng 28,5 giờ.
- Giải trí: 5 bộ sưu tập, 17 video, 112 câu hỏi, khoảng 41,9 giờ.
- Tổng: 22 bộ sưu tập, 164 video, 602 câu hỏi, khoảng 134,6 giờ.
Bạn nên nhớ điểm số có thể dao động nhẹ giữa các lần chạy do bản chất sinh ngẫu nhiên của mô hình ngôn ngữ.
Làm thế nào để cài đặt và sử dụng VideoRAG cùng Vimo?

Hiện Vimo chưa phát hành bản cài đặt chính thức; bản beta đầu tiên dành cho macOS Apple Silicon đang được chuẩn bị, còn Windows và Linux sẽ ra sau. Nếu muốn dùng ngay, bạn cần tự chạy từ mã nguồn bằng cách cài backend Python, khởi động server VideoRAG rồi mở frontend Electron.
Các bước cơ bản:
- Truy cập thư mục
Vimo-desktoptrong repo gốc để đọc hướng dẫn cài đặt chi tiết. - Tạo môi trường Python theo tài liệu trong thư mục
VideoRAG-algorithm, sau đó cài đặt dependencies. - Khởi động backend VideoRAG trên máy; nếu cần tải model checkpoint, làm theo hướng dẫn trong repo.
- Chạy frontend Electron, kết nối tới server và bắt đầu kéo thả video vào cửa sổ Vimo.
- Đặt câu hỏi bằng ngôn ngữ tự nhiên, xem kết quả và xuất thông tin nếu cần.
Với nhà nghiên cứu, README khuyến nghị dùng phần VideoRAG-algorithm/reproduce để tái lập thí nghiệm và so sánh với benchmark LongerVideos.
Ai nên dùng VideoRAG và Vimo — ai không nên?

VideoRAG phù hợp với nhà nghiên cứu AI đang tìm giải pháp mở cho video dài, lập trình viên muốn xây dựng sản phẩm hỏi đáp video, và người dùng chuyên nghiệp cần phân tích bài giảng, phim tài liệu hoặc nội dung giải trí. Ngược lại, nếu bạn cần một app đóng gói sẵn để dùng ngay, hãy chờ bản beta Vimo.
Nhóm phù hợp nhất:
- Researchers: dùng framework VideoRAG, benchmark LongerVideos và script tái lập để đánh giá thuật toán.
- Developers: tích hợp API truy xuất video hoặc đóng góp cải tiến cho Vimo.
- Video editors, giảng viên, nhà làm phim: tìm kiếm phân cảnh, tóm tắt nội dung, đối chiếu nhiều video.
Nhóm nên cân nhắc:
- Người dùng cuối muốn cài đặt một cú click: chưa có bản release chính thức, nên theo dõi repo để biết khi beta phát hành.
- Người chỉ cần tóm tắt video ngắn vài phút: có thể dùng công cụ khác nhẹ hơn, vì VideoRAG tập trung vào ngữ cảnh dài.
- Hệ thống không có GPU mạnh: dù RTX 3090 đủ dùng, việc xử lý hàng trăm giờ vẫn cần tài nguyên tính toán đáng kể.
Câu hỏi thường gặp
VideoRAG khác gì so với RAG văn bản thông thường?
RAG thông thường truy xuất đoạn văn bản từ tài liệu, còn VideoRAG mở rộng sang video bằng đồ thị tri thức đa phương thức và mã hóa ngữ cảnh phân cấp. Nó hiểu đồng thời hình ảnh, âm thanh, lời nói và quan hệ giữa các cảnh, nhờ đó trả lời câu hỏi dựa trên toàn bộ video dài thay vì một đoạn cắt rời.
Vimo có hỗ trợ Windows và Linux không?
Có, README ghi rõ Vimo là ứng dụng đa nền tảng dành cho macOS, Windows và Linux. Bản beta đầu tiên đang được chuẩn bị cho macOS Apple Silicon, còn các nền tảng khác sẽ phát hành sau, do đó người dùng Windows và Linux cần theo dõi cập nhật từ repo.
Tôi cần loại GPU nào để chạy VideoRAG?
Theo thông tin công bố, VideoRAG có thể xử lý hàng trăm giờ video trên một GPU RTX 3090 24GB. Nếu video ngắn hơn và bạn giảm kích thước ngữ cảnh, cấu hình thấp hơn có thể dùng được, nhưng hiệu suất và tốc độ sẽ phụ thuộc vào độ dài video.
VideoRAG có hỗ trợ phân tích nhiều video cùng lúc không?
Có, Vimo hỗ trợ Multi-Video Analysis để so sánh và phân tích nhiều video cùng lúc. Về phía thuật toán, VideoRAG có thành phần Cross-Video Understanding giúp mô hình hóa quan hệ ngữ nghĩa giữa các video, không chỉ xử lý từng video độc lập.
Làm sao để tôi đóng góp cho dự án VideoRAG?
Bạn có thể báo lỗi, đề xuất tính năng, cải thiện thuật toán, viết tài liệu hoặc thiết kế UI/UX cho Vimo bằng cách tạo issue và pull request trên repo GitHub chính thức. Đội ngũ phát triển hoan nghênh mọi đóng góp từ cộng đồng.
Kết luận
VideoRAG là một trong những hướng tiếp cận đáng chú ý cho bài toán hiểu video cực dài, kết hợp retrieval-augmented generation với đồ thị tri thức đa phương thức và benchmark mở. Nếu bạn làm nghiên cứu hoặc đang cần nền tảng để trò chuyện với video, hãy bắt đầu từ repo gốc và dùng thử phiên bản chạy từ mã nguồn.
Bạn có thể truy cập kho mã nguồn VideoRAG để đọc README, xem demo và thử ngay phiên bản mã nguồn.

