Video2robot là một pipeline mã nguồn mở end-to-end cho phép chuyển đổi video hoặc prompt văn bản thành chuyển động robot humanoid, giải quyết bài toán đắt đỏ và phức tạp trong việc tạo dữ liệu vận động cho robot. Thay vì phải lập trình từng khớp, bạn chỉ cần một video người thực hoặc câu lệnh ngắn, và video2robot xử lý toàn bộ từ sinh video (Veo, Sora) đến trích xuất pose 3D và retargeting sang robot. Dự án phù hợp với nhà nghiên cứu robot, kỹ sư AI và người đam mê robotics muốn thử nghiệm nhanh các chuyển động phức tạp như lộn nhào hay nhảy múa.
Thank you for reading this post, don't forget to subscribe!Những điểm chính
- Pipeline end-to-end: prompt → video → pose 3D (SMPL-X) → chuyển động robot, hỗ trợ nhiều robot humanoid như Unitree G1, H1, Booster T1.
- Tích hợp hai mô hình AI sinh video hàng đầu: Google Veo và Sora, cho phép tạo video từ mô tả văn bản trước khi chuyển đổi.
- Sử dụng hai môi trường Conda riêng biệt cho pose extraction (PromptHMR) và robot retargeting (GMR), đảm bảo tách biệt phụ thuộc.
- Hỗ trợ web UI với tính năng 3D visualization (viser) và video-3D đồng bộ, cho phép kiểm tra trực quan kết quả.
- Giấy phép kép: mã core là MIT nhưng khi sử dụng end-to-end (gồm PromptHMR) bị ràng buộc bởi giấy phép Non-Commercial Scientific Research Only, hạn chế thương mại hóa.
Video2robot là gì và giải quyết vấn đề gì?

Video2robot là kho mã nguồn mở do nhóm AIM-Intelligence phát triển, cung cấp pipeline hoàn chỉnh từ prompt văn bản hoặc video đầu vào đến file chuyển động robot (robot motion). Vấn đề cốt lõi mà nó giải quyết là sự tốn kém và thiếu linh hoạt trong việc tạo dữ liệu chuyển động cho robot humanoid. Thông thường, việc thu thập chuyển động người bằng mocap rất đắt đỏ hoặc phải lập trình tay từng frame. Video2robot cho phép tận dụng các video có sẵn trên mạng hoặc sinh video từ văn bản qua mô hình Veo/Sora, sau đó tự động trích xuất tư thế 3D (SMPL-X) và chuyển đổi sang không gian khớp robot. Pipeline này đặc biệt hữu ích trong nghiên cứu robot học, thử nghiệm nhanh các động tác phức tạp như đi bộ, lộn nhào hay nhảy múa mà không cần phần cứng đắt tiền.
Các tính năng nổi bật của video2robot

Video2robot sở hữu nhiều tính năng thiết kế cho cả người dùng kỹ thuật và người muốn trải nghiệm nhanh. Dưới đây là những điểm đáng chú ý nhất.
Pipeline đa năng hỗ trợ nhiều robot
Pipeline gồm bốn bước chính: sinh video từ prompt (Veo hoặc Sora), trích xuất pose 3D dạng SMPL-X qua PromptHMR, retargeting sang robot qua GMR, và xuất file robot_motion.pkl. Hiện tại hỗ trợ ba robot: Unitree G1 (29 DOF), Unitree H1 (19 DOF), Booster T1 (23 DOF), và có thể mở rộng nhờ GMR. Bạn có thể chọn robot bằng tham số –robot-type trong CLI.
Hỗ trợ cả video sẵn có và sinh video từ prompt
Không chỉ giới hạn ở video do AI sinh, video2robot cho phép bắt đầu từ video bất kỳ có sẵn. Bạn có thể chạy lệnh python scripts/run_pipeline.py --video /path/to/video.mp4 và pipeline tự động bỏ qua bước sinh video. Ngoài ra, nếu muốn sinh video từ mô tả, bạn chỉ cần dùng --action với câu lệnh tự nhiên như ‘Action sequence: The subject walks forward with four steps.‘
Giao diện Web UI và 3D Visualization
Dự án đi kèm web UI chạy bằng Uvicorn, cho phép nhập prompt, tải video lên, chọn mô hình Veo/Sora và xem trực tiếp quá trình chuyển đổi. Điểm nhấn là tính năng 3D visualization sử dụng thư viện viser, hiển thị đồng thời video gốc và chuyển động robot dạng 3D synchronized, giúp dễ dàng so sánh và kiểm tra độ chính xác.
Chế độ resume và chạy từng bước riêng lẻ
Pipeline hỗ trợ resume từ project đã tồn tại (ví dụ --project data/video_001), giúp tiết kiệm thời gian nếu gián đoạn. Bạn cũng có thể chạy từng script riêng: generate_video, extract_pose, convert_to_robot, visualize. Điều này rất hữu ích khi debug hoặc tùy chỉnh một phần pipeline.
Hướng dẫn cài đặt và sử dụng video2robot

Việc cài đặt video2robot đòi hỏi kiến thức cơ bản về Conda và GPU, nhưng quy trình đã được hướng dẫn khá chi tiết. Dưới đây là các bước chính cần thực hiện.
Yêu cầu hệ thống
Bạn cần một máy tính có GPU NVIDIA (khuyến nghị dòng Ampere, Hopper trở lên) và cài sẵn Conda. Dự án yêu cầu hai môi trường Conda riêng biệt: gmr (Python 3.10) và phmr (Python 3.10 hoặc 3.11 tùy GPU).
Các bước cài đặt
- Clone repository với submodules:
git clone --recursive https://github.com/AIM-Intelligence/video2robot.gitvàcd video2robot. - Tạo môi trường GMR:
conda create -n gmr python=3.10 -y, kích hoạt, rồipip install -e .. - Tạo môi trường PromptHMR: Nếu dùng GPU Blackwell (sm_120), chạy
conda create -n phmr python=3.11 -y, kích hoạt,cd third_party/PromptHMR,bash scripts/install_blackwell.sh. Với GPU khác, dùngpython=3.10vàpip install -e .. - Tạo file .env và thiết lập API key:
cp .env.example .env,echo 'GOOGLE_API_KEY=your-api-key' >> .env.
Sử dụng cơ bản
Sau khi cài đặt, bạn có thể chạy full pipeline với prompt: python scripts/run_pipeline.py --action 'Action sequence: The subject walks forward with four steps.' Để dùng Sora thay vì Veo, thêm --provider sora. Các script tự động chuyển đổi môi trường Conda, bạn chỉ cần đảm bảo cả hai môi trường đều đã được cài đặt. Để chạy web UI: uvicorn web.app:app --host 0.0.0.0 --port 8000, sau đó truy cập http://localhost:8000.
Ai nên dùng và ai không nên dùng video2robot?

Video2robot không phải công cụ đại chúng, vì vậy cần xác định rõ đối tượng phù hợp để tránh lãng phí thời gian cài đặt.
Đối tượng nên dùng
- Nhà nghiên cứu về robot học cần tạo nhanh dữ liệu chuyển động cho mô phỏng hoặc thử nghiệm trên robot thật.
- Kỹ sư AI muốn tích hợp sinh video và robot motion trong một pipeline duy nhất.
- Sinh viên, học viên cao học làm luận văn hoặc dự án liên quan đến retargeting chuyển động.
- Người dùng có GPU mạnh và quen thuộc với Conda, Python.
Đối tượng không nên dùng
- Người dùng phổ thông không có kiến thức lập trình hoặc không có GPU tương thích (dòng Ampere trở lên).
- Doanh nghiệp muốn thương mại hóa sản phẩm robot vì giấy phép PromptHMR chỉ cho phép nghiên cứu phi thương mại.
- Ai cần chuyển động cho robot không phải dạng người (manipulator, drone, v.v.) vì GMR tập trung vào humanoid.
Câu hỏi thường gặp
Video2robot có hỗ trợ macOS hoặc Windows không?
Không được đề cập chính thức. Dự án chỉ hướng dẫn cài đặt trên Linux với GPU NVIDIA. Người dùng macOS có thể thử với Metal backend nhưng không được đảm bảo.
Tôi cần GPU loại nào để chạy video2robot?
GPU tối thiểu thuộc dòng Ampere (RTX 30 series) hoặc Hopper. Nếu dùng Blackwell (RTX 50 series), bạn phải dùng script cài đặt riêng cho phmr.
Có thể xuất chuyển động robot sang định dạng khác ngoài .pkl không?
Hiện tại pipeline chỉ xuất file robot_motion.pkl với cấu trúc chứa fps, robot_type, num_frames, root_pos, root_rot, dof_pos. Bạn có thể tự viết script chuyển đổi sang URDF, MJCF hoặc các format khác.
Làm thế nào để thêm robot mới không có trong danh sách?
Phải dựa vào khung GMR (General Motion Retargeting). Bạn cần định nghĩa cấu hình robot mới trong GMR và cập nhật danh sách trong config video2robot. Hướng dẫn chi tiết có trong GMR README.
Dùng video2robot có tốn phí API không?
Có, vì sử dụng Google Veo hoặc Sora qua API. Bạn cần có GOOGLE_API_KEY và sẽ bị tính phí theo mức sử dụng của Google Cloud. Nếu tự cung cấp video, không cần API key.
Kết luận
Video2robot là một pipeline mã nguồn mở đầy triển vọng giúp dân nghiên cứu robot nhanh chóng biến video hoặc ý tưởng thành chuyển động robot thực tế. Tuy nhiên, giấy phép hạn chế thương mại và yêu cầu phần cứng cao khiến nó chưa phù hợp với mọi đối tượng. Nếu bạn có GPU mạnh, đam mê robot và chấp nhận giới hạn nghiên cứu, hãy thử nghiệm ngay trên kho mã nguồn video2robot.

