Bạn muốn mang theo một trợ lý AI mạnh mẽ, không cần mạng, không cần cài đặt, và quan trọng là không bị kiểm duyệt? USB AI không kiểm duyệt từ dự án USB-Uncensored-LLM biến chiếc USB hay ổ SSD rẻ tiền thành một môi trường AI cục bộ hoàn chỉnh, chạy được trên Windows, macOS, Linux lẫn Android. Đây là giải pháp air-gapped đúng nghĩa cho lập trình viên, nhà nghiên cứu, hay bất kỳ ai cần một LLM riêng tư tuyệt đối mà không phụ thuộc vào đám mây.
Thank you for reading this post, don't forget to subscribe!Những điểm chính
- Zero-install, cắm là chạy: Không cần quyền admin, không cần cài đặt Python hay package manager. Mọi thứ đều portable, kể cả engine Ollama được biên dịch riêng.
- Đa nền tảng thực sự: Tải mô hình một lần vào thư mục Shared, dùng chung cho cả Windows, macOS, Linux và Android mà không tốn dung lượng trùng lặp.
- Mô hình không kiểm duyệt: Sử dụng các bản fine-tune ablative và heretic, xóa bỏ hoàn toàn cơ chế từ chối hay moralizing của mô hình gốc.
- Air-gapped & riêng tư: Hoạt động hoàn toàn ngoại tuyến, không gửi dữ liệu ra ngoài, lịch sử chat lưu ngay trên USB.
- Truy cập qua mạng LAN: Có thể dùng điện thoại, máy tính bảng trong cùng WiFi để truy cập giao diện chat mà không cần cấu hình CORS phức tạp.
USB-Uncensored-LLM là gì và giải quyết vấn đề gì?

Nói một câu cho vuông: đây là bộ công cụ đóng gói sẵn mọi thứ bạn cần để chạy LLM cục bộ từ ổ USB hoặc ổ cứng gắn ngoài. Nó giải quyết cơn đau đầu muôn thuở của dân kỹ thuật – muốn xài AI riêng tư nhưng ngại cài đặt lằng nhằng, sợ bị theo dõi, và cần mang đi khắp nơi. Bạn cắm USB vào máy nào là có ngay trợ lý AI y hệt, không để lại dấu vết trên máy chủ. Điều này đặc biệt có giá trị nếu bạn thường xuyên di chuyển giữa các máy tính ở công ty, quán net, hay thậm chí là máy của khách hàng mà vẫn muốn giữ môi trường làm việc AI nhất quán.
Điều gì làm nên sức hút của USB-Uncensored-LLM?

Nhiều công cụ AI portable trên GitHub chỉ là wrapper nửa vời, đòi hỏi Python global hoặc Docker. USB-Uncensored-LLM thực sự khác biệt ở chỗ nó ship cả portable Python và engine Ollama biên dịch riêng cho từng OS – không đụng gì đến hệ thống của bạn hết. Nhưng điểm sáng nhất phải kể tới hệ thống Shared Volume: bạn tải mô hình 5GB+ một lần duy nhất vào thư mục Shared/models, rồi cả Windows, macOS, Linux lẫn Android cùng xài chung, không cần copy đi copy lại. Tiết kiệm dung lượng USB đáng kể, nhất là khi bạn chơi mấy con model 9B-12B.
Zero Dependency – không cài đặt, không vướng víu
Engine được đóng gói kèm portable Python và các binary riêng biệt (ollama-windows.exe, ollama-darwin…). Bạn không cần cài Python hệ thống, không cần pip install, không cần registry edit. Cắm USB vào, chạy script install một lần duy nhất cho OS đó – nó chỉ download engine tầm 50MB về Shared/bin.
Mô hình thực sự không kiểm duyệt
Không giống như các bản LLM thương mại, project này tích hợp sẵn các model đã được «ablated» (xóa bỏ vector an toàn) hoặc fine-tune theo hướng «heretic» để phản hồi mọi truy vấn, không từ chối, không giảng đạo đức. Gemma 2 2B Abliterated là lựa chọn mặc định cho tốc độ, còn Gemma 4 E4B Ultra Uncensored Heretic thì chiều mọi yêu cầu bất kể nội dung. Bạn có thể thấy rõ sự khác biệt khi hỏi những câu mà ChatGPT hay Claude nhất quyết không trả lời.
Tăng tốc phần cứng thông minh
Engine tự động nhận diện và tận dụng AVX, CUDA hoặc Apple Metal tùy vào máy bạn đang cắm USB. Khi cắm vào PC có GPU NVIDIA, nó dùng CUDA; khi chuyển sang MacBook, nó tự chuyển qua Metal – không cần chỉnh tay. Tốc độ sinh token trên GPU có thể gấp 5-10 lần so với chạy thuần CPU.
Giao diện chat qua mạng LAN
Một HTTP server nhỏ gọn phục vụ giao diện dark mode ngay trên trình duyệt. Điều thú vị là bạn có thể nằm dài trên sofa, cầm điện thoại hoặc tablet, truy cập IP:3333 từ máy chạy USB và chat thoải mái – không cần cấu hình CORS rắc rối. Cảm giác như có server AI mini trong nhà vậy.
Hướng dẫn cài đặt và sử dụng chi tiết

Để bắt đầu, bạn cần một USB 3.0 trở lên (hoặc SSD gắn ngoài) với ít nhất 8GB trống, khuyến nghị 16GB để chứa model nặng. Máy tính nên có tối thiểu 8GB RAM cho model 2B-4B, và 16GB RAM cho model 9B-12B.
Bước 1: Tải project
Clone hoặc download repository từ trang GitHub chính thức vào USB hoặc thư mục trên máy. Nếu bạn muốn cài trực tiếp lên ổ cứng để có tốc độ nhanh hơn, có thể clone về ổ C: hoặc D: – project hoạt động tốt cả khi không dùng USB.
Bước 2: Khởi tạo engine (chạy lần đầu cho mỗi OS)
Mở thư mục tương ứng với hệ điều hành và chạy script install:
- Windows: Nhấp đúp
Windows/install.bat - macOS: Mở Terminal, kéo thả
Mac/install.commandvào và Enter - Linux: Chạy
bash Linux/install.sh - Android (Termux): Chạy
bash Android/install.sh
Script này chỉ tải engine nền tầm 50MB vào Shared/bin. Nếu gặp lỗi script tự đóng trên Windows, có thể do Windows App Execution Aliases – hãy chạy bằng cmd hoặc chuột phải chọn Run as Administrator.
Bước 3: Tải mô hình AI
Cách dễ nhất là dùng Windows: Windows/install.bat có menu tương tác để chọn model từ danh sách curated sẵn. Bạn chỉ việc chọn số tương ứng – Gemma 2 2B cho nhẹ nhanh, Qwen 3.5 9B cho suy luận sâu. Nếu không có Windows, bạn có thể tự tải file .gguf từ HuggingFace và bỏ vào Shared/models. Mọi model tải về đều dùng chung cho tất cả OS nhờ Shared Volume.
Bước 4: Khởi động
Sau khi có model, chạy script start tương ứng: Windows/start-fast-chat.bat, Mac/start.command, bash Linux/start.sh. Engine sẽ chạy nền và tự mở trình duyệt với giao diện chat dark mode. Muốn dùng từ điện thoại, tìm dòng «Network Access IP Address» trong terminal (ví dụ http://192.168.1.15:3333) và nhập vào trình duyệt di động. Lưu ý: cần cho phép firewall Windows mở port 3333 nếu bị chặn.
Ai nên dùng USB-Uncensored-LLM – và ai không nên?

Không phải cứ thấy hay là hợp với bạn. Công cụ này có chân dung người dùng khá rõ ràng.
Người nên dùng
- Lập trình viên, researcher cần privacy tuyệt đối: Bạn muốn test prompt nhạy cảm, xử lý tài liệu nội bộ mà không sợ lộ ra ngoài. Air-gapped là điểm cộng cực lớn.
- Nhà báo, nhà hoạt động ở môi trường hạn chế internet: Bạn cần một trợ lý AI hoạt động độc lập, không phụ thuộc vào kết nối mạng, có thể mang theo trong USB bỏ túi.
- Người thích vọc uncensored models: Bạn mệt mỏi với những câu «As an AI language model, I cannot…» và muốn khám phá giới hạn thật sự của LLM.
- Người dùng nhiều máy tính: Bạn làm việc trên Windows ở cơ quan, MacBook ở nhà, thỉnh thoảng lại dùng Linux server. Một USB AI đồng bộ tất cả môi trường là lý tưởng.
Người không nên dùng
- Người dùng phổ thông: Nếu bạn chỉ cần hỏi đáp nhanh như ChatGPT và không quan tâm privacy, project này hơi overkill. Học cách chạy script cũng là một rào cản.
- Máy yếu (dưới 8GB RAM): Dù Gemma 2B có thể chạy, tốc độ sẽ rất chậm nếu máy bạn chỉ có 4GB RAM. Không đáng để vật vã.
- Người không có nhu cầu di động: Nếu bạn chỉ dùng một máy cố định, cài Ollama trực tiếp lên máy đó sẽ nhanh và tiện hơn là chạy từ USB (tốc độ đọc USB chậm hơn SSD nội bộ).
Câu hỏi thường gặp
USB-Uncensored-LLM có cần internet để hoạt động không?
Bạn cần internet lúc đầu để tải engine (khoảng 50MB) và model (1.6GB – 5.3GB tùy chọn). Sau khi đã có đủ trên USB, mọi thứ chạy hoàn toàn ngoại tuyến, không cần mạng, không gửi dữ liệu đi đâu cả.
Mô hình không kiểm duyệt có an toàn không?
An toàn về mặt kỹ thuật vì dữ liệu không rời khỏi máy bạn. Tuy nhiên, việc sử dụng model không kiểm duyệt đòi hỏi trách nhiệm cá nhân cao – nó sẽ trả lời mọi thứ bạn hỏi, không có cơ chế ngăn chặn nội dung độc hại. Hãy cân nhắc kỹ trước khi dùng.
Tôi có thể thêm model của riêng mình không?
Hoàn toàn được. Bạn chỉ cần tải file .gguf tương thích từ HuggingFace hoặc nguồn khác, đặt vào thư mục Shared/models. Engine sẽ tự nhận diện và bạn có thể load nó như bất kỳ model nào khác trong danh sách.
Chạy trên Android bằng Termux có nhanh không?
Tốc độ suy luận trên Android bị giới hạn bởi phần cứng điện thoại. Với model Gemma 2 2B, bạn có thể đạt khoảng 3-10 token/giây trên thiết bị 6-8GB RAM. Nên dùng termux-wake-lock để tránh Android kill process, và cắm sạc vì LLM ngốn pin rất nhanh.
USB có cần định dạng gì đặc biệt không?
Bạn nên dùng USB định dạng exFAT hoặc NTFS để hỗ trợ file lớn hơn 4GB (do model GGUF thường >4GB). FAT32 sẽ không chứa được những model nặng. Ngoài ra, dùng USB 3.0 trở lên để tốc độ đọc model nhanh hơn.
Kết luận
USB-Uncensored-LLM là một cách tiếp cận thực tế và thông minh cho nhu cầu AI cục bộ di động. Nó không cố gắng làm mọi thứ, mà tập trung giải quyết đúng bài toán: mang LLM mạnh mẽ, không kiểm duyệt, không ràng buộc mạng đến bất kỳ máy tính nào bạn ngồi vào – chỉ với một chiếc USB. Nếu bạn thấy mình trong nhóm «nên dùng» ở trên, hãy ghé ngay repo trên GitHub, tải về và cắm thử liền nha. Cảm giác lần đầu thấy AI chạy vèo vèo từ ổ USB mà không cần đụng gì đến máy chủ sẽ rất đáng đồng tiền bát gạo đấy.

