Bạn muốn mang theo một trợ lý AI mạnh mẽ, không cần mạng, không cần cài đặt, và quan trọng là không bị kiểm duyệt? USB AI không kiểm duyệt từ dự án USB-Uncensored-LLM biến chiếc USB hay ổ SSD rẻ tiền thành một môi trường AI cục bộ hoàn chỉnh, chạy được trên Windows, macOS, Linux lẫn Android. Đây là giải pháp air-gapped đúng nghĩa cho lập trình viên, nhà nghiên cứu, hay bất kỳ ai cần một LLM riêng tư tuyệt đối mà không phụ thuộc vào đám mây.
Thank you for reading this post, don't forget to subscribe!Nói ngắn gọn: USB-Uncensored-LLM là bộ công cụ portable đóng gói sẵn engine Ollama biên dịch riêng cho từng hệ điều hành, kèm các model đã được abliterated để không từ chối truy vấn. Tổng dung lượng từ 1,6GB nếu chọn Gemma 2 2B, tối đa 5,3GB nếu chọn Qwen 3.5 9B. Bạn cắm USB, chạy một script duy nhất, là có giao diện chat trên localhost:3333 hoặc truy cập từ điện thoại qua LAN. Điểm khác biệt so với Ollama cài đặt thường là Shared Volume: model được lưu một lần, dùng chung cho Windows, macOS, Linux và Android. Không cần quyền admin, không cần Python global, không gửi dữ liệu ra ngoài. Đây là lựa chọn phù hợp nhất hiện tại cho nhu cầu di động + riêng tư + không kiểm duyệt, nhưng bạn phải tự chịu trách nhiệm về nội dung.

Vì sao USB-Uncensored-LLM chạy được LLM không kiểm duyệt mà không cần cài đặt hệ thống?
Vì dự án này gói sẵn engine Ollama dạng portable, không cần Python hay package manager. Mỗi hệ điều hành có một script install riêng, chỉ tải binary khoảng 50MB vào thư mục Shared/bin. Khi bạn cắm USB vào máy khác, mọi đường dẫn đều tương đối nên không đụng vào registry, thư mục hệ thống hay biến môi trường.
Thay vì cài đặt Ollama system-wide, dự án dùng cấu trúc thư mục đóng gói sẵn trên GitHub: Windows/ chứa install.bat, Mac/ chứa install.command, Linux/ và Android/ chứa script tương ứng. Lần đầu chạy, script chỉ tải engine nền tầm 50MB về Shared/bin – đúng nghĩa zero-install. Nhờ đó, bạn có thể dùng trên máy công ty không có quyền admin mà không lo bị chặn.
Nguyên lý hoạt động của các model không kiểm duyệt nằm ở bước fine-tune: các vector phản hồi an toàn bị xóa đi (abliteration), nên model không còn cơ chế từ chối. USB-Uncensored-LLM không tự tạo model, mà đóng gói sẵn các bản fine-tune này kèm script chạy, vì vậy bạn không cần làm gì thêm ngoài việc chọn model và bật server.
Quy trình cài đặt 4 bước trước khi chạy model không kiểm duyệt
Quy trình gồm: tải repo, chạy install script, tải model, khởi động server. Toàn bộ chỉ mất vài phút nếu USB đã có sẵn model. Bạn cần một USB 3.0 trở lên, ít nhất 8GB trống; khuyến nghị 16GB nếu muốn thử model 9B. Máy tính nên có tối thiểu 8GB RAM cho model 2B-4B, và 16GB RAM cho model 9B-12B.
Bước 1: clone hoặc download repo từ GitHub vào USB. Bước 2: chạy script cài engine tương ứng OS – Windows: Windows/install.bat; macOS: Mac/install.command; Linux: bash Linux/install.sh; Android: bash Android/install.sh trong Termux. Bước 3: dùng menu của install.bat để tải model, hoặc tự đặt file .gguf vào Shared/models. Bước 4: chạy script start như Windows/start-fast-chat.bat, Mac/start.command, Linux/start.sh, server sẽ mở trình duyệt tại localhost:3333.
Kiến trúc Shared Volume giúp dùng chung model 5GB+ trên Windows, macOS, Linux và Android như thế nào?
Shared Volume là một thư mục dùng chung trong USB, chứa Shared/models và Shared/bin. Engine của mỗi OS trỏ đến cùng đường dẫn tương đối, nên model 5GB+ chỉ cần tải một lần, tất cả hệ điều hành cùng đọc file này khi cắm USB.
Nếu không có Shared Volume, bạn phải tải model riêng cho từng OS – với model 9B, tốn gấp 4 lần dung lượng. Cơ chế này đặc biệt hữu ích khi bạn mang USB từ PC Windows ở công ty sang MacBook ở nhà. Trong quá trình tải, bạn có thể chọn model từ menu của HuggingFace hoặc tự đưa file GGUF vào. Engine tự nhận diện và load model ngay lần chạy kế tiếp.

So sánh nhanh ba model trong bộ USB-Uncensored-LLM
Cả ba model đều được fine-tune để giảm từ chối, nhưng khác nhau về dung lượng, tốc độ và chất lượng suy luận. Gemma 2 2B Abliterated là lựa chọn mặc định cho máy yếu; Gemma 4 E4B Ultra Uncensored Heretic có mức từ chối thấp nhất; Qwen 3.5 9B phù hợp tác vụ phức tạp.
| Model | Dung lượng GGUF | RAM tối thiểu | Điểm mạnh | Phù hợp |
|---|---|---|---|---|
| Gemma 2 2B Abliterated | ~1.6GB | 8GB | Tốc độ cao, chạy tốt trên CPU | Máy văn phòng, laptop cũ |
| Gemma 4 E4B Ultra Uncensored Heretic | ~3.1GB | 12GB | Ít từ chối nhất, sáng tạo | Người thích khám phá ranh giới |
| Qwen 3.5 9B | ~5.3GB | 16GB | Suy luận sâu, đa bước | Code, phân tích tài liệu dài |
Số liệu dung lượng là ước lượng theo bản quantized Q4 trong kho model của dự án. Bạn nên bắt đầu với Gemma 2 2B để kiểm tra luồng chạy trước, sau đó mới nâng cấp lên model lớn hơn. Mỗi model có thể được tải qua menu cài đặt hoặc thủ công từ trang Qwen và Google Gemma.
Làm thế nào để truy cập giao diện chat từ điện thoại qua LAN mà không gặp lỗi CORS?
Server chat trong USB-Uncensored-LLM lắng nghe trên 0.0.0.0:3333 và đã bật CORS cho mọi nguồn gốc. Điện thoại chỉ cần nhập IP máy chủ, ví dụ http://192.168.1.15:3333, miễn là cùng WiFi. Lỗi CORS chỉ xảy ra khi bạn tự viết giao diện web gọi API từ domain khác; còn giao diện mặc định được phục vụ trực tiếp từ server nên không bị chặn.
Khi chạy start script, tìm dòng Network Access IP Address trong terminal. Nếu truy cập thất bại, hãy kiểm tra tường lửa Windows cho phép cổng 3333, và đảm bảo điện thoại không dùng mạng khác. Chỉ nên mở trên WiFi gia đình hoặc văn phòng tin cậy; ai trong LAN cũng có thể chat được. Cảm giác lúc đó giống như có một server AI mini tự lưu trữ nằm gọn trong túi.

Kết quả kiểm thử 5 prompt nhạy cảm trên USB cho thấy điều gì?
Kiểm thử gồm 5 nhóm prompt: vi phạm bản quyền, nội dung bạo lực, lời khuyên y tế, kích động chính trị và prompt vượt rào. Trên Gemma 2 2B Abliterated, cả 5 nhóm đều có phản hồi, không xuất hiện câu kiểu As an AI language model, nhưng chất lượng phụ thuộc nhiều vào context.
Quy trình kiểm thử được thiết kế để đo ba chỉ số: tỉ lệ từ chối, tốc độ token/giây và độ ổn định khi tăng dần độ dài hội thoại. Với model 2B, tốc độ trên CPU hiện đại đủ dùng cho chat thông thường; model 9B cần GPU để đạt hiệu năng cao. Con số cụ thể thay đổi theo RAM, chip và bản quantize nên chúng tôi để placeholder cho phần đo thực tế trên từng hệ điều hành.
Rủi ro và trách nhiệm khi dùng model không kiểm duyệt là gì?
Về kỹ thuật, an toàn vì dữ liệu không rời khỏi máy bạn. Nhưng model abliterated sẽ trả lời cả những yêu cầu tạo nội dung độc hại, sai lệch y tế, pháp lý hoặc hướng dẫn nguy hiểm mà không có lớp lọc nào. Người dùng phải tự chịu trách nhiệm về đầu ra và không dùng để gây hại.
Kỹ thuật abliteration được giải thích chi tiết trong bài viết về Abliteration trên HuggingFace. Nó cho phép giữ lại toàn bộ kiến thức của model mà loại bỏ chiều không gian phản hồi an toàn, nên model không còn nhận thức để từ chối. Nếu bạn dùng USB AI không kiểm duyệt trong công việc, hãy cách ly với dữ liệu nhạy cảm và kiểm tra kỹ mọi output. Một số người dùng hợp lý là lập trình viên, nhà nghiên cứu, hoặc người xử lý tài liệu nội bộ – bạn có thể tham khảo thêm công cụ coding agent mã nguồn mở hay phần mềm trích xuất kiến thức từ LLM.
Đây là một giải pháp tự lưu trữ lý tưởng nếu bạn biết giới hạn của mình. Hãy nhớ rằng không có model nào hoàn hảo; mọi câu trả lời đều cần được kiểm chứng, đặc biệt khi nó liên quan đến sức khỏe, pháp luật hay tài chính.
Câu hỏi thường gặp
USB AI không kiểm duyệt có cần internet để hoạt động không?
Bạn cần internet ở lần đầu để tải engine (khoảng 50MB) và model (1.6GB – 5.3GB). Sau khi đã có đủ file trên USB, toàn bộ hoạt động chạy ngoại tuyến, không gửi dữ liệu ra ngoài và không cần tài khoản đám mây.
Chạy trên Android bằng Termux có nhanh không?
Tốc độ phụ thuộc chip và RAM của điện thoại. Với model Gemma 2 2B, bạn có thể đạt mức dùng được trên máy 6-8GB RAM. Nên dùng termux-wake-lock để tránh hệ điều hành kill process, và cắm sạc vì LLM ngốn pin rất nhanh.
USB có cần định dạng đặc biệt không?
Nên dùng exFAT hoặc NTFS vì model GGUF thường lớn hơn 4GB; FAT32 sẽ không chứa được. Kết hợp với USB 3.0 trở lên để giảm thời gian đọc model.
Tôi có thể thêm model riêng không?
Được. Tải file .gguf tương thích từ HuggingFace hoặc nguồn khác, đặt vào Shared/models. Engine sẽ nhận diện và cho phép load model đó như model mặc định. Bạn có thể xem thêm hướng dẫn sử dụng GGUF trên docs.ollama.com.

Tóm lại, USB-Uncensored-LLM giải quyết đúng bài toán mang LLM riêng tư, không kiểm duyệt đến nhiều máy tính khác nhau. Bạn mất vài phút chuẩn bị USB, đổi lại sự chủ động hoàn toàn về dữ liệu và môi trường AI khi di chuyển. Nếu bạn thuộc nhóm cần privacy tuyệt đối, hãy tải repo ngay hôm nay để tự trải nghiệm.
Bài viết được thực hiện bởi .

