DeepSeek OCR: Ứng dụng nhận dạng văn bản và xử lý PDF miễn phí

ByNgọc Trai MKT03/07/2026in GitHub Tools 0
deepseek-ocr-app

DeepSeek OCR là một ứng dụng mã nguồn mở kết hợp React và FastAPI, cho phép bạn nhận dạng văn bản (OCR) từ hình ảnh và PDF, sau đó xuất ra các định dạng như Markdown, HTML, DOCX và JSON. Công cụ này giải quyết vấn đề trích xuất nội dung từ tài liệu scan, bảng biểu, công thức toán học một cách nhanh chóng, phù hợp cho lập trình viên, nhà nghiên cứu và người làm nội dung.

Thank you for reading this post, don't forget to subscribe!

Những điểm chính

  • Hỗ trợ hai chế độ chính: OCR hình ảnh đơn và xử lý PDF nhiều trang với theo dõi tiến độ.
  • Xuất kết quả ra Markdown, HTML, DOCX và JSON, giữ nguyên định dạng bảng, hình ảnh, công thức.
  • Tích hợp phát hiện khung chứa (bounding boxes) cho chế độ tìm kiếm, hiển thị tọa độ chính xác.
  • Triển khai dễ dàng bằng Docker, hỗ trợ GPU NVIDIA (CUDA) cho tốc độ cao.
  • Mã nguồn mở, cấu hình linh hoạt qua file .env, cộng đồng đóng góp tích cực.

DeepSeek OCR là gì và giải quyết vấn đề gì?

DeepSeek OCR là gì và giải quyết vấn đề gì?
DeepSeek OCR là gì và giải quyết vấn đề gì?

DeepSeek OCR là ứng dụng web mã nguồn mở sử dụng mô hình DeepSeek-OCR từ Hugging Face, kết hợp frontend React với backend FastAPI. Nó giải quyết bài toán trích xuất văn bản từ hình ảnh và PDF, bao gồm cả tài liệu scan chất lượng thấp, bảng biểu phức tạp và công thức toán học. Thay vì phải dùng nhiều công cụ rời rạc, bạn có một giải pháp toàn diện với khả năng chuyển đổi định dạng ngay trong cùng một giao diện.

Bạn có thể xem chi tiết tại repository gốc trên GitHub.

Những tính năng nổi bật của DeepSeek OCR là gì?

Những tính năng nổi bật của DeepSeek OCR là gì?
Những tính năng nổi bật của DeepSeek OCR là gì?

Phiên bản 2.2.0 bổ sung xử lý PDF nhiều trang, cho phép tải file lên đến 100MB, tự động OCR từng trang và xuất ra bốn định dạng. Chế độ OCR hình ảnh hỗ trợ bốn chế độ: Plain OCR, Describe, Find (tìm kiếm với bounding box), Freeform (prompt tùy chỉnh). Giao diện glass morphism, kéo thả file, hiển thị khung chứa nhiều đối tượng, và theo dõi tiến độ.

Xử lý PDF nâng cao

Bạn có thể trích xuất văn bản từ PDF scan, giữ nguyên hình ảnh nhúng, bảng biểu và công thức LaTeX. Kết quả được xuất dưới dạng Markdown cho tài liệu, HTML cho web, DOCX cho chỉnh sửa, và JSON cho lập trình.

Tương tác trực quan

Bounding box được hiển thị đúng tỉ lệ nhờ cơ chế chuyển đổi tọa độ chuẩn hóa (0-999) sang pixel thực tế. Ứng dụng còn hỗ trợ nhiều bounding box cho cùng một từ khóa, mỗi box có màu riêng.

Hướng dẫn cài đặt và sử dụng DeepSeek OCR như thế nào?

Hướng dẫn cài đặt và sử dụng DeepSeek OCR như thế nào?
Hướng dẫn cài đặt và sử dụng DeepSeek OCR như thế nào?

DeepSeek OCR sử dụng Docker Compose để triển khai, giúp bạn dễ dàng chạy trên máy có GPU NVIDIA. Dưới đây là các bước cơ bản:

  1. Clone repository: git clone https://github.com/rdumasia303/deepseek_ocr_app
  2. Copy file cấu hình: cp .env.example .env
  3. Khởi động ứng dụng: docker compose up --build
  4. Truy cập frontend tại http://localhost:3000 và API tại http://localhost:8000

Lần đầu chạy sẽ tải mô hình (~5-10GB). Bạn có thể tùy chỉnh port, giới hạn upload qua file .env. Để xử lý PDF, chọn chế độ PDF Processing, tải file, chọn định dạng xuất và nhấn Process PDF.

Ai nên dùng và ai không nên dùng DeepSeek OCR?

Ai nên dùng và ai không nên dùng DeepSeek OCR?
Ai nên dùng và ai không nên dùng DeepSeek OCR?

DeepSeek OCR phù hợp với lập trình viên cần tích hợp OCR vào ứng dụng, nhà nghiên cứu xử lý tài liệu học thuật, và người làm nội dung chuyển đổi PDF sang Markdown. Tuy nhiên, nếu bạn chỉ cần OCR đơn giản vài chữ, các công cụ miễn phí như Google Lens có thể nhanh hơn. Ngoài ra, yêu cầu GPU với 8-12GB VRAM và ~20GB ổ cứng có thể là rào cản với người dùng phổ thông.

Câu hỏi thường gặp

DeepSeek OCR có hỗ trợ GPU không?

Có, ứng dụng hỗ trợ GPU NVIDIA với CUDA, đã được kiểm thử trên RTX 3090 và RTX 5090. Bạn cần cài đặt NVIDIA Container Toolkit để Docker nhận GPU.

Có thể xử lý PDF bao nhiêu trang?

Không có giới hạn trang cụ thể, nhưng tổng dung lượng file tối đa 100MB. Với tài liệu nhiều trang, thời gian xử lý sẽ lâu hơn và có thanh tiến độ theo dõi.

Làm sao để xuất kết quả ra Word hoặc Markdown?

Trong chế độ PDF Processing, chọn định dạng DOCX hoặc Markdown từ dropdown trước khi nhấn Process PDF. File sẽ tự động tải về sau khi hoàn tất.

DeepSeek OCR có nhận dạng được tiếng Việt không?

README không đề cập cụ thể về ngôn ngữ, nhưng mô hình DeepSeek-OCR hỗ trợ đa ngôn ngữ. Bạn nên kiểm tra trực tiếp với ảnh tiếng Việt để đánh giá độ chính xác.

Kết luận

DeepSeek OCR là một công cụ mã nguồn mở mạnh mẽ cho nhu cầu OCR và chuyển đổi tài liệu, đặc biệt hữu ích khi bạn cần xử lý PDF với nhiều định dạng đầu ra. Nếu bạn có GPU và muốn kiểm soát hoàn toàn quy trình OCR, hãy thử ngay repo này trên GitHub. Đừng quên đóng góp ý kiến hoặc báo lỗi nếu gặp vấn đề nhé!

Related Posts