RS-Agent không phải là một cái tên hoa mỹ — đây là một «trợ lý thông minh» dành cho viễn thám, được điều khiển bởi mô hình ngôn ngữ lớn (LLM), có thể tự động lập kế hoạch và thực thi hàng loạt tác vụ xử lý ảnh vệ tinh phức tạp. Nếu bạn là chuyên gia GIS, nhà nghiên cứu môi trường, hay kỹ sư AI đang mệt mỏi với việc chạy script thủ công cho từng loại ảnh, thì repo này chính là cách để dồn hết mớ hỗn độn đó cho AI lo — bạn chỉ cần hỏi bằng ngôn ngữ tự nhiên. Bạn có thể xem chi tiết tại repository gốc trên GitHub để nắm toàn bộ mã nguồn và kiến trúc.
Thank you for reading this post, don't forget to subscribe!Những điểm chính
- Kiến trúc 4 thành phần chặt chẽ: Central Controller (bộ điều khiển trung tâm), Toolkit (bộ công cụ viễn thám SOTA), Solution Space (không gian giải pháp chuyên gia) và Knowledge Space (không gian tri thức). Tất cả phối hợp nhịp nhàng qua đối thoại đa lượt.
- Tự động lập kế hoạch trên 95%: Khi ghép với các LLM hiện đại (GPT-4o-mini, Qwen2.5 72B, v.v.), độ chính xác lập kế hoạch tác vụ trung bình vượt 98%, ngay cả với model nhỏ hơn cũng đạt 75%+.
- Hỗ trợ 18+ tác vụ viễn thám: Từ khử mây, siêu phân giải, nhận diện máy bay trong ảnh SAR, đến truy xuất tri thức chuyên sâu về hãng sản xuất Boeing 747 — tất cả đều được thực hiện chỉ bằng câu lệnh tiếng Anh thông thường.
- Phương pháp DualRAG và Task-Aware Retrieval: Tăng cường truy xuất tri thức chuyên ngành bằng cách đánh trọng số từ khóa và truy xuất kép, giúp agent trả lời chính xác các câu hỏi học thuật hoặc thực địa khó.
- Mã nguồn mở, tương thích đa dạng LLM: Hoạt động với cả mô hình đóng (GPT series) lẫn mở (LLaMa 3.1, Qwen2.5, DeepSeek-r1), linh hoạt cho môi trường nghiên cứu lẫn doanh nghiệp vừa và nhỏ.
RS-Agent là gì và giải quyết vấn đề gì?

RS-Agent là một tác nhân thông minh (intelligent agent) được thiết kế dành riêng cho lĩnh vực viễn thám. Nó không chỉ là một mô hình ngôn ngữ đa phương thức thông thường; thay vào đó, nó dùng LLM làm bộ điều khiển trung tâm để hiểu yêu cầu của bạn, tra cứu không gian giải pháp, gọi đúng bộ công cụ xử lý ảnh và cuối cùng tổng hợp câu trả lời. Vấn đề nó giải quyết rất cụ thể: các nhà nghiên cứu thường phải dùng đến nhiều tool rời rạc cho từng tác vụ — cái thì khử mây, cái thì phân loại cảnh quan, cái thì nhận diện đối tượng trong ảnh SAR — RS-Agent gói gọn tất cả vào một hội thoại duy nhất, lên kế hoạch và thực thi đa bước mà không cần bạn biết chi tiết kỹ thuật.
Nghe cho rõ nhé: trước đây, muốn làm một bài toán «xóa mây rồi tìm máy bay trong ảnh quang học», bạn phải mò từng repo, kéo thư viện, đổi định dạng ảnh. Với RS-Agent, bạn chỉ cần gõ «Remove the clouds in this image and identify the aircraft type» — nó tự động gọi tool cloud_removal trước, rồi optical_plane_type sau, và trả kết quả như một trợ lý thạo việc. Nhóm tác giả từ Đại học Bưu chính Viễn thông Bắc Kinh và Viện Hàn lâm Khoa học Trung Quốc đã thiết kế một kiến trúc dạng mô-đun, cho phép bạn dễ dàng cắm thêm công cụ mới mà không làm vỡ luồng điều khiển.
Một điểm sáng: kết quả thí nghiệm cho thấy khi ghép với GPT-4o-mini, RS-Agent đạt độ chính xác lập kế hoạch trung bình 99.17% trên 18 tác vụ. Ngay cả với LLaMa 3.1 8B (mô hình nhẹ) cũng đạt 75.28%, minh chứng tính linh hoạt của kiến trúc.
Những tính năng nổi bật của RS-Agent

Đừng nhầm RS-Agent với một con chatbot tạo sinh ảnh. Sức mạnh của nó nằm ở khả năng lập kế hoạch và gọi API công cụ chuyên biệt, cộng thêm hai sáng kiến: Task-Aware Retrieval (truy xuất giải pháp theo tác vụ) và DualRAG (truy xuất tri thức kép) để trả lời chính xác những câu hỏi đòi hỏi hiểu biết sâu về lĩnh vực. Dưới đây là những gì bạn nhận được ngay khi clone repo:
- Central Controller: Bộ não LLM, phiên dịch yêu cầu người dùng thành chuỗi hành động, quản lý lịch sử hội thoại và tổng hợp phản hồi cuối cùng. Hỗ trợ đa mô hình (GPT, LLaMa, Qwen, DeepSeek).
- Toolkit «thần thánh»: Hơn 18 công cụ xử lý ảnh viễn thám đỉnh cao, gồm khử mây (cloud_removal), khử mù (image_dehazing), siêu phân giải 2× (super_resolution), khử nhiễu (denoising), tạo mô tả ảnh theo ngữ cảnh địa lý (caption), nhận diện đối tượng ảnh quang học và SAR (optical_detection, sar_detection), phân loại kiểu máy bay (optical_plane_type, sar_plane_type), phân loại cảnh (scene), phát hiện thiệt hại tòa nhà (building_damage_detection), trích xuất tòa nhà/đường xá (building_extraction, road_extraction), phát hiện hộp chữ nhật ngang/xoay, phân đoạn ngữ nghĩa và phân loại sử dụng đất. Mỗi tool là một module riêng, sẵn sàng được gọi thông qua lời nhắc.
- Solution Space: Kho lưu giải pháp chuyên gia được định nghĩa sẵn, giúp controller chọn đúng công cụ và chiến lược cho từng loại câu hỏi. Nhờ vậy, RS-Agent không «đoán mò» mà bám theo quy trình thực địa.
- Knowledge Space: Cơ sở dữ liệu tri thức chuyên ngành (ví dụ thông tin về dòng máy bay, nhà sản xuất), tích hợp với DualRAG để tăng độ chính xác khi trả lời câu hỏi dạng «Ai sản xuất Boeing 747?». Điều này biến agent từ «thợ ảnh» thành «chuyên gia phân tích».
Bảng bên dưới (trình bày gọn lại từ README) liệt kê các hàm và input mẫu để bạn hình dung. Ví dụ: với ảnh mờ do sương, chỉ cần «Dehaze this foggy image», agent tự gọi image_dehazing. Muốn biết loại máy bay trong ảnh SAR, «Identify the aircraft in this SAR image» kích hoạt sar_plane_type. Mọi thứ đều theo kiểu «một câu nói, một kết quả».
Hướng dẫn cài đặt và sử dụng RS-Agent

Hiện tại, repo chủ yếu cung cấp mã nguồn kiến trúc agent, các script khởi tạo thành phần, và pipeline đánh giá. Vì RS-Agent được xây dựng bằng Python và tận dụng các mô hình nền tảng qua API hoặc checkpoint cục bộ, bạn cần chuẩn bị môi trường GPU nếu muốn chạy suy luận nặng (hoặc có thể dùng API GPT nếu chỉ test controller). Dưới đây là các bước cơ bản để bắt đầu, dựa trên cấu trúc repo mẫu:
- Clone repo:
git clone https://github.com/IntelliSensing/RS-Agent.git && cd RS-Agent - Tạo môi trường ảo và cài dependencies:
python -m venv rsagent_env && source rsagent_env/bin/activate(Linux/Mac) hoặcrsagent_env\Scripts\activate(Windows), sau đópip install -r requirements.txt. Nếu repo chưa có file requirements, bạn cần cài từng gói khi chạy demo. - Cấu hình LLM: Sửa file config hoặc biến môi trường để chỉ định khóa API (OpenAI, DeepSeek) hoặc đường dẫn checkpoint cục bộ (LLaMa, Qwen). Mặc định RS-Agent hỗ trợ nhiều backend.
- Chạy demo: Tìm file chính (có thể là
run_agent.pyhoặcdemo_chat.py). Thực thipython run_agent.py --image sample.png --query 'Remove clouds in this image and detect aircraft'để thấy quy trình đa bước.
Lưu ý: vì công trình mang tính học thuật, một số công cụ (optical_detection, semantic_segmentation…) yêu cầu tải trọng số mô hình riêng; bạn cần kiểm tra từng thư mục tool để biết hướng dẫn chi tiết. Nếu chỉ muốn thử khả năng lập kế hoạch mà không cần xử lý ảnh thật, phần đánh giá task planning trong bài báo có thể chạy độc lập bằng các tác vụ giả lập. Đây là điểm cần cân nhắc: repo chưa có hướng dẫn «một nút bấm» cho người không chuyên, nhưng với dân kỹ thuật, việc cấu hình khá quen thuộc.
Ai nên dùng RS-Agent và ai không nên?

RS-Agent sinh ra để phục vụ nhóm người làm việc với dữ liệu viễn thám mỗi ngày nhưng lại ghét sự rời rạc của các công cụ. Cụ thể hơn:
Nên dùng nếu bạn là:
- Chuyên gia GIS hoặc nhà phân tích ảnh vệ tinh: bạn cần một giao diện thống nhất thay vì chạy 5 script khác nhau.
- Nhà nghiên cứu AI muốn thử nghiệm mô hình ngôn ngữ trong lĩnh vực đặc thù: kiến trúc mở, dễ gắn thêm tool, dễ benchmark.
- Kỹ sư phần mềm xây dựng pipeline tự động cho giám sát môi trường, nông nghiệp thông minh, quốc phòng: bạn tiết kiệm thời gian tích hợp nhờ thiết kế module.
Không nên dùng nếu:
- Bạn là người dùng cuối không có kỹ năng lập trình Python: repo hiện không có giao diện web hay ứng dụng cài đặt một chạm.
- Bạn cần xử lý ảnh thời gian thực với độ trễ thấp: agent LLM có thời gian phản hồi hàng chục token/giây (xem bảng tốc độ trong README: GPT-4o-mini ~58.87 t/s, DeepSeek 70B ~18.25 t/s), chưa phù hợp tác vụ yêu cầu phản hồi tức thì.
- Bạn chỉ cần một mô hình sinh caption đơn thuần: RS-Agent nặng ký hơn hẳn, sẽ là lãng phí nếu chỉ dùng tính năng mô tả ảnh.
Nói ngắn gọn: đây là con dao đa năng của kỹ sư, không phải đồ chơi cho người lướt web. Nếu bạn sẵn sàng lấm tay một chút, giá trị mang lại rất lớn.
Câu hỏi thường gặp
RS-Agent hỗ trợ những mô hình ngôn ngữ nào?
Bảng thí nghiệm trong README chỉ rõ: ChatGPT (3.5-turbo, 4o-mini), LLaMa 3.1 (8B và 70B), Qwen2.5 (14B, 32B, 72B), DeepSeek-r1 (70B). Bạn có thể đổi model bằng cách sửa cấu hình, miễn là model đó có khả năng sinh văn bản và theo dõi hướng dẫn. Nhóm tác giả đã đo cả tốc độ token/giây, giúp bạn ước lượng chi phí vận hành.
Tôi có thể thêm tool xử lý ảnh của riêng mình vào RS-Agent không?
Hoàn toàn được. Kiến trúc dạng module cho phép bạn đăng ký một hàm Python mới vào Toolkit và thêm mô tả ngắn gọn vào Solution Space. Sau đó, Central Controller sẽ «học» cách gọi tool mới thông qua prompt, không cần đào tạo lại toàn bộ. Đây chính là ưu điểm lớn so với các mô hình end-to-end cứng nhắc.
Độ chính xác 99% chỉ đúng trên tập test hay thực tế cũng vậy?
Con số 99.17% là độ chính xác lập kế hoạch (chọn đúng chuỗi công cụ) trên tập đánh giá của bài báo với GPT-4o-mini. Hiệu suất thực tế phụ thuộc vào chất lượng ảnh đầu vào, độ khó của câu lệnh và khả năng của từng tool con. Nhưng rõ ràng con số này cho thấy agent hiếm khi «đi lạc» trong việc quyết định làm gì tiếp theo, một bước tiến rất đáng nể.
Tôi không có GPU, dùng API GPT có được không?
Được, miễn là bạn dùng Central Controller với API GPT-4o-mini hoặc GPT-3.5. Các tác vụ tool con (super_resolution, detection…) đương nhiên cần GPU để chạy mô hình con, nhưng nếu bạn chỉ muốn test khả năng lập kế hoạch và tra cứu tri thức, chỉ cần khóa API là đủ.
Kết luận
RS-Agent không đơn thuần là một bản demo «AI trong viễn thám» — nó là một khung kiến trúc đã được kiểm chứng qua hơn chục mô hình LLM, giải quyết được bài toán tự động hóa thực sự: biến ngôn ngữ tự nhiên thành quy trình xử lý ảnh đa bước mà không cần code. Dù chưa dành cho người dùng phổ thông, nhưng với giới chuyên môn, đây là viên gạch nền tảng để xây các hệ thống giám sát từ xa thông minh. Nếu bạn đang tìm cách giảm thời gian chết giữa các khâu phân tích, hãy cho RS-Agent một cơ hội — bắt đầu bằng một lần clone repo và chạy thử demo. Đừng quên để lại star trên GitHub nếu thấy hữu ích!

