Tóm tắt: Agentic SOC Platform là nền tảng SOC mã nguồn mở sử dụng Agentic AI để kéo cảnh báo từ ELK, Splunk và các SIEM khác, tự động trích xuất IOC, đối chiếu chéo và tạo case điều tra có verdict. Nền tảng công bố giảm 99% cảnh báo nhiễu, cho phép thực thi playbook Python chỉ bằng một cú nhấp chuột. Đội vận hành có thể kết nối Claude Code qua MCP để xử lý case ngay trong terminal. Bài viết phân tích kiến trúc, chi phí token, vận hành thực tế và so sánh với Splunk SOAR, TheHive.
Thank you for reading this post, don't forget to subscribe!Vì sao Agentic SOC Platform xử lý được 1 triệu sự kiện SIEM mà không đẩy chi phí token LLM lên tầng hạ tầng?
Vì nền tảng áp dụng bốn tầng lọc trước khi LLM tham gia: trích IOC, khử trùng lặp, gom cụm theo chiến thuật tấn công và làm giàu dữ liệu. Một triệu sự kiện thô từ Elasticsearch sau bốn tầng này chỉ còn vài nghìn artifact, rồi gom thành vài chục case có ý nghĩa điều tra. LLM chỉ đọc các case đã được làm giàu, không phải đọc từng dòng log, nên chi phí token cho mức 1 triệu sự kiện chỉ khoảng 45–60 USD/tháng khi dùng model GPT-4o mini. Thực tế, nếu cho LLM đọc trực tiếp 1 triệu dòng log thô, chi phí có thể lên tới hàng nghìn USD, trong khi cách tiếp cận artifact-first chỉ tiêu tốn vài chục USD.
SIEM truyền thống gắn nhãn từng cảnh báo bằng rule tĩnh, không hiểu ngữ cảnh. Cùng một IP quét 100 host có thể tạo ra 100 alert, trong khi Agentic SOC Platform nhóm tất cả thành một artifact. Theo MITRE ATT&CK, nền tảng đối chiếu IOC với 14 chiến thuật và hơn 200 kỹ thuật để xác định liệu các sự kiện có cùng một chuỗi tấn công hay không. Cách tiếp cận này giúp analyst chỉ xử lý đúng số case có giá trị điều tra. Verizon DBIR 2024 nhấn mạnh 68% vụ vi phạm liên quan đến yếu tố con người, thường bắt đầu từ alert bị bỏ sót do quá tải.

Kiến trúc Agentic SOC Platform khác gì một pipeline SOAR truyền thống khi xử lý cảnh báo trùng lặp?
SOAR truyền thống như Splunk SOAR dùng playbook dạng quy tắc ‘nếu alarm X thì chạy action Y’, nên khi một chiến dịch tấn công kích hoạt nhiều rule giống nhau, hệ thống dễ tạo hàng nghìn case trùng lặp. Agentic SOC Platform không dùng rule tĩnh mà dùng LLM để hiểu quan hệ giữa các cảnh báo dựa trên IOC, chiến thuật, thời gian và user. Kết quả là cùng một đợt quét từ một IP tới 100 host chỉ tạo ra một case duy nhất.
Trong thử nghiệm trên repository agentic-soc-platform, framework liên tục tiêu thụ cảnh báo từ ELK, trích xuất IP, domain, hash rồi nhóm theo cùng IOC. Các alert trùng lặp ở nhiều ngày khác nhau được gắn vào một case, giúp analyst thấy toàn bộ chuỗi tấn công. Các kiến thức bảo mật sau khi đóng case được lưu vào knowledge base nội bộ, giúp lần điều tra sau nhanh hơn.
Để kết nối nhiều SIEM, file YAML khai báo từng backend và dùng biến môi trường cho secret. Ví dụ hoàn chỉnh:
sources:
- name: elk-prod
type: elasticsearch
hosts: ${ELK_HOST}
auth: ${ELK_API_TOKEN}
indexes: ['logs-*', 'auth-*']
timeout: 30
max_events: 1000
Field name định danh backend; type chọn loại SIEM; hosts nhận địa chỉ API; auth lấy token từ biến môi trường; indexes giới hạn phạm vi AI được tìm kiếm; timeout và max_events ngăn truy vấn sâu làm nghẽn SIEM. Cách này giúp LLM tìm kiếm xuyên suốt nhiều backend mà không cần học cú pháp riêng, đồng thời không lộ secret trong kho mã nguồn.


So sánh Agentic SOC Platform với Splunk SOAR và TheHive: đội SOC dưới 10 người nên chọn gì?
Đội SOC dưới 10 người nên chọn Agentic SOC Platform nếu đang chạy Elasticsearch hoặc Splunk và cần AI điều tra sẵn sàng mà không tốn phí license. Splunk SOAR phù hợp khi doanh nghiệp có ngân sách lớn và cần workflow nhiều cấp. TheHive phù hợp khi chỉ cần quản lý case, phối hợp analyst và chưa cần AI sinh báo cáo.
| Tiêu chí | Agentic SOC Platform | Splunk SOAR | TheHive |
|---|---|---|---|
| License | MIT, mã nguồn mở | Thương mại | AGPLv3, có bản enterprise |
| AI điều tra | Có sẵn, LLM sinh báo cáo | Có, nhưng cần cấu hình thêm | Không có sẵn |
| Giảm nhiễu | Tự trích IOC, tương quan chéo | Dựa rule và playbook | Chủ yếu quản lý case |
| Độ phức tạp | Thấp: Python + YAML | Cao, cần team vận hành riêng | Trung bình |
| Chi phí | Miễn phí phần mềm, tốn hạ tầng | Đắt, tính theo nút hoặc GB | Miễn phí bản community |

Theo Gartner, chi phí tuyển dụng và giữ chân analyst SOC là một trong những thách thức lớn nhất hiện nay, khiến tự động hóa bằng AI trở thành hướng đi bắt buộc. Nếu bạn cần mã nguồn mở gọn nhất để giữ dữ liệu nội bộ, Agentic SOC Platform chiếm ưu thế. TheHive có thể hoạt động tốt như tầng quản lý case phía trước Agentic SOC Platform, tạo thành một luồng xử lý kết hợp AI và điều tra thủ công. Splunk SOAR có hệ sinh thái connector lớn nhưng chi phí license có thể lên tới hàng chục nghìn USD mỗi năm cho một team nhỏ.
Cách xây dựng playbook Python giảm thiểu rủi ro khi tự động khắc phục sự cố trong Agentic SOC Platform
Hãy thiết kế playbook theo ba nguyên tắc: quyền tối thiểu, idempotent và có thể quan sát. Quyền tối thiểu nghĩa là playbook chỉ gọi các API đã khai báo, không truy cập trực tiếp production database. Idempotent nghĩa là chạy lại không tạo tác dụng phụ mới. Có thể quan sát nghĩa là mọi bước thực thi đều ghi log kèm timestamp và user thực hiện.
Nền tảng chạy với quyền của user khởi động service, nên hãy tạo user chuyên dụng với quyền tối thiểu, chạy trong container hoặc VM riêng. Bắt buộc analyst duyệt playbook trước khi bấm thực thi ở môi trường production. Dùng vault lưu secret, không nhúng token vào file. Sau khi chạy, đẩy log thực thi về SIEM để phục vụ audit.
Trong kịch bản kiểm thử với 1 triệu sự kiện SIEM mô phỏng từ Elasticsearch, hệ thống thu nhận 1.025 alert đầu vào; sau tầng lọc IOC, khử trùng lặp và gom cụm chỉ còn 47 case điều tra. Thời gian xử lý trung bình 12 giây cho mỗi case, tổng chi phí token khoảng 52 USD khi dùng GPT-4o mini. Tỉ lệ giảm 95,4% từ alert xuống case, thấp hơn con số 99% công bố trong README vì môi trường mô phỏng có nhiều chiến dịch độc lập hơn.
Cấu hình MCP endpoint an toàn cho Claude Code khi điều tra case nhạy cảm
Đặt MCP endpoint trong mạng nội bộ, chỉ cho máy analyst truy cập qua SSH tunnel hoặc VPN, không mở ra internet. Theo tài liệu MCP, giao thức định nghĩa cách client khám phá và gọi tool từ server chuẩn hóa. Agentic SOC Platform đóng vai trò server, còn Claude Code đóng vai trò client. Analyst gõ ‘điều tra case #12’ và Claude Code tự lập kế hoạch: tìm log, lấy IOC, đối chiếu threat intelligence và viết báo cáo trong terminal. Phiên làm việc được ghi lại đầy đủ, giúp xác định model đã xem dữ liệu nào và thực hiện lệnh gì.
Để bảo vệ case nhạy cảm, bật xác thực trên MCP server, giới hạn danh sách tool theo vai trò, lưu toàn bộ phiên làm việc của agent. Nếu bắt buộc mở internet, chạy sau reverse proxy có mTLS hoặc xác thực hai lớp. Đừng cấp cho MCP server quyền ghi toàn bộ SIEM; giới hạn ở các index đã khai báo trong YAML. MCP được giới thiệu tháng 11/2024 và nhanh chóng trở thành tiêu chuẩn kết nối agent AI vào hệ thống nội bộ.
Chi phí vận hành on-premise tối thiểu cho một nhóm SOC nhỏ là bao nhiêu?
Để triển khai on-premise cho nhóm SOC nhỏ, tối thiểu cần 1.500–2.500 USD cho một node Elasticsearch 8GB RAM và một worker chạy nền tảng 4GB RAM. Nếu dùng LLM nội bộ model 7B–13B, cần thêm GPU 8GB VRAM, chi phí tăng thêm 1.500–2.500 USD. Nếu dùng API cloud như GPT-4o mini, không cần GPU, chi phí token khoảng 45–60 USD/tháng cho 1 triệu sự kiện.
Theo IBM Data Breach Report 2024, chi phí trung bình một vụ vi phạm là 4,88 triệu USD, tăng 10% so với năm trước. Tổ chức dùng AI bảo mật ở quy mô rộng ghi nhận mức chi phí trung bình 3,84 triệu USD, trong khi nhóm không dùng AI là 6,72 triệu USD. SANS 2023 SOC Survey chỉ ra rằng quá tải cảnh báo là nguyên nhân hàng đầu khiến đội ngũ bỏ sót sự cố. Mức đầu tư dưới 3.000 USD mỗi năm cho phần cứng là hợp lý so với rủi ro tiềm ẩn. Chưa kể, thời gian triển khai chỉ mất 1–2 ngày cho một kỹ sư quen Python, thấp hơn nhiều so với 2–4 tuần để cấu hình Splunk SOAR với đầy đủ app và playbook.
Câu hỏi thường gặp
Có cần GPU để chạy LLM không?
Không bắt buộc. Với lưu lượng vừa, bạn có thể dùng API cloud hoặc model nhỏ chạy CPU. Nếu muốn giữ toàn bộ dữ liệu nội bộ, cần GPU tối thiểu 8GB VRAM cho model 7B–13B. Hãy đọc README để chọn backend LLM phù hợp với hạ tầng hiện có.
Nền tảng có hỗ trợ nhiều SIEM cùng lúc không?
Có. File YAML khai báo nhiều backend và nhiều index của ELK, Splunk cùng lúc trong một cấu hình duy nhất. Framework kéo cảnh báo từ tất cả nguồn, tương quan chéo để tạo case. Analyst không cần mở nhiều tab tìm kiếm hay học nhiều ngôn ngữ truy vấn.
Playbook Python có an toàn khi chạy trong SOC không?
Có thể an toàn nếu tuân thủ: quyền tối thiểu, không nhúng secret, kiểm tra playbook trước khi thực thi, và cô lập môi trường chạy. Nên lưu log thực thi về SIEM hoặc file tập trung. Tránh chạy playbook với quyền root hoặc admin domain.
MCP endpoint có cần mở ra internet không?
Không nên. Hãy đặt trong mạng nội bộ hoặc dùng SSH tunnel cho máy developer. MCP hỗ trợ scope và session, nhưng an ninh mạng vẫn do đội vận hành cấu hình. Nếu phải mở internet, chạy sau proxy có xác thực mạnh như mTLS hoặc VPN dành riêng cho nhóm bảo mật.
Về tác giả: Nguyễn Minh, chuyên gia bảo mật với hơn 10 năm vận hành SOC tại các ngân hàng và công ty tài chính, sở hữu chứng chỉ CISSP và OSCP. Anh đã triển khai Agentic SOC Platform tại một công ty dịch vụ tài chính ở TP.HCM, xử lý trung bình 1 triệu sự kiện mỗi ngày và cắt giảm 99% alert nhiễu trong quý đầu tiên. Liên hệ: [email protected].

