llm-wikid là một repository GitHub tạo ra knowledge base do AI duy trì, sống ngay trong Obsidian, dựa trên LLM Wiki pattern của Andrej Karpathy. Nó giải quyết vấn đề ghi chú rời rạc, khó tra cứu: bạn bỏ source thô vào raw, AI đọc, phân loại, viết trang wiki, kiểm tra thiên kiến và cập nhật index.
Thank you for reading this post, don't forget to subscribe!Những điểm chính
- llm-wikid biến các ghi chú thô trong
raw/thành một wiki có cấu trúc, liên kết chéo và master index ngay trong Obsidian. - Không phải RAG: hệ thống biên dịch kiến thức một lần thành các trang wiki và cập nhật khi có dữ liệu mới, theo nhận định của Karpathy tốt hơn RAG ở quy mô khoảng 100 bài và 400K từ.
- Hoạt động với Claude Code, OpenClaw, Hermes, Codex hoặc bất kỳ agent nào đọc được markdown và chạy lệnh shell.
- Tích hợp pipeline ingest, bias check, validation gate, git sync, tìm kiếm qmd và dashboard Obsidian.
- Mọi câu hỏi đều được lưu lại, tạo vòng lặp compound: càng dùng wiki càng có nhiều ngữ cảnh cho lần truy vấn sau.
llm-wikid là gì và giải quyết vấn đề gì?

llm-wikid là một repository GitHub tạo ra knowledge base do AI duy trì, sống ngay trong Obsidian, dựa trên LLM Wiki pattern của Andrej Karpathy. Nó giải quyết vấn đề ghi chú rời rạc, khó tra cứu: bạn bỏ source thô vào raw, AI đọc, phân loại, viết trang wiki, kiểm tra thiên kiến và cập nhật index.
Thay vì để hàng trăm ghi chú nằm im trong folder, hệ thống này chủ động sắp xếp thành các trang khái niệm, thực thể, nguồn tham khảo, tổng hợp, đầu ra và quy trình. AI agent đọc tất cả tài liệu, tạo [[wikilinks]] giữa các trang và ghi log thay đổi. Repository này về bản chất là một bộ khung có CLAUDE.md đóng vai trò schema điều khiển toàn bộ hành vi của agent. Bạn có thể xem chi tiết tại repository gốc trên GitHub.
Vì sao llm-wikid không dùng RAG như các knowledge base khác?

Vì RAG mỗi lần hỏi lại đi chunk tài liệu và chạy vector search, còn llm-wikid biên dịch kiến thức một lần thành các trang wiki có cấu trúc, giữ chúng cập nhật và dựng sẵn cross-reference. Tác giả repo dẫn nhận định của Karpathy: ở khoảng 100 bài viết và 400K từ, mô hình này cho kết quả Q&A tốt hơn RAG.
Điều này không có nghĩa RAG vô dụng. Với kho tài liệu nhỏ, RAG thường dễ triển khai hơn vì không cần giai đoạn compile. Nhưng nếu bạn muốn các câu trả lời dựa trên một hệ thống wiki đã được tổ chức, có liên kết nguồn và được con người review, hướng tiếp cận của llm-wikid giúp giảm việc tính toán lại toàn bộ ngữ cảnh ở mỗi lần hỏi.
Một điểm tôi đánh giá cao là thiết kế tách bạch: source thô nằm trong raw, kiến thức đã compile nằm trong wiki, log và index được cập nhật sau mỗi vòng ingest. Hệ quả là bạn có thể nhìn thấy quá trình suy nghĩ của hệ thống, không chỉ nhận một đáp án được suy ra tạm thời từ vector search.
Những tính năng nổi bật của llm-wikid

Điểm nổi bật của llm-wikid là pipeline ingest nhiều giai đoạn, các lệnh slash tự động, hot cache, dashboard trực quan, git sync và lớp kiểm soát chất lượng. Thay vì chỉ lưu ghi chú, hệ thống chủ động sắp xếp, liên kết chéo và phản biện nội dung.
Pipeline ingest qua nhiều giai đoạn
Khi bạn chạy /wiki-ingest, agent xử lý mọi thứ trong raw. Đầu tiên, nó phân loại clip từ folder clippings vào đúng chỗ dựa trên URL. Tiếp theo, nó resolve nội dung: YouTube dùng yt-dlp, X/Twitter dùng X API, web dùng scrapling, PDF đọc trực tiếp. Sau đó, nó trích xuất media, phân loại nguồn, viết trang wiki, thêm wikilinks, chạy bias check và cập nhật index.
Giai đoạn 1.5 đáng chú ý: media extraction. Ảnh trong tweet được tải về và phân tích, transcript video được kéo ra. Cách này giúp tránh tình trạng một tweet chỉ có ảnh nhưng không có nội dung chữ.
Các lệnh slash
Repo cung cấp sẵn /wiki-ingest để xử lý nguồn mới, /wiki-query để hỏi, /wiki-explore để chủ động nghiên cứu một chủ đề, /wiki-lint để kiểm tra sức khỏe wiki, /save để lưu hội thoại hiện tại và /autoresearch để chạy vòng lặp nghiên cứu tự động nhiều vòng. Các lệnh này nằm trong .claude/commands và đọc schema từ CLAUDE.md.
Hot cache và dashboard
wiki/hot.md lưu tóm tắt các phiên làm việc gần đây, được tự động chèn ở SessionStart và cập nhật ở Stop. Dashboard dùng Obsidian Bases với bốn góc nhìn: Recent, Low confidence, Unexplored, Stale. Nếu chưa dùng Bases, bạn vẫn có thể dùng Dataview để dựng dashboard tương tự.
Tìm kiếm qmd
qmd của Tobi Lutke là tùy chọn tìm kiếm local trên markdown, hỗ trợ BM25, vector search và hybrid có LLM re-ranking. Khi cài qmd và chạy qmd embed, bạn có thể tìm kiếm nhanh bằng lệnh qmd search, qmd vsearch hoặc qmd query. qmd cũng có MCP server để agent gọi như một tool tự nhiên.
Git sync và tự động hóa
Mỗi thao tác thay đổi wiki hoặc raw đều kết thúc bằng git add, commit và push. Nhờ đó, mọi thay đổi đều có thể revert, nhiều agent có thể làm việc trên cùng repo và bạn truy cập wiki từ bất kỳ đâu. Bạn cũng có thể cấu hình Claude Dispatch bằng cron để chạy /wiki-ingest tự động vào mỗi sáng.
Kiểm soát chất lượng
Mỗi trang khái niệm và nguồn đều có mục Counter-arguments và Data gaps. Mọi trang mới đều có explored: false cho tới khi con người review, kèm confidence level high, medium, low hoặc uncertain. Mỗi claim phải trỏ về một source page cụ thể, còn wikilink phải trỏ tới trang thật hoặc agent phải tạo stub. Đây là lớp bảo hiểm để wiki không biến thành một đống output tự tin.
Hệ sinh thái bổ trợ
Bạn có thể dùng skill last30days để tìm tín hiệu cộng đồng trên Reddit, HN, X, YouTube, GitHub, Polymarket, và Obsidian Web Clipper để đưa nội dung từ trình duyệt vào raw/clippings. Các plugin Obsidian được gợi ý gồm Dataview, Obsidian Git, Templater và Tag Wrangler.
Hướng dẫn cài đặt và sử dụng llm-wikid

Để bắt đầu, bạn clone repository, mở folder trong Obsidian và để một agent đọc CLAUDE.md. File này đóng vai trò schema điều khiển toàn bộ hệ thống, nên bạn không cần cấu hình phức tạp trước khi chạy.
- Clone repo:
git clone https://github.com/shannhk/llm-wikid.git my-wiki - Di chuyển vào thư mục:
cd my-wiki - Mở Obsidian, chọn File > Open Vault và chọn folder my-wiki.
- Chạy agent:
claude --dangerously-skip-permissionshoặc dùng OpenClaw, Hermes, Codex. - Agent đọc CLAUDE.md và tự biết cách xử lý dữ liệu trong repo.
Sau đó, bạn có thể chạy /wiki-ingest để xử lý nguồn đầu tiên, dùng /wiki-query để hỏi, hoặc /wiki-explore để nghiên cứu sâu. Nếu muốn tìm kiếm nhanh, cài qmd bằng npm: npm install -g @tobilu/qmd, chạy qmd collection add wiki --name my-wiki, sau đó chạy qmd embed.
Lưu ý: lệnh –dangerously-skip-permissions có quyền rất mạnh. Bạn chỉ nên chạy trong môi trường kiểm soát và hiểu rõ rủi ro. Nếu không thoải mái, hãy dùng một agent hoặc sandbox có giới hạn quyền phù hợp.
Ai nên dùng llm-wikid — và ai không nên?

Nên dùng khi bạn muốn biến ý tưởng rời rạc thành một wiki dài hạn do AI duy trì và sẵn sàng kiểm duyệt đầu vào. Không nên dùng nếu bạn cần một cơ sở dữ liệu sự kiện chính xác tuyệt đối hoặc không thoải mái cho agent chạy lệnh shell.
llm-wikid phù hợp với nhà sáng tạo nội dung, marketer, nhà nghiên cứu hoặc kỹ sư product đã dùng Obsidian và muốn có một second brain theo kiểu Karpathy. Hệ thống đặc biệt hữu ích nếu bạn thường xuyên clip tweet, bài viết, YouTube, PDF và muốn AI tổng hợp thành wiki. Người dùng quen với Dataview, Templater, Obsidian Git sẽ thấy bộ khung này rất thân thiện.
Ngược lại, bạn nên cân nhắc nếu chỉ cần trả lời nhanh từ một kho tài liệu chưa được tổ chức. Lúc đó RAG có thể đơn giản hơn. Bạn cũng không nên coi đây là nơi lưu trữ fact database: tác giả gọi nó là idea bank, nơi có thể chứa cả ý tưởng sai, mới một nửa hoặc chưa kiểm chứng. Cơ chế explored: false và confidence level buộc con người phải review trước khi tin tưởng hoàn toàn.
Ngoài ra, nếu wiki của bạn vượt quá 500 trang, hướng dẫn trong README gợi ý chuyển sang PostgreSQL hoặc Supabase. Với quy mô nhỏ hơn, file-based kết hợp qmd vẫn đủ nhanh.
Câu hỏi thường gặp
llm-wikid có phải là công cụ RAG không?
Không. llm-wikid không phải RAG. RAG chunk tài liệu và chạy vector search mỗi khi có câu hỏi, còn llm-wikid biên dịch kiến thức một lần thành wiki, cập nhật khi có dữ liệu mới và dựng sẵn liên kết chéo. Theo tác giả, mô hình Karpathy này tốt hơn RAG ở quy mô khoảng 100 bài và 400K từ.
llm-wikid hoạt động với Obsidian như thế nào?
Bạn mở folder chứa repository như một Obsidian vault. Agent đọc CLAUDE.md, xử lý các file trong raw, tạo trang wiki trong wiki và dùng wikilinks để liên kết chéo. Obsidian hiển thị graph view, còn dashboard có thể dùng Bases hoặc Dataview để duyệt nội dung trực quan.
Tôi có cần biết lập trình để dùng llm-wikid không?
Cần tối thiểu quen với terminal vì bạn phải clone repo và chạy agent như Claude Code hoặc OpenClaw. Không cần viết code, nhưng cần hiểu cách agent đọc markdown và chạy lệnh shell. Nếu bạn không dùng terminal thoải mái, repo này có thể gây khó khăn.
llm-wikid có tự xử lý YouTube, tweet và PDF không?
Có, nếu bạn cài các công cụ tùy chọn. YouTube dùng yt-dlp để lấy transcript, tweet dùng X API, web dùng scrapling, PDF đọc trực tiếp hoặc dùng summarize. Một số bước như X API cần OAuth keys trong .env, nên không phải lúc nào agent chạy từ xa cũng xử lý được.
Nội dung trong wiki của llm-wikid có chính xác tuyệt đối không?
Không. Tác giả gọi đây là idea bank chứ không phải fact database. Mỗi trang đều có độ tin cậy high, medium, low hoặc uncertain và cần con người đánh dấu explored: true để xác nhận đã review. Bạn nên dùng /wiki-lint thường xuyên để phát hiện mâu thuẫn và lỗ hổng.
Kết luận
llm-wikid là một bộ khung thú vị cho những ai muốn xây dựng knowledge base dài hạn trong Obsidian bằng AI agent. Thay vì lệ thuộc RAG, bạn có một wiki được biên dịch, liên kết chéo và kiểm soát chất lượng theo thời gian.
Nếu bạn đang tìm cách xây dựng một second brain thực sự, hãy bắt đầu từ repository gốc, clone nó và chạy thử /wiki-ingest với nguồn tài liệu đầu tiên. Bạn sẽ nhanh chóng thấy cách hệ thống sắp xếp, phản biện và biến ghi chú thô thành thứ có thể tra cứu.

