Retrieval Augmented Generation (RAG) là gì? Cách AI chọn trang để trích dẫn

ByNgọc Trai MKT12/07/2026in AI 0
retrieval-augmented-generation-rag-la-gi

Retrieval Augmented Generation (RAG) là một framework quyết định nội dung nào công cụ AI sẽ truy xuất và trích dẫn trước khi tạo ra câu trả lời. Bạn cần hiểu về RAG vì đây là một trong những cách ChatGPT, AI Mode và các công cụ tìm kiếm AI khác chọn trang nào sẽ được đưa vào câu trả lời của chúng. Hướng dẫn này giải thích cách RAG hoạt động (bằng tiếng Việt dễ hiểu), điều gì khiến nội dung có khả năng được truy xuất cao hơn, và cách đo lường khả năng hiển thị của bạn trong các hệ thống AI sử dụng RAG với Ahrefs Brand Radar.

Thank you for reading this post, don't forget to subscribe!

Retrieval augmented generation (RAG) là một kỹ thuật trong đó LLM truy vấn một index – như công cụ tìm kiếm, kiến thức nền hoặc vector database – để tìm thông tin bổ sung, có liên quan đến ngữ cảnh cho phản hồi của nó, thay vì chỉ dựa vào những gì nó học được trong quá trình huấn luyện. Các mô hình ngôn ngữ lớn được huấn luyện trên các bộ dữ liệu khổng lồ, nhưng quá trình huấn luyện đó có ngày giới hạn. Hãy hỏi một mô hình AI về chuyện xảy ra tuần trước, hoặc dữ liệu trong cơ sở dữ liệu sản xuất hiện tại của bạn, bạn đang yêu cầu nó làm việc từ trí nhớ mà không có tài liệu tham khảo nào trước mắt. Khi bạn truy vấn một mô hình AI về thông tin nó chưa có, đó là lúc nó có khả năng ‘nổi loạn’ và bắt đầu bảo bạn rằng chất độc tốt cho sức khỏe…

Minh họa AI bị ảo giác khi không có dữ liệu đúng

Điều này còn được gọi là ‘ảo giác’ (hallucination) của AI. RAG cung cấp cho mô hình AI quyền truy cập vào tài liệu chính xác, cập nhật để tránh số phận đó. Với RAG, LLM bổ sung hoặc ghi đè lên kiến thức nội bộ của chúng – được gọi là ‘bộ nhớ tham số’ – nhằm cố gắng đưa ra câu trả lời đáng tin cậy hơn. Quá trình này đôi khi cũng được gọi là ‘grounding’; neo câu trả lời vào các nguồn cụ thể để mô hình không chỉ tự do ứng biến từ dữ liệu huấn luyện. Ba từ trong RAG tương ứng với ba giai đoạn của quy trình:

  • Truy xuất (Retrieval): Mô hình AI chạy một truy vấn tìm kiếm để tìm (hoặc truy xuất) nội dung liên quan
  • Tăng cường (Augmented): Nó thêm nội dung đã truy xuất vào đầu vào (tăng cường kiến thức của nó)
  • Phát sinh (Generation): Nó sử dụng truy vấn và nội dung đã truy xuất để viết (hoặc phát sinh) một phản hồi

Hầu hết các công cụ AI đều sử dụng đồng thời cả RAG và kiến thức đã được huấn luyện.

Hầu hết các công cụ AI đều có ít nhất hai thứ hoạt động bên dưới ‘nắp capo’: mô hình nền tạo ngôn ngữ từ các mẫu học được trong quá trình huấn luyện. Lớp truy xuất đi tìm kiếm các nguồn để đính kèm.

Dorron Shapow

Việc lọt vào kiến thức của mô hình nền có nghĩa là trở thành một phần dữ liệu huấn luyện của nó, và đó không phải điều bạn dễ dàng kiểm soát. Nhưng việc lọt vào kết quả truy xuất, theo nhiều cách, là một phần mở rộng của SEO.

RAG hoạt động như thế nào?

Mỗi câu trả lời AI được hỗ trợ bởi RAG đều trải qua ba bước: tìm kiếm, truy xuất, phát sinh. Để hiểu chi tiết những gì có thể xảy ra ở mỗi giai đoạn, đây là những gì chúng ta biết về cách ChatGPT truy xuất các nguồn của nó.

Bước 1: AI quyết định có nên chạy tìm kiếm hay không

Trước khi bất cứ thứ gì được truy xuất, AI sẽ quyết định liệu nó có cần làm giàu kiến thức bằng dữ liệu bên ngoài hay không. Các truy vấn tìm kiếm sự thật đơn giản như ‘VPN là gì?’ thường có thể được trả lời bởi mô hình cốt lõi dựa trên kiến thức huấn luyện hiện có. Không cần truy xuất. Trong trường hợp của ChatGPT, một mô hình phân loại nhỏ hơn (một phần của hệ thống ‘sonicberry’ theo David McSweeney, người đã nghiên cứu cách ChatGPT truy xuất nguồn) sẽ chạy trước, gán điểm xác suất để xác định xem một truy vấn cần: không tìm kiếm, tìm kiếm đơn giản, hoặc tìm kiếm phức tạp nhiều bước.

Sơ đồ quyết định tìm kiếm của AI

Các công cụ AI khác sẽ xử lý bước này khác đi, nhưng chúng đều có chung logic cơ bản: không phải mọi truy vấn đều kích hoạt tìm kiếm.

Bước 2: AI chạy tìm kiếm

Bất cứ khi nào ai đó hỏi ChatGPT một câu hỏi cần thêm ngữ cảnh, nó sẽ mở rộng truy vấn đó thành nhiều truy vấn liên quan, sau đó gửi chúng đến một index tìm kiếm bên ngoài như Bing hoặc Google để thu thập kết quả. Quá trình mở rộng đó được gọi là query fan-out (hãy nhớ điều này cho phần sau). Khi một lựa chọn các trang được thu thập, các yếu tố SEO trên trang như tiêu đề, mô tả meta/tóm tắt và URL quyết định trang nào được đọc đầy đủ, theo nghiên cứu của Chuyên gia AI Dan Petrovic.

Ví dụ về quy trình chọn trang để đọc

Từ đó, ông phát hiện ra rằng các nguồn được lọc sẵn để thu thập dựa trên ‘mức độ liên quan, thẩm quyền, độ mới và sự đa dạng về quan điểm’.

Các tiêu chí lọc nguồn

Một số trợ lý AI có ‘làn VIP’ cho một số tên miền nhất định. Chuyên gia AI Jérôme Salomon đã tìm thấy bằng chứng rằng ChatGPT đang xây dựng index tìm kiếm riêng của nội dung được lưu trong bộ nhớ đệm. Nói cách khác, nó không phải lúc nào cũng truy xuất từ các trang kết quả của công cụ tìm kiếm trực tiếp. Ngoài ra, theo nghiên cứu riêng của Mark Williams-Cook, David McSweeney và Suganthan Mohanadasan, ChatGPT được cho là đưa vào nội dung từ một tầng ‘VIP’ riêng biệt, được cấp phép gồm các trang web và nhà xuất bản có thẩm quyền – nhiều trang đã có thỏa thuận nội dung (ví dụ: Reuters, WSJ, Wikipedia). Các trang này được gắn thẻ tên labrador trong các tệp lưu lượng mạng của ChatGPT, và được truy xuất với các trích đoạn gần như toàn bộ bài viết đã được tóm tắt sẵn, thay vì được thu thập và chia nhỏ như tất cả các kết quả khác.

Bước 3: Nội dung được chia thành các đoạn nhỏ – và đoạn khớp nhất sẽ thắng

Trước khi có thể được truy xuất hoàn toàn và phục vụ trong phản hồi, nội dung web đã thu thập được chia thành các phần nhỏ hơn gọi là chunks. Hãy nghĩ về chunking như xé một cuốn sách thành từng chương riêng lẻ. Hệ thống chia trang thành các mảnh, sau đó hỏi mảnh nào trả lời câu hỏi tốt nhất. ChatGPT chuyển đổi truy vấn tìm kiếm và mỗi chunk thành một biểu diễn số của ý nghĩa, được gọi là embedding, sau đó đo cosine similarity – điểm số về mức độ gần gũi về mặt ngữ nghĩa của chúng. Cách đơn giản nhất để hình dung: hãy tưởng tượng một bản đồ khổng lồ nơi các ý tưởng tương tự nằm gần nhau và các ý tưởng không liên quan ở xa nhau. Trên bản đồ này, ‘chó’ và ‘cún con’ sẽ ở gần nhau. ‘Chó’ và ‘ván trượt’ sẽ ở hai đầu đối diện.

Minh họa bản đồ ngữ nghĩa embedding

Embedding giống như tọa độ GPS trên bản đồ đó – mọi đoạn văn bản đều được gán tọa độ dựa trên ý nghĩa của nó. Cosine similarity là thước đo khoảng cách giữa hai bộ tọa độ. AI truy xuất các chunk có tọa độ gần nhất với tọa độ của truy vấn fan-out, và chunk khớp nhất sẽ thắng. Đây là lý do tại sao ngôn ngữ cụ thể, rõ ràng giúp ích cho việc truy xuất – nó dễ dàng ánh xạ đến ‘tọa độ’ vector chính xác hơn.

Bước 4: Nội dung đã truy xuất được nạp vào bộ nhớ làm việc của AI – tạm thời

Các chunk khớp được nạp vào context window của AI – bộ nhớ làm việc ngắn hạn của nó – cùng với câu hỏi gốc của người dùng. Nó tổng hợp một câu trả lời sử dụng cả hai, sau đó xóa các chunk. Dan Petrovic đã thử nghiệm trực tiếp điều này: ông yêu cầu một mô hình AI truy xuất thông tin về một người nổi tiếng, sau đó trong một tin nhắn tiếp theo yêu cầu nó nhớ lại một đoạn cụ thể từ các nguồn. Nó không thể.

Kết quả thử nghiệm cho thấy AI không nhớ được chunk sau khi sinh câu trả lời

Nội dung thô bị ‘xóa sạch’ ngay khi phản hồi được tạo ra.

RAG so với dữ liệu huấn luyện: khác biệt là gì?

RAG và dữ liệu huấn luyện thường bị nhầm lẫn, nhưng chúng làm những việc rất khác nhau. Dữ liệu huấn luyện là thứ xây dựng bộ nhớ tham số của mô hình AI – kiến thức nội bộ mà tôi đã đề cập trước đó. Điều này xảy ra trong quá trình tiền huấn luyện, khi mô hình học từ một kho dữ liệu chung khổng lồ được thu thập từ web và các nguồn khác (ví dụ: CommonCrawl), và có thể xảy ra lại trong quá trình tinh chỉnh, khi mô hình được huấn luyện thêm trên một tập dữ liệu hẹp hơn để thay đổi hành vi hoặc kiến thức. Dù bằng cách nào, kiến thức đó được nướng vào chính mô hình. Không cần tra cứu – nó chỉ là một phần trong những gì mô hình ‘biết’. Nhưng bạn không có tiếng nói trong đó. Nó xảy ra theo lịch trình của nhà phát triển mô hình, sử dụng bất kỳ dữ liệu nào họ chọn để huấn luyện. Đó không phải điều bạn có thể yêu cầu, nhắm mục tiêu hoặc xác minh rằng nó đã xảy ra với nội dung của bạn. RAG mặt khác, là một quy trình bạn có một số quyền kiểm soát. Chất lượng, cấu trúc và khả năng lập chỉ mục của nội dung trực tiếp ảnh hưởng đến việc liệu nó có được truy xuất hay không. Bất cứ khi nào truy vấn của người dùng kích hoạt bước truy xuất, mô hình sẽ kéo thông tin hiện tại từ dữ liệu bên ngoài mà không cần phải được huấn luyện lại. Đối với hầu hết các công cụ AI thương mại, đây là cơ chế đằng sau hầu hết các câu trả lời cập nhật mà chúng đưa ra cho bạn.

RAG Dữ liệu huấn luyện
Cách hoạt động Truy xuất nội dung bên ngoài tại thời điểm truy vấn – không bao giờ trở thành một phần của mô hình Nội dung được hấp thụ vào các tham số của mô hình trong quá trình huấn luyện, trở thành một phần những gì nó ‘biết’ nội bộ
Chi phí cập nhật Thấp. Cập nhật kiến thức nền và câu trả lời tiếp theo của mô hình phản ánh điều đó Cao. Chỉ thay đổi khi mô hình được huấn luyện lại – theo lịch trình của nhà phát triển, không phải của bạn
Bạn có thể ảnh hưởng? Có. Chất lượng nội dung, lập chỉ mục và cấu trúc đều ảnh hưởng đến việc nội dung của bạn có được truy xuất để hiển thị thông tin hiện tại, trích dẫn bạn như một nguồn hoặc đề cập đến thương hiệu cụ thể của bạn hay không Không trực tiếp. Bạn có thể xuất bản nội dung và hy vọng nó được thu thập, nhưng không giống RAG, bạn không thể tối ưu một trang và hy vọng nó được trích dẫn. Điều bạn có thể làm là xây dựng một câu chuyện thương hiệu nhất quán qua đủ nội dung theo thời gian để định hình cách các mô hình tương lai mô tả bạn.

Mọi thứ chúng tôi đề cập trong bài viết này – mở đầu bằng định nghĩa, bao gồm các thực thể, cấu trúc Hỏi & Đáp, độ tươi mới – trực tiếp ảnh hưởng đến quy trình truy xuất. Đó là lớp bạn thực sự có thể tác động thông qua nội dung. Được trích dẫn trong phản hồi AI là một chiến thắng, nhưng nó không giống với việc được nướng vào những gì AI cơ bản biết về thương hiệu của bạn. Chuyên gia Tối ưu hóa Người dùng Tìm kiếm Dorron Shapow nói rất đúng: ‘Tối ưu hóa cho truy xuất không sai. Trong các hệ thống phụ thuộc nhiều vào tìm kiếm trực tiếp cho các truy vấn thương mại, nó chắc chắn có thể ảnh hưởng đến những gì được đưa lên bề mặt. Nhưng cho rằng khả năng hiển thị truy xuất giống như trọng số mô hình nền là nơi chiến lược thất bại. Một việc mất vài tuần. Việc còn lại là công việc chậm rãi của sự nhất quán thực thể – thương hiệu của bạn được hiểu một cách nhất quán và rõ ràng trên toàn bộ web như thế nào – và nó mất nhiều năm.’

Dorron Shapow

Query Fan-Out là gì?

Query fan-out là quy trình diễn ra đằng sau hậu trường khi bạn gửi một truy vấn đến hệ thống AI. Thay vì tìm kiếm chính xác từ bạn nhập, nó chia câu hỏi của bạn thành nhiều truy vấn phụ liên quan, chạy từng truy vấn riêng biệt và kéo nguồn từ các kết quả kết hợp. Giả sử ai đó tìm kiếm ‘Điều gì sẽ xảy ra nếu tôi thay bột mì thường bằng bột mì nguyên cám trong bánh chanh?’ trong Google, mô hình AI tìm kiếm bên dưới sẽ không chỉ tìm kiếm cụm từ đó, nó cũng có thể tra cứu: Bột mì tốt nhất cho bánh chanh; Mẹo nướng bánh với bột mì nguyên cám; Bột mì nguyên cám ảnh hưởng đến độ đặc của bánh như thế nào? Trước khi tổng hợp câu trả lời.

Minh họa query fan-out thành nhiều truy vấn phụ

AI tự động làm điều tương tự với hầu hết các truy vấn phức tạp. Một số SEO đã có thể trích xuất trực tiếp các truy vấn phụ nội bộ này. Ví dụ, Metehan Yeşilyurt đã phát triển một kỹ thuật để yêu cầu Google AI Mode xuất ra các truy vấn tìm kiếm mà nó đã sử dụng để grounding.

Ảnh chụp màn hình truy vấn fan-out từ Google AI Mode

Nhưng nếu bạn không có thời gian để đào sâu, bạn cũng có thể thấy các truy vấn fan-out được tạo ra bởi ChatGPT, Grok và Perplexity trong báo cáo AI Responses trong Ahrefs Brand Radar.

Báo cáo AI Responses trong Ahrefs Brand Radar hiển thị truy vấn fan-out

Trong quá trình query fan-out, AI chia câu hỏi của bạn thành các truy vấn phụ nhỏ hơn, tìm kiếm tất cả cùng một lúc, kết hợp và xếp hạng lại kết quả, sau đó hợp nhất các trang hoạt động tốt trên nhiều tìm kiếm thành một danh sách cuối cùng. Danh sách đó là những gì AI thực sự đọc để viết câu trả lời của bạn.

Sơ đồ quy trình kết hợp và xếp hạng lại kết quả fan-out

Chúng tôi đã đơn giản hóa quy trình fan-out ở đây để dễ hiểu, nhưng để tìm hiểu sâu hơn, hãy đọc hướng dẫn của chúng tôi: ‘Query Fan-Out là gì? Hiểu về các truy vấn ẩn đang thúc đẩy AI Search’.

Tại sao RAG khiến SEO vẫn quan trọng

Đối với ChatGPT và các công cụ tìm kiếm AI khác, Retrieval Augmented Generation chạy trên SEO. Trên thực tế, nhiều nhà tiếp thị và SEO coi AI search là một ‘lớp bọc’ bên trên các công cụ tìm kiếm ‘truyền thống’ như Google, vì một số trợ lý AI phụ thuộc rất nhiều vào chúng.

Biểu đồ cho thấy các công cụ AI dựa vào công cụ tìm kiếm nào

Khi ChatGPT, Perplexity hoặc Google AI Overviews cần trả lời một câu hỏi, chúng chạy các tìm kiếm web thực sự. Google Gemini và AI Overviews sử dụng Google Search. Microsoft Copilot sử dụng Bing. ChatGPT kéo từ cả Google và Bing. Claude sử dụng Brave Search.

Trợ lý AI Index/crawler tìm kiếm chính thức Index/crawler tìm kiếm nghi ngờ Index/crawler tìm kiếm nghi ngờ trong tương lai
ChatGPT Bing (OpenAI Help Center) Google Search (ZDNET) Index riêng (Leaked memo)
Gemini Google Search (Google AI Devs) Google Knowledge Graph (Google Dev Docs)
Perplexity PerplexityBot / index riêng (Perplexity docs) Third-party crawlers không được tiết lộ (Fast Company)
và Google Search (SEL)
Copilot Bing (Microsoft Support)
Claude Brave Search (Anthropic Trust Center
→ được Simon Willison ghi nhận)

Điều đó có nghĩa là lớp truy xuất của mọi công cụ AI lớn đều được hỗ trợ bởi một công cụ tìm kiếm truyền thống.

  • Nội dung được lập chỉ mục là hồ khởi đầu. Bạn cần nội dung của mình xuất hiện trên Google trước khi nó xuất hiện trong AI.
  • Nội dung được tối ưu hóa tìm kiếm giúp bạn được trích dẫn: Ngay cả khi kết quả tìm kiếm và AI không phải lúc nào cũng chồng lấn một cách gọn gàng, cả hai đều ưu tiên nội dung có thẩm quyền, có cấu trúc tốt và được tối ưu hóa tốt.
  • Đề cập thương hiệu trong tìm kiếm tương quan mạnh với khả năng hiển thị AI: Hệ thống AI nhận biết tần suất và vị trí thương hiệu của bạn được tham chiếu trên toàn bộ web – nội dung được tối ưu hóa tìm kiếm và PR kỹ thuật số trực tiếp nuôi dưỡng điều này.

Bất chấp một số khác biệt, SEO và GEO có mối liên kết nội tại. Nếu nội dung của bạn không xuất hiện trong index tìm kiếm, bot AI sẽ khó tìm thấy nó, và nếu không tìm thấy, nó không thể truy xuất.

Cách tối ưu nội dung của bạn cho RAG

Hãy làm theo bảy mẹo thực hành tốt nhất này nếu bạn muốn nội dung của mình được trích dẫn trong RAG search.

Đảm bảo nội dung có thể truy cập được bởi AI crawlers

Khi đi tìm nội dung, nhiều AI crawler không thể đọc và trích dẫn một số trang nhất định. Nội dung JavaScript (như tab hoặc accordion) hoặc văn bản trong hình ảnh thường không thể truy cập được đối với bot AI. Thay vào đó, hệ thống AI truy xuất nội dung HTML tĩnh.

Bài đăng LinkedIn của Daniel Foley Carter về vấn đề truy cập nội dung JavaScript

Đây là những gì xảy ra khi một trang chứa JavaScript. Suganthan Mohanadasan gần đây đã khai thác các tệp mạng của hàng chục cuộc trò chuyện ChatGPT và nghiên cứu quy trình chuỗi suy nghĩ của mô hình, nơi nó mô tả cách nó lấy thông tin bằng ngôn ngữ dễ hiểu. Đối với một truy vấn B2B SaaS có liên quan, ChatGPT đã định vị được giá chính thức của Ahrefs nhưng gặp khó khăn khi tìm giá của Profound và Peec, lý do là thông tin này bị ẩn trong JavaScript.

Ảnh chụp màn hình ChatGPT giải thích lý do không tìm được giá vì JavaScript

ChatGPT đã chuyển sang các nguồn của bên thứ ba như G2 vì ‘trang chính thức khó phân tích và không hiển thị giá’.

Ảnh chụp màn hình ChatGPT trích dẫn G2 thay vì trang chính thức

Bài học rút ra: nếu bạn muốn thông tin quan trọng nhất của mình – như giá cả – được thể hiện chính xác trong AI search, nội dung của bạn lý tưởng nhất nên được phục vụ qua HTML, không phải JavaScript. Lưu ý: có một giải thích khả dĩ khác: một số công ty không công bố giá của họ. Điều này khiến AI phải ghép thông tin còn thiếu từ các nguồn khác. Ngay cả khi bạn không công bố giá, các mô hình AI sẽ công bố, và chúng không phải lúc nào cũng đúng.

JavaScript không phải là cách duy nhất để khóa crawler – bạn cũng cần tránh chặn AI crawlers (như OAI_SearchBot) trong tệp robots.txt và quy tắc tường lửa nếu bạn muốn được trích dẫn thông qua truy xuất. Nếu bạn sử dụng Cloudflare, bạn có thể theo dõi cách bot AI thu thập dữ liệu trang web của bạn – bao gồm trang nào chúng truy cập thường xuyên nhất và trang nào chúng bỏ lỡ – qua Ahrefs Bot Analytics.

Giao diện Ahrefs Bot Analytics hiển thị hoạt động của bot AI

Cảnh báo CDN chặn AI và crawler đa năng: Kiểm tra cài đặt thu thập dữ liệu mặc định của Mạng phân phối nội dung (CDN) để đảm bảo bạn không vô tình chặn nội dung của mình khỏi bị truy xuất. Ví dụ: Cloudflare chặn tất cả AI crawlers theo mặc định, điều này có thể hạn chế khả năng hiển thị trang web của bạn trên các giao diện như ChatGPT, Claude và Gemini. Quan trọng hơn, nó cũng có thể chặn các crawler đa năng kết hợp huấn luyện AI và khả năng hiển thị trên công cụ tìm kiếm, như GooglebotBingBot.

Bài đăng LinkedIn của Suganthan Mohanadasan và những người khác về việc Cloudflare chặn bot AI

Dẫn đầu bằng thông tin tốt nhất của bạn

AI chú ý nhiều nhất đến phần đầu trang của bạn, nhưng sự chú ý giảm dần đều từ đó. Theo nghiên cứu của Kevin Indig trên 1,2 triệu trích dẫn ChatGPT, 30% đầu tiên của nội dung trang tạo ra 44,2% tổng số trích dẫn. Một phần ba giữa tạo ra 31,1%, và một phần ba cuối: chỉ 24,7%.

Biểu đồ phân bố trích dẫn theo vị trí nội dung

Thông tin quan trọng nhất của bạn – định nghĩa, tuyên bố chính, dữ liệu độc đáo – cần phải ở trên cùng của nội dung. Điều này ngược lại với cách tiếp cận truyền thống ‘giữ điều tốt nhất cho cuối cùng’. Trong nội dung được tối ưu hóa cho trích dẫn AI, punchline được đặt lên đầu. Điều này được gọi là phục vụ Bottom Line Up Front (BLUF). Trả lời truy vấn ngay lập tức trong câu đầu tiên bên dưới tiêu đề phụ – đừng chôn câu trả lời hai đoạn sau. Điều này phản ánh trực tiếp cách hệ thống RAG khớp nội dung với truy vấn – nhưng cũng là cách người dùng đọc, vì vậy bạn đang đáp ứng cả con người và bot!

Dữ liệu theo dõi mắt cho thấy sự chú ý tập trung ở đầu trang

Dữ liệu theo dõi mắt này cho thấy người đọc tập trung nhiều sự chú ý nhất ở đầu trang và quét ngày càng ít khi họ di chuyển xuống dưới, vì vậy nếu thông điệp chính của bạn bị chôn vùi ở đoạn ba, hầu hết người đọc không bao giờ thực sự nhìn thấy nó – do đó, ‘bottom line up front’.

Tối ưu hóa cho các chủ đề fan-out

Để xuất hiện trong kết quả fan-out mà hệ thống AI dựa vào, sẽ hữu ích khi tạo cụm chủ đề – các câu hỏi liên quan, định nghĩa, so sánh và chủ đề phụ mà AI có thể tìm kiếm trong khi chuẩn bị câu trả lời. Nếu bạn đang tìm kiếm manh mối về các chủ đề phụ đó có thể là gì, hãy khai thác các hộp ‘People also ask’ và các truy vấn ‘People also search for’ ở cuối Google.

Hộp People also ask trên Google

Kết quả People also search for trên Google

Chúng phản ánh các câu hỏi và góc nhìn được hỏi nhiều nhất xung quanh chủ đề của bạn, thường tương tự như các truy vấn mà AI tạo ra trong fan-out. Mẹo: Hãy xem tab Questions trong Ahrefs Keywords Explorer để tìm các truy vấn liên quan đang được hỏi xung quanh chủ đề của bạn và lập bản đồ một cụm chủ đề.

Tab Questions trong Ahrefs Keywords Explorer

Nếu bạn không bao gồm các chủ đề phụ cụ thể, bạn sẽ vô hình trong một phần đáng kể của kết quả tìm kiếm truy vấn fan-out.

Tối ưu hóa tốc độ trang của bạn

Trang chậm là tin xấu trong bất kỳ công cụ tìm kiếm nào, nhưng trong AI search, chi phí còn cao hơn. Trong phân tích của ông về cách ChatGPT hoạt động, Chuyên gia tư vấn SEO David McSweeney lưu ý rằng ChatGPT dường như tìm nạp các trang gốc với thời gian chờ cứng khoảng hai giây: nếu máy chủ của bạn chậm, trang của bạn bị cắt, và ngay cả khi nó phản hồi kịp thời, thời gian đến byte đầu tiên (TTFB) cao có nghĩa là nội dung của bạn bị cắt ngắn. TTFB dưới 1 giây: bạn có thể ổn. Toàn bộ trang của bạn có thời gian để tải, được chia nhỏ và đưa vào mô hình. TTFB trên 1 giây: bạn đang đánh bạc. Kết nối có thể bị cắt giữa chừng – đôi khi sớm đến mức chỉ có thẻ <head> của bạn vượt qua, nghĩa là mô hình chưa bao giờ thấy nội dung thực tế của bạn. Tốc độ quyết định liệu bạn có lọt vào context window của mô hình hay không. Kiểm tra thời gian đến byte đầu tiên trong Site Audit.

  1. Đi đến báo cáo Performance
  2. Tìm biểu đồ ‘Time to first byte distribution’
  3. Nhấp vào ‘Medium: 200–300 ms’ để xem các cơ hội tối ưu nhanh

Biểu đồ phân bố TTFB trong Site Audit

Sau đó sắp xếp theo organic traffic để tìm nội dung quan trọng nhất của bạn có thể cần được tối ưu hóa.

Sắp xếp nội dung theo organic traffic

Nếu máy chủ của bạn quá chậm, trang của bạn có thể không bao giờ lọt vào câu trả lời AI – nhưng trong một số trường hợp, bạn sẽ không bao giờ biết, bởi vì khách truy cập (trong trường hợp này là bot) chỉ đơn giản là bỏ cuộc và rời đi. Jan-Willem Bobbink tìm kiếm các trường hợp này bằng cách xác định mã trạng thái HTTP 499 trong nhật ký máy chủ của mình. Mã trạng thái 499 có nghĩa là máy khách đã đóng kết nối trước khi máy chủ phản hồi xong. Đây là một tín hiệu rõ ràng khác rằng trang của bạn quá chậm đối với việc truy xuất AI.

Tạo nội dung sâu, dẫn dắt bằng thực thể

Nội dung được trích dẫn thường xuyên nhất qua RAG search có mật độ thực thể khoảng 20,6%. Nghĩa là 20,6% số từ của nó là danh từ riêng – các công cụ, thương hiệu, con người, công ty, nghiên cứu được đặt tên – so với 5-8% trong nội dung ‘trung bình’. Một thực thể là bất kỳ thứ gì được đặt tên cụ thể. Ví dụ: ‘Một công cụ SEO’ không phải là thực thể – nhưng ‘Ahrefs’ thì có. Càng bao gồm nhiều thực thể được đặt tên, nội dung của bạn càng có nhiều điểm neo trên bản đồ ý nghĩa – khiến nó có thể truy xuất được cho nhiều truy vấn liên quan hơn. Nhưng bạn sẽ không giành được trích dẫn bằng cách ‘nhồi nhét thực thể’ một cách ngẫu nhiên. Nội dung của bạn và các thực thể của nó, cần phải liên quan đến truy vấn của người dùng.

Đây là một lý do khác tại sao thực thể quan trọng. Các truy vấn fan-out thường sử dụng kỹ thuật ‘đám mây từ đồng nghĩa’ để định hướng truy xuất đến các góc nhìn và thực thể cụ thể, và cuối cùng là khớp tốt hơn với ý định của truy vấn gốc của người dùng.

Ví dụ về kỹ thuật synonym cloud trong fan-out

Ví dụ: mô hình frontier của ChatGPT có thể biến đổi một truy vấn như ’10 đôi giày chạy bộ tốt nhất là gì?’ thành các truy vấn fan-out giàu từ đồng nghĩa như: giày chạy bộ tốt nhất 2026; đánh giá giày chạy bộ; lựa chọn hàng đầu; giải thưởng. Để đẩy embedding về phía ý định ‘best of’, như được thấy bên dưới qua Brand Radar.

Brand Radar hiển thị các truy vấn fan-out cho giày chạy bộ

Vậy điều này có nghĩa là gì đối với nội dung của bạn? Để diễn giải David McSweeney: Các trang chung chung đề cập đến mọi thứ đạt điểm ổn trên toàn bộ. Nhưng các trang chuyên biệt đi sâu vào một góc nhìn sẽ thắng góc nhìn đó hoàn toàn. Do đó, việc được trích dẫn là về việc neo nội dung của bạn vào các thực thể cụ thể. Bao gồm các thực thể truy vấn fan-out trong tiêu đề trang của bạn. Nghiên cứu của chúng tôi trên 1,4 triệu prompt ChatGPT cho thấy các trang được trích dẫn có tiêu đề tương tự về mặt ngữ nghĩa với các truy vấn fan-out nội bộ của ChatGPT hơn so với các trang bị bỏ qua.

Biểu đồ tương quan giữa tiêu đề và truy vấn fan-out

Brand Radar hiển thị các truy vấn fan-out đằng sau bất kỳ prompt nào, vì vậy bạn có thể kiểm tra xem các thực thể tiêu đề của mình có khớp với các thực thể fan-out hay không.

Brand Radar hiển thị truy vấn fan-out cho prompt cụ thể

Đây là một cách thực tế để làm giàu nội dung của bạn với các thực thể: xem qua danh mục cũ của bạn và thay thế các thuật ngữ chung chung bằng các thuật ngữ cụ thể. Thay đổi: ‘Một công cụ tìm kiếm’ → ‘Google’; ‘Nghiên cứu cho thấy’ → ‘Một nghiên cứu năm 2024 từ Đại học Waseda phát hiện’; ‘Một trợ lý AI’ → ‘ChatGPT’ hoặc ‘Perplexity’. Bạn có thể xác minh công việc của mình bằng Google Natural Language API. Phiên bản demo miễn phí hiển thị cho bạn mọi thực thể mà Google phát hiện trên trang của bạn và danh mục mà nó đã gán cho nội dung của bạn.

Kết quả Google Natural Language API hiển thị thực thể và danh mục

Nếu bạn trả phí để truy cập đầy đủ, bạn cũng sẽ nhận được điểm salience – một giá trị cho mức độ nổi bật và quan trọng mà Google cho rằng một thực thể đối với trang của bạn. Chạy API trên trang của bạn, sau đó chạy nó trên trang xếp hạng hàng đầu cho từ khóa mục tiêu của bạn. Khoảng cách giữa hai đầu ra đó cung cấp cho bạn danh sách kiểm tra tối ưu hóa thực thể: sự giao thoa thực thể, khoảng trống thực thể, điểm salience (cao hơn khi chủ đề được đặt tên sớm hơn và nổi bật hơn), sự giao thoa danh mục, khoảng trống danh mục. Ngoài ra, hãy chạy bản nháp của bạn qua Ahrefs AI Content Helper. Nó đánh giá nội dung của bạn so với các đối thủ cạnh tranh hàng đầu cho từ khóa mục tiêu của bạn và làm nổi bật các chủ đề họ đề cập mà bạn đang thiếu – hữu ích để bắt các khoảng trống chủ đề có thể khiến bạn vô hình trong kết quả fan-out.

Thêm thông tin gia tăng – nói điều mà mô hình chưa biết

Phạm vi thực thể giúp bạn được truy xuất, nhưng có một điều xảy ra trước đó: nội dung của bạn có đủ điều kiện để được truy xuất ngay từ đầu không? Một prompt hệ thống Claude bị rò rỉ tiết lộ rằng các hệ thống AI như Claude có lệnh never_search cho các truy vấn về thông tin ‘vượt thời gian hoặc ổn định’.

Prompt hệ thống Claude bị rò rỉ cho thấy lệnh never_search

Claude trả lời các câu hỏi never_search chỉ từ dữ liệu huấn luyện, và không đi tìm các URL bên ngoài để trích dẫn. Chuyên gia tư vấn tăng trưởng Gaetano DiNardi cho rằng các LLM khác có thể đang tuân theo cùng một logic. Theo lời của ông: ‘giá trị của việc xuất bản các trang về kiến thức tổng quát là bằng không.’ Đây là vấn đề thông tin gia tăng. Hãy nghĩ về mọi thứ mà mô hình đã biết như là văn hóa chung – phiên bản trung bình, đồng thuận của một chủ đề đã được lập chỉ mục hàng nghìn lần. Nếu nội dung của bạn chỉ lặp lại điều đó, bạn là dư thừa đối với framework RAG – một mô hình AI không có gì để đạt được khi trích dẫn bạn. Những gì nó làm trích dẫn là nội dung thêm điều gì đó mới: dữ liệu độc quyền, một lý thuyết được đặt tên, một phát hiện cụ thể từ một nghiên cứu, một kết luận mà mô hình không thể tổng hợp từ kiến thức nền hiện có. Nhà nghiên cứu OpenAI Karthik Narasimhan đã công bố một bài báo về Generative Engine Optimization cung cấp thêm bằng chứng cho điều này. Cùng với các đồng nghiệp tại Đại học Princeton, ông đã nghiên cứu những kỹ thuật nào có khả năng tăng khả năng hiển thị trong các hệ thống AI RAG như Perplexity nhất. Phát hiện của họ cho thấy các trang web có thông tin độc đáo như trích dẫn và thống kê được tham chiếu thường xuyên nhất; thấy mức tăng khả năng hiển thị 30-40% trong các phản hồi AI.

Phương pháp LLMO được thử nghiệm Số từ điều chỉnh theo vị trí (khả năng hiển thị) 👇 Ấn tượng chủ quan (mức độ liên quan, tiềm năng nhấp chuột)
Trích dẫn 27.2 24.7
Thống kê 25.2 23.7
Lưu loát 24.7 21.9
Trích dẫn nguồn 24.6 21.9
Thuật ngữ kỹ thuật 22.7 21.4
Dễ hiểu 22 20.5
Có thẩm quyền 21.3 22.9
Từ độc đáo 20.5 20.4
Không tối ưu hóa 19.3 19.3
Nhồi nhét từ khóa 17.7 20.2

Kevin Indig cũng phát hiện ra rằng ngày thángsố là các loại thực thể dự đoán trích dẫn ChatGPT nhiều nhất.

Biểu đồ cho thấy ngày tháng và số là thực thể dự đoán trích dẫn nhất

Và Eric Lancheres đã nghiên cứu 150 trang xếp hạng và thấy rằng yếu tố dự đoán xếp hạng lớn nhất là số lượng điểm dữ liệu độc đáo của chúng.

Biểu đồ tương quan giữa điểm dữ liệu độc đáo và thứ hạng

Việc nội dung của bạn được truy xuất là vấn đề đưa ra thông tin mới mẻ và dữ liệu độc đáo, không phải lặp lại những gì các trang khác đã đề cập.

Bao gồm cấu trúc câu hỏi và câu trả lời

Nội dung được cấu trúc như câu hỏi → câu trả lời ngay lập tức được trích dẫn thường xuyên gấp đôi so với nội dung không tuân theo quy ước này (18% so với 8,9%), theo dữ liệu của Kevin Indig. Đây là một ví dụ khác của BLUF trong hành động. Các mô hình AI cố gắng khớp các truy vấn của người dùng (hầu như luôn là câu hỏi) với một chunk trả lời nó.

Biểu đồ tần suất trích dẫn theo cấu trúc Q&A

Theo lời của Suganthan Mohanadansan: ‘Trích dẫn gắn với một câu cụ thể, không phải toàn bộ câu trả lời, vì vậy chỉ có liên quan theo chủ đề là không đủ, bạn phải là sự hỗ trợ tốt nhất cho một tuyên bố chính xác.’ Định dạng nội dung của bạn dưới dạng Hỏi & Đáp có thể giúp các mô hình AI như ChatGPT thực hiện một kết nối trực tiếp, rõ ràng. Mohanadasan cũng phát hiện ra rằng ChatGPT khử trùng lặp kết quả theo tên miền, vì vậy 20 trang mỏng trên trang web của bạn không cộng lại thành 20 cơ hội trích dẫn. ChatGPT chọn trang duy nhất khớp nhất với truy vấn ban đầu của người dùng và các truy vấn phụ fan-out. Hãy đặt câu trả lời mạnh nhất của bạn vào trang đó, không trải dài trên tất cả 20 trang. Mẹo: Theo lời của Eli Schwartz: ‘Đại đa số các trang được xem xét và bị từ chối trước khi câu trả lời được viết.’ Trong Brand Radar, bạn có thể lọc các trích dẫn theo ‘Found but not cited’ để xem mọi phản hồi nơi trang của bạn được kéo vào bộ truy xuất của ChatGPT và sau đó bị bỏ qua để lấy trang khác.

Bộ lọc Found but not cited trong Brand Radar

Nghiên cứu các trang đã được trích dẫn và điều chỉnh nội dung của bạn để tăng cơ hội trích dẫn.

Giữ nội dung tươi mới

Các hệ thống RAG search có xu hướng ưa chuộng nội dung hiện tại. Chúng tôi đã thực hiện một nghiên cứu trên 17 triệu trích dẫn và phát hiện ra rằng các trợ lý AI luôn ưa thích trích dẫn nội dung tươi mới hơn so với các công cụ tìm kiếm. Các URL được trợ lý AI trích dẫn tươi mới hơn trung bình 25,7% so với các URL trong SERP hữu cơ tiêu chuẩn – và ChatGPT và Perplexity thực sự sắp xếp các trích dẫn của chúng từ mới nhất đến cũ nhất.

Biểu đồ so sánh độ tươi mới của URL được AI trích dẫn so với SERP

Nhưng đừng chỉ tin lời chúng tôi. Độ tươi mới là một tín hiệu đã được xác nhận, được ghi nhận trong truy xuất AI. Nghiên cứu của Metehan Yeşilyurt đã xác nhận điều này. Ông phát hiện ra rằng ChatGPT có một cài đặt cấu hình gọi là use_freshness_scoring_profile: true, nướng vào một thiên vị về độ mới một cách có hệ thống. Vì vậy, nội dung của bạn có cơ hội tốt hơn nhiều để được truy xuất và cuối cùng được trích dẫn nếu bạn cập nhật các trang chính của mình thường xuyên. Ngay cả những cập nhật nhỏ cũng có thể đặt lại tín hiệu độ tươi mới. Làm mới các số liệu thống kê và ví dụ hàng năm và thêm ngày ‘cập nhật lần cuối’ có thể nhìn thấy. Lưu ý: Một điều cần nhớ với RAG là các mô hình AI thường truy xuất phiên bản lưu trong bộ nhớ đệm của các trang thay vì trang trực tiếp. Vì vậy, nếu bạn cập nhật nội dung của mình hôm qua, AI vẫn có thể đang đọc một phiên bản cũ hơn từ bộ nhớ đệm của index tìm kiếm.

Cách theo dõi khả năng hiển thị của bạn trong RAG với Ahrefs Brand Radar

Tối ưu hóa nội dung của bạn cho RAG là rất quan trọng, nhưng bạn cần biết liệu nó có hiệu quả không. Ahrefs Brand Radar được xây dựng để giúp các thương hiệu theo dõi khả năng hiển thị của họ trong các kết quả AI được hỗ trợ bởi truy xuất. Đây là cách tôi đề xuất sử dụng nó để cải thiện khả năng hiển thị của bạn trong RAG.

Theo dõi khả năng hiển thị cơ bản của bạn

Trước khi thay đổi bất cứ điều gì, hãy tìm hiểu vị trí thực tế của bạn. Tìm kiếm thương hiệu của bạn trong Brand Radar để xem tần suất bạn xuất hiện trong các câu trả lời AI cho các chủ đề mục tiêu của mình và nền tảng nào đang trích dẫn bạn.

Giao diện tổng quan Brand Radar

Nếu số lần đề cập thấp hoặc không có, hãy xem ai đang được trích dẫn thay thế.

Tìm ra nền tảng AI nào đang trích dẫn bạn (và nền tảng nào không)

Các nền tảng AI khác nhau có kiến trúc truy xuất khác nhau với các thiên vị khác nhau đối với độ tươi mới, thẩm quyền và cấu trúc. Bảng phân tích nền tảng của Brand Radar có thể tiết lộ các khoảng trống như ‘AI Mode trích dẫn chúng tôi thường xuyên, nhưng chúng tôi thiếu khả năng hiển thị trong Perplexity.’

Bảng phân tích nền tảng trong Brand Radar

Nếu trang web của bạn hoạt động kém chỉ trên một nền tảng, vấn đề có thể là do cách nền tảng đó đánh giá nó – không phải bản thân nội dung. Ví dụ: nếu một trang xếp hạng tốt trên Google nhưng không tốt trên Bing, chúng tôi sẽ coi đó là tín hiệu cụ thể của Bing (như liên kết, thực thể hoặc lập chỉ mục) chứ không phải là trang có chất lượng thấp nói chung – điều tương tự cũng đúng với khả năng hiển thị AI.

Khám phá các truy vấn nào đang kích hoạt trích dẫn của bạn

Nhìn thấy các truy vấn chính xác dẫn đến trích dẫn cho bạn biết điều gì đang hiệu quả và đánh dấu các truy vấn liên quan nơi bạn chưa xuất hiện. Do query fan-out, bạn có thể đã được trích dẫn cho các truy vấn mà bạn không bao giờ nghĩ đến để nhắm mục tiêu.

Danh sách các truy vấn kích hoạt trích dẫn trong Brand Radar

Cơ sở dữ liệu của Brand Radar chứa hàng triệu truy vấn hiện có, nghĩa là bạn có thể tình cờ tìm thấy các cơ hội nội dung mới mà bạn không biết là tồn tại.

Theo dõi xem các bản cập nhật nội dung có thay đổi tỷ lệ trích dẫn của bạn không

Khi bạn đã thực hiện các thay đổi để tối ưu hóa nội dung của mình cho việc truy xuất – áp dụng BLUF, nhắm mục tiêu các truy vấn fan-out, kết hợp số liệu thống kê – hãy theo dõi Brand Radar để xem liệu các trích dẫn của bạn có tăng lên trong những tuần tiếp theo hay không.

Biểu đồ theo dõi trích dẫn theo thời gian trong Brand Radar

Điều này cho phép bạn xây dựng một vòng lặp phản hồi: tối ưu hóa → xuất bản → đo lường → lặp lại. Cùng một loại phương pháp luận hiệu quả cho việc theo dõi thứ hạng hữu cơ cũng áp dụng cho việc theo dõi trích dẫn AI.

So sánh với đối thủ cạnh tranh

Tìm hiểu đối thủ cạnh tranh nào của bạn đang được AI trích dẫn một cách nhất quán cho các truy vấn bạn quan tâm, sau đó phân tích cấu trúc và nội dung của các trang được trích dẫn nhiều nhất của họ. Chỉ cần thêm bộ lọc ‘Your brand: Not mentioned’ và ‘Your brand: Found but not cited’ vào báo cáo AI Responses hoặc Cited Pages trong Brand Radar.

Bộ lọc thương hiệu trong Brand Radar

Điều này sẽ hiển thị cho bạn các chủ đề và thảo luận của bên thứ ba mà thương hiệu của bạn có xu hướng bị bỏ qua. Sau đó, chỉ là vấn đề kỹ thuật đảo ngược các bước đi của đối thủ để thu hẹp khoảng cách.

Lời kết

RAG là cầu nối giữa tìm kiếm và AI. Nó tuân theo các quy tắc có thể dự đoán được, thúc đẩy các trang mà nó có thể truy cập, tìm nạp nhanh và khớp chủ đề trực tiếp để đưa ra câu trả lời tốt nhất có thể. Theo dõi khả năng hiển thị AI của bạn với Ahrefs Brand Radar để xem liệu nội dung của bạn có xuất hiện trên ChatGPT, Perplexity, Google AI Overviews và các công cụ khác mà khán giả của bạn thực sự sử dụng hay không. Có câu hỏi? Hãy gửi tin nhắn cho tôi trên LinkedIn.

Bài viết được biên dịch và tổng hợp từ bài gốc.

Related Posts