ChatGPT lấy nguồn nào khi người Việt hỏi về dịch vụ?
Thử nghiệm 45 câu hỏi tiếng Việt: ChatGPT thường lộ ra những loại nguồn nào khi trả lời về dịch vụ?
Trong quá trình làm các bài kiểm tra về AI Visibility, tôi thường gặp một câu hỏi khá cơ bản nhưng khó trả lời bằng cảm giác:
Khi người dùng Việt Nam hỏi ChatGPT về một dịch vụ hoặc một lựa chọn mua hàng, hệ thống thường lộ ra những loại nguồn nào?
Tôi không muốn trả lời câu này bằng một vài ảnh chụp màn hình rời rạc, nên ngày 30/09/2026 tôi thực hiện một thử nghiệm nhỏ với 45 câu hỏi tiếng Việt đã được chốt trước.
Mục tiêu không phải tìm ra “công thức để được ChatGPT ưu tiên”, mà đơn giản hơn: quan sát tập nguồn xuất hiện trong source trace và xem chúng thuộc những nhóm nào.
Tôi đã đo như thế nào?
Bộ thử nghiệm gồm 45 câu hỏi, chia đều cho 5 nhóm: travel/hotel, local services, B2B/professional services, ecommerce/consumer và marketing/software.
Mỗi nhóm có 9 câu hỏi, gồm ba loại intent: tìm thông tin, so sánh và tìm nhà cung cấp.
Tất cả câu hỏi được viết bằng tiếng Việt và được giữ nguyên trước khi chạy. Tôi không chèn tên Ghim AI hoặc một domain mục tiêu vào prompt.
Sau 45 lượt kiểm tra trên ChatGPT, tôi ghi nhận 263 source rows từ 203 domain khác nhau.
Tôi cũng review thủ công 30/263 source rows, tương đương 11,4% tập dữ liệu, trải đều trên cả 5 nhóm.
Mỗi source row được phân loại thành một trong các nhóm như nguồn chính thức, website nhà cung cấp, editorial, directory/review, community hoặc original research.
Có một điểm cần làm rõ ngay từ đầu:
Source trace không đồng nghĩa citation trong câu trả lời cuối cùng.
Một website xuất hiện trong lớp source/search chỉ cho thấy nó đã được lộ ra trong quá trình truy vấn mà tôi quan sát được.
Từ đó chưa thể kết luận rằng ChatGPT đã dùng nguồn đó để tạo câu trả lời, trích dẫn nó, nhắc đến thương hiệu hay đề xuất thương hiệu.
Đây là ranh giới quan trọng nếu muốn đo AI Search một cách nghiêm túc.
Website nhà cung cấp là nhóm xuất hiện nhiều nhất trong mẫu
Trong 263 source rows, website nhà cung cấp hoặc first-party chiếm 88 dòng, tương đương 33,5%.
Local Vietnamese editorial/agency đứng thứ hai với 56 dòng, tương đương 21,3%.
Nguồn chính thức có 39 dòng, tương đương 14,8%. Directory/review có 32 dòng, tương đương 12,2%. Tool/platform vendor chiếm 10,6%, industry editorial 5,7%, community 1,5% và original research 0,4%.
Điều làm tôi chú ý không phải chỉ là nhóm first-party đứng đầu.
Quan trọng hơn là source trace không bị chi phối bởi một loại nguồn duy nhất.
Một câu hỏi về nhà cung cấp có thể kéo theo website chính chủ, directory và editorial. Một câu hỏi liên quan chính sách hoặc quyền lợi người dùng có thể xuất hiện nguồn chính thức. Một câu hỏi sản phẩm lại có thể xuất hiện review hoặc retailer.
Vì vậy tôi cho rằng sẽ thiếu nếu người làm marketing chỉ hỏi:
“Website của mình có được ChatGPT đọc không?”
Câu hỏi thực dụng hơn có lẽ là:
Trong từng intent, hệ thống đang tìm loại bằng chứng nào để hỗ trợ câu trả lời?
Nguồn Việt Nam chiếm tỷ trọng khá lớn trong mẫu
Trong 263 source rows, 236 dòng, tương đương 89,7%, được tôi phân loại là có Vietnam scope.
249/263 source rows, tương đương 94,7%, là nội dung tiếng Việt.
Điều này khá phù hợp với thiết kế của thử nghiệm vì toàn bộ prompt đều bằng tiếng Việt và nhiều câu hỏi có ngữ cảnh mua hàng, dịch vụ hoặc nhà cung cấp tại Việt Nam.
Tuy nhiên, tôi không xem kết quả này là bằng chứng rằng “ChatGPT luôn ưu tiên nguồn Việt Nam”.
Mẫu chỉ có 45 prompt tại một thời điểm và trên một phạm vi cụ thể.
Khi ngôn ngữ, intent hoặc thị trường thay đổi, tập nguồn cũng có thể thay đổi đáng kể.
Trong một thử nghiệm khác với 12 cặp prompt Việt/Anh có cùng intent, tôi quan sát thấy source-domain overlap giữa hai ngôn ngữ khá thấp. Điều đó càng củng cố lý do không nên biến kết quả của một tập prompt thành quy luật chung.
Điều này có ý nghĩa gì với người làm marketing?
Hàm ý đầu tiên với tôi là website chính chủ vẫn cần sở hữu những fact quan trọng.
Thông tin về doanh nghiệp, dịch vụ, phạm vi phục vụ, điều kiện, quy trình hoặc đặc điểm sản phẩm nên tồn tại ở một nơi rõ ràng, nhất quán và có thể truy cập được.
Nếu website chính thức không sở hữu fact, rất khó kỳ vọng một hệ thống bên ngoài hiểu chính xác thương hiệu từ những nguồn rời rạc.
Hàm ý thứ hai là chỉ kiểm tra website chính chủ có thể chưa đủ để hiểu landscape nguồn.
Trong sample này, editorial, directory/review và official sources cũng xuất hiện thường xuyên.
Vì vậy khi audit AI Visibility, tôi cho rằng cần quan sát cả ecosystem nguồn thay vì chỉ kiểm tra index của website.
Hàm ý thứ ba là cần tách source exposure khỏi citation.
Đây là điểm tôi thấy dễ bị nhầm nhất khi đánh giá AI Search.
Có thể một domain xuất hiện trong source trace nhưng không được dẫn trong câu trả lời cuối. Cũng có thể thương hiệu được nhắc nhưng nguồn dẫn lại thuộc một website khác.
Nếu gộp các trạng thái này thành một chỉ số duy nhất, marketer rất dễ kết luận sai nguyên nhân.
Tôi thường hình dung quá trình này thành các lớp:
search / source discovery → retrieval → citation → mention → recommendation
Trong đó retrieval đôi khi không quan sát trực tiếp được. Khi đó trạng thái đúng nên là “chưa biết”, thay vì tự suy ra từ việc có hoặc không có citation.
Điều nghiên cứu này không chứng minh
Tôi muốn ghi rõ phần này vì các số liệu về AI Search rất dễ bị diễn giải quá mức.
Thử nghiệm 45 prompt này không chứng minh rằng ChatGPT có một ranking rule ưu tiên website nhà cung cấp.
Nó cũng không chứng minh website first-party chắc chắn được citation nhiều hơn, nội dung tiếng Việt luôn thắng nội dung tiếng Anh, hay tỷ trọng nguồn trong sample này có thể áp dụng cho mọi ngành.
Kết quả cũng không nên được suy rộng sang Gemini, Perplexity hoặc mọi phiên bản ChatGPT.
Và quan trọng nhất: xuất hiện trong source trace không đồng nghĩa được AI đề xuất.
Tôi xem đây là một snapshot có kiểm soát để đặt câu hỏi tốt hơn, không phải một benchmark đại diện toàn thị trường.
Tôi muốn đo tiếp điều gì?
Điều tôi muốn kiểm tra tiếp không phải “làm thế nào để tăng một con số visibility”, mà là tính lặp lại của những observation này.
Nếu chạy cùng một prompt nhiều lần, tập domain thay đổi bao nhiêu?
Nếu đổi từ tiếng Việt sang tiếng Anh nhưng giữ cùng intent, landscape nguồn thay đổi như thế nào?
Và quan trọng hơn: khi một thương hiệu cải thiện factual owner, nội dung và corroboration bên ngoài, source exposure, citation và mention có cùng thay đổi hay không?
Theo tôi, đây là hướng đo thực tế hơn cho AI Search ở giai đoạn hiện tại: giữ lại raw observations, công khai giới hạn và tránh biến một vài lần chạy thành “công thức thuật toán”.
Nguồn dữ liệu và phương pháp: Nghiên cứu R39-A của Ghim AI, snapshot 30/09/2026, 45 prompt tiếng Việt, 263 source rows, 203 domain, ChatGPT-only source trace:
https://ghimai.com/research/chatgpt-nguon-viet-nam-2026