Marketer Steven Being
Steven Being

Sáng tạo kỳ tích @ Infinity

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơn

Synthetic Persona là một nhân vật AI được xây dựng từ dữ liệu thực của khách hàng, có thể tương tác được và mô phỏng cách một phân khúc người dùng cụ thể sẽ suy nghĩ, đặt câu hỏi và ra quyết định.

Cách dễ hiểu nhất: hãy tưởng tượng bạn có thể nhân bản một khách hàng điển hình của mình thành một nhân vật AI. Nhân vật đó không phải người thật nhưng được xây dựng từ dữ liệu của hàng trăm người thật trong cùng phân khúc. Bạn có thể hỏi nó bất cứ lúc nào: "Bạn sẽ hỏi ChatGPT như thế nào khi đang tìm kiếm giải pháp X?" và nhận được câu trả lời phản ánh đúng cách nhóm khách hàng đó thực sự hành động.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơn

Tóm tắt các điểm chính:

Nghiên cứu gốc của Stanford và Google DeepMind, ứng dụng thực tế của Bain & Company, và cách áp dụng vào bài toán theo dõi prompt người dùng cho AI visibility.

  • Synthetic persona đạt độ chính xác 85% khi dự đoán cách người dùng thực trả lời câu hỏi, tương đương mức độ nhất quán tự nhiên của chính con người khi được hỏi lại sau 2 tuần.

  • Prompt trong AI dài gấp 5 lần từ khóa tìm kiếm truyền thống (23 từ so với 4,2 từ), mang theo tín hiệu ý định phong phú hơn nhiều mà công cụ theo dõi kiểu cũ không nắm bắt được.

  • Bain & Company giảm 50-70% thời gian nghiên cứu và 60-70% chi phí khi dùng phương pháp tương tự, so với nghiên cứu người dùng truyền thống.

  • Persona card chỉ cần 5 trường thông tin: công việc cần hoàn thành, ràng buộc, tiêu chí thành công, tiêu chí quyết định, và từ vựng tự nhiên.

  • Synthetic persona là công cụ lọc, không phải công cụ quyết định. Chúng thu hẹp 20 phương án xuống còn 5, sau đó vẫn cần xác thực bằng người dùng thật.

1/ Vấn đề cần giải quyết là gì?

Không thể theo dõi "câu trả lời AI" như một đầu ra cố định, vì AI trả lời khác nhau cho từng người. ChatGPT và các công cụ AI search cá nhân hóa câu trả lời dựa trên bối cảnh, lịch sử và ý định của từng người dùng. Một prompt của người dùng trung bình dài gấp 5 lần từ khóa tìm kiếm cổ điển (23 từ so với 4,2 từ), mang theo rất nhiều thông tin về người hỏi là ai.

Điều này tạo ra vấn đề thực tế cho marketer: muốn theo dõi xem thương hiệu có xuất hiện trong câu trả lời AI hay không, nhưng không biết nên theo dõi câu hỏi nào. Khách hàng doanh nghiệp sẽ hỏi khác hoàn toàn so với khách hàng cá nhân, dù cùng mua một sản phẩm.

Tham khảo: Nghiên cứu Personas trong tìm AI Search: Tại sao Personas trở nên quan trọng sống còn trong kỷ nguyên AI Search

Cách làm cũ: xây persona theo kiểu truyền thống (phỏng vấn, phân nhóm khách hàng), rồi đoán xem mỗi nhóm sẽ hỏi AI câu gì. Vấn đề: phỏng vấn và tổng hợp mất nhiều tuần. Đến lúc xong, mô hình AI đã thay đổi, và persona trở thành tài liệu cũ nằm im, không ai dùng thực sự để theo dõi prompt.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơnSynthetic persona giải quyết đúng vấn đề này: tạo ra hàng loạt câu hỏi mẫu cho từng nhóm khách hàng ngay lập tức, dựa trên dữ liệu có sẵn, thay vì chờ phỏng vấn.

2/ Nghiên cứu của Stanford và Google DeepMind

Nghiên cứu của StanfordGoogle DeepMind huấn luyện synthetic persona từ bản ghi phỏng vấn dài 2 giờ, sau đó kiểm tra xem persona AI có dự đoán được cách những người thật đó trả lời câu hỏi khảo sát sau này không.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơnPhương pháp: các nhà nghiên cứu thực hiện khảo sát tiếp theo với chính những người tham gia phỏng vấn ban đầu, hỏi họ câu hỏi mới. Synthetic persona trả lời cùng bộ câu hỏi đó.

Bước 1: Tuyển 1.052 người thật, đại diện cho dân số Mỹ theo tuổi, giới tính, chủng tộc, vùng miền, học vấn, quan điểm chính trị.

Bước 2: Phỏng vấn sâu mỗi người trong 2 giờ. Đây là phỏng vấn định tính có cấu trúc bán phần, hỏi về câu chuyện cuộc đời và quan điểm về các vấn đề xã hội hiện tại. Toàn bộ nội dung được ghi lại thành văn bản (transcript).

Bước 3: Xây "agent" AI cho từng người. Với mỗi người, các nhà nghiên cứu lấy toàn bộ bản ghi phỏng vấn 2 giờ của người đó, đưa vào prompt của một mô hình ngôn ngữ lớn (LLM), và ra lệnh cho mô hình: "hãy đóng vai chính xác người này khi trả lời câu hỏi." Nói cách khác, mỗi "synthetic agent" ở đây gắn với một người thật cụ thể, không phải một nhóm chung chung.

Bước 4: Kiểm tra bằng câu hỏi mới, chưa từng xuất hiện trong buổi phỏng vấn. Sau buổi phỏng vấn, chính những người thật đó được mời làm thêm khảo sát và bài kiểm tra khác: bộ câu hỏi khảo sát xã hội học tiêu chuẩn (General Social Survey), bài trắc nghiệm tính cách Big Five, và 5 trò chơi kinh tế học hành vi (ví dụ: trò chơi tin tưởng, trò chơi chia sẻ tài nguyên). Đây đều là câu hỏi mới, người thật chưa từng trả lời trước đó.

Bước 5: Đưa cùng bộ câu hỏi mới đó cho AI agent (đã được "nạp" bản ghi phỏng vấn của người tương ứng), rồi so sánh câu trả lời của AI với câu trả lời thật của người đó.

Kết quả: độ chính xác 85% trên bộ câu hỏi khảo sát (agent chọn đúng đáp án giống người thật). Tương quan 98% trên các trò chơi hành vi kinh tế học (agent dự đoán đúng xu hướng hành vi, không chỉ nhớ lại câu trả lời cũ).

Để hiểu con số 85% có ý nghĩa gì: nếu hỏi cùng một người cùng một câu hỏi cách nhau 2 tuần, chính người đó cũng chỉ trả lời giống bản thân khoảng 85% (do tâm trạng, ngữ cảnh thay đổi theo thời gian). Vậy AI agent dự đoán người thật với độ chính xác ngang bằng mức độ chính người đó tự nhất quán với mình.

Điểm mấu chốt cần hiểu rõ: nghiên cứu Stanford dự đoán câu trả lời (attitude, ý kiến, hành vi) của một người cụ thể có thể truy vết được, dựa trên bản ghi phỏng vấn rất giàu thông tin của chính người đó.

3/ Bain & Company áp dụng vào kinh doanh như thế nào?

Bain lấy ý tưởng cốt lõi từ Stanford (AI có thể mô phỏng con người đủ chính xác để tin cậy được) nhưng chuyển sang một dạng khác: "synthetic customer" đại diện cho một phân khúc khách hàng, không phải một cá nhân cụ thể.

Synthetic customer của Bain được xây từ tổ hợp nhiều nguồn dữ liệu: dữ liệu giao dịch nội bộ, dữ liệu hành vi, dữ liệu nhân khẩu học, nghiên cứu tiếng nói khách hàng (voice-of-customer), cộng thêm nguồn bên ngoài như đánh giá sản phẩm và phân tích thị trường. Khác với agent của Stanford (1 người thật = 1 bản ghi phỏng vấn = 1 agent), synthetic customer của Bain đại diện cho một nhóm/phân khúc được tổng hợp từ nhiều loại dữ liệu khác nhau.

Bain dùng synthetic customer cho 5 mục đích: thiết kế và dự báo phản ứng với tính năng/giá sản phẩm mới, xây persona chi tiết hơn, thử nghiệm quảng cáo và chiến dịch marketing, mô hình hóa điểm hài lòng khách hàng (NPS), và đào tạo đội bán hàng bằng cách mô phỏng phản ứng và phản đối của khách hàng thật.

Trải nghiệm thực tế của Bain: thử nghiệm bằng synthetic customer mất 1/2 thời gian và 1/3 chi phí so với phương pháp nghiên cứu truyền thống. Một ví dụ thực tế: một nhà cung cấp viễn thông lớn dùng synthetic customer để thử tính năng, giá, và khuyến mãi nhằm tìm chiến lược ra mắt tối ưu cho phân khúc giá trị (value-first) mới, mà không làm ảnh hưởng thương hiệu cao cấp hiện có.

Bain cũng cảnh báo rõ: đây không phải công cụ thay thế hoàn toàn nghiên cứu khách hàng thật, mà là công cụ bổ sung, tăng tốc và giảm chi phí trước khi kiểm chứng bằng khách hàng thật.

4/ Áp dụng vào việc theo dõi Prompt của khách hàng như nào?

Stanford dự đoán: "người này sẽ trả lời khảo sát như thế nào?" Bain dự đoán: "phân khúc khách hàng này sẽ phản ứng thế nào với sản phẩm mới?" Còn chúng ta sẽ ứng dụng để để làm công việc khác: "mẫu khách hàng này sẽ gõ câu hỏi như thế nào vào ChatGPT?"

Nói cách khác, output của synthetic persona trong việc ứng dụng theo dõi prompt không phải một câu trả lời hay một đánh giá, mà là một danh sách prompt mẫu mà một “mẫu khách hàng cụ thể có khả năng dùng để hỏi AI.

Ví dụ minh họa: một persona "người mua doanh nghiệp" với công việc cần hoàn thành là "đánh giá tuân thủ bảo mật" và ràng buộc là "cần lộ trình kiểm toán cho bộ phận mua sắm" sẽ tạo ra prompt: "công cụ quản lý dự án doanh nghiệp, tuân thủ SOC 2, có nhật ký kiểm toán."

Một persona khác "người dùng cá nhân" với công việc cần hoàn thành là "tìm phương án rẻ nhất" và ràng buộc là "cần quyết định trong 24 giờ" sẽ tạo ra prompt: "ứng dụng quản lý dự án miễn phí tốt nhất."

Cùng một loại sản phẩm, nhưng hai persona tạo ra hai prompt hoàn toàn khác nhau. Nếu chỉ theo dõi 1 loại prompt, sẽ bỏ sót toàn bộ nhóm khách hàng còn lại.

Toàn bộ quy trình sử dụng thực tế gồm 3 bước:

  1. Xây persona card từ dữ liệu thật (chi tiết ở phần dưới)

  2. Đưa persona card vào một LLM, yêu cầu: "hãy đóng vai persona này, và cho biết bạn sẽ hỏi ChatGPT câu gì về [chủ đề X]"

  3. Lấy danh sách prompt mà LLM sinh ra, đưa vào công cụ giám sát AI visibility thật (như Semrush AI Toolkit, Profound, AirOps) để xem thương hiệu có xuất hiện trong câu trả lời AI cho những prompt đó hay không

Đây chính xác là cách synthetic persona giải quyết vấn đề “thiếu dữ liệu đầu để theo dõi” : thay vì chờ 6 tháng tích lũy dữ liệu prompt thật để biết nên theo dõi câu hỏi nào, có thể tạo ra danh sách prompt hợp lý ngay lập tức, bắt đầu theo dõi luôn, rồi tinh chỉnh khi có dữ liệu thật.

Lưu ý: nội dung đang mượn kết quả nghiên cứu Stanford làm bằng chứng cho thấy công nghệ mô phỏng người bằng AI nói chung đáng tin cậy, sau đó áp dụng công nghệ đó vào một nhiệm vụ hẹp hơn và khác biệt: sinh câu hỏi, không phải sinh câu trả lời. Đây là một bước suy luận mở rộng hợp lý, nhưng bản thân nghiên cứu Stanford chưa từng kiểm chứng trực tiếp việc sinh prompt tìm kiếm.

5/ Cách xây dựng synthetic persona cho việc theo dõi prompt

Ba phần: nạp dữ liệu thật, điền persona card (5 trường), và gắn thêm metadata theo dõi chất lượng.

Sai lầm phổ biến nhất: cố xây persona bằng cách nhìn vào chính các prompt đã có. Đây là logic vòng tròn, vì cần persona để biết nên theo dõi prompt nào, nhưng lại dùng prompt để xây persona. Cách đúng: bắt đầu từ nhu cầu thông tin thật của khách hàng, để persona tự chuyển hóa nhu cầu đó thành prompt khả dĩ.

Nguồn dữ liệu nào nên dùng để nạp cho synthetic persona?

Mục tiêu là hiểu người dùng đang cố đạt được điều gì và ngôn ngữ tự nhiên họ dùng.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơn

Persona card gồm những trường nào?

Persona card chỉ cần 5 trường, không nhiều hơn, để tránh tạo gánh nặng bảo trì. Năm trường này đủ để mô phỏng cách một người sẽ đặt câu hỏi cho hệ thống AI.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơn

Metadata giúp persona đáng tin cậy?

Đây là lớp thông tin giúp synthetic persona không trở thành "hộp đen." Khi ai đó đặt nghi vấn về kết quả từ persona, có thể truy ngược lại bằng chứng.

Nguồn gốc (Provenance): nguồn dữ liệu nào, khung thời gian nào, quy mô mẫu bao nhiêu đã được dùng (ví dụ: "Phiếu hỗ trợ Q3/2024 kết hợp Đánh giá G2").

Điểm tin cậy theo từng trường: xếp hạng Cao/Trung bình/Thấp cho mỗi trong 5 trường của Persona Card, có bằng chứng đi kèm (ví dụ: "Tiêu chí quyết định: tin cậy CAO, dựa trên 47 cuộc gọi bán hàng, so với Từ vựng: tin cậy THẤP, dựa trên 3 email nội bộ").

Ghi chú phạm vi bao phủ: nêu rõ dữ liệu bỏ sót điều gì (ví dụ: "Đại diện quá mức cho người mua doanh nghiệp lớn, hoàn toàn bỏ sót người dùng đã rời bỏ trước khi liên hệ hỗ trợ").

Điểm kiểm chứng thực tế: 3-5 phép thử đối chiếu với sự thật kinh doanh đã biết để phát hiện ảo giác (ví dụ: "Nếu persona khẳng định giá là ràng buộc hàng đầu, điều đó có khớp với dữ liệu chu kỳ giao dịch thực tế không?").

Điểm kích hoạt tái tạo: tín hiệu định trước cho biết đã đến lúc chạy lại và làm mới persona (ví dụ: đối thủ mới xuất hiện trên thị trường, hoặc từ vựng trong phiếu hỗ trợ thay đổi đáng kể).

Synthetic persona phát huy giá trị tốt nhất trong trường hợp nào?

Trước khi xây dựng, cần hiểu rõ chúng tạo giá trị ở đâu và hạn chế ở đâu.

Synthetic Persona: Phương pháp giúp theo dõi prompt của người dùng chính xác hơn

6/ Hạn chế nào cần lưu ý khi dùng synthetic persona?

5 hạn chế quan trọng nhất, và nguy hiểm lớn nhất là sự tự tin sai.

1/ Synthetic persona có xu hướng quá tích cực: người thật nói "tôi bắt đầu khóa học nhưng chưa xong," persona nói "tôi đã hoàn thành."

2/ Chúng thiếu tự nhiên: lý trí và nhất quán hơn con người thật, không bị ảnh hưởng từ những điều kiện mới từ môi trường ngoài những gì đã có trong dữ liệu huấn luyện.

3/ Thiếu thứ tự ưu tiên: hỏi điều gì quan trọng, chúng liệt kê 10 yếu tố ngang nhau, trong khi người thật có thứ bậc rõ ràng.

4/ Chúng kế thừa thiên lệch của dữ liệu huấn luyện: nếu dữ liệu dùng để huấn luyện persona có sẵn thiên lệch, persona sẽ mang y nguyên thiên lệch đó.

5/ Và nguy hiểm lớn nhất: synthetic persona luôn có câu trả lời mạch lạc, nghe hợp lý, khiến đội ngũ quá tự tin và bỏ qua bước kiểm chứng thật.

Nguyên tắc vận hành đúng: dùng synthetic persona để khám phá và lọc phương án, không dùng để ra quyết định cuối cùng. Chúng thu hẹp 20 ý tưởng xuống còn 5. Người dùng thật vẫn cần xác nhận 5 phương án đó.

Giá trị cốt lõi của phương pháp này nằm ở tốc độ: giải quyết vấn đề khởi đầu khi chưa có đủ dữ liệu prompt thật để bắt đầu theo dõi AI visibility. Nhưng giá trị đó chỉ phát huy khi luôn đi kèm bước xác thực bằng khách hàng thật, không thay thế hoàn toàn cho nó.

Nguồn: Infinity - đơn vị mang đến giải pháp Digital Marketing tích hợp cho doanh nghiệp từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing.