5 con số về GEO đang bị chép sai ở Việt Nam
GEO tăng 40%, Gartner giảm 25%, Semrush tăng 30%: mình truy về bài gốc từng con số đang lan trong các bài viết tiếng Việt và thấy phần lớn bị chép lệch.

Có một trò chơi trẻ con tên là tam sao thất bản: một câu thì thầm qua mười người, tới người cuối cùng thì thành câu khác hẳn.
Các con số về GEO trong những bài viết tiếng Việt đang chơi đúng trò đó. Một nghiên cứu gốc bằng tiếng Anh, qua vài lần chép lại, thành một con số tròn trịa không nguồn, rồi con số không nguồn đó được chép tiếp sang chục bài khác như thể sự thật hiển nhiên.
Mình ngồi truy từng con số hay gặp nhất về bài gốc của nó. Bài này là kết quả: cái nào thật, cái nào bị chép lệch, và cái nào thậm chí chưa từng là một con số thật. Mọi nguồn đều để link để bạn tự kiểm lại, đừng tin cả mình.
Con số thứ nhất: "GEO giúp tăng hiển thị 40%"
Đây là con số phổ biến nhất, xuất hiện trong gần như mọi bài tiếng Việt về GEO, và phần lớn nêu mà không ghi nguồn.
Nguồn thật của nó là nghiên cứu "GEO: Generative Engine Optimization" của nhóm tác giả từ Princeton và các trường đối tác, công bố tại hội nghị KDD 2024, đọc miễn phí tại arxiv.org. Và bản gốc nói khác với bản chép ở ba chỗ.
Một, con số gốc là "lên tới 40%", tức mức trần trong điều kiện thí nghiệm, không phải mức ai làm cũng được. Hai, nó là kết quả đo trên một hệ thống mô phỏng công cụ tìm kiếm AI, không phải đo trực tiếp trên ChatGPT thương mại. Ba, và đây là phần đáng giá nhất, nghiên cứu tách ra từng chiến thuật: thêm số liệu cụ thể tăng khoảng 41%, thêm trích dẫn trực tiếp tăng khoảng 38%, dẫn nguồn tăng khoảng 34%, và mức tăng khác nhau theo lĩnh vực.
Chép "GEO tăng 40%" không sai hẳn, nhưng nó vứt đi đúng phần dùng được: bạn không cần "làm GEO" chung chung, bạn cần thêm số liệu, trích dẫn và nguồn vào nội dung.
Con số thứ hai: "nhồi từ khoá giảm 10%", con số bị bỏ quên
Cùng nghiên cứu Princeton đó có một phát hiện gần như không bài tiếng Việt nào nhắc: nhồi từ khoá làm giảm khoảng 10% khả năng được trích dẫn.
Nó bị bỏ quên không khó hiểu: con số này khó bán. "Tăng 40%" mở ra một gói dịch vụ, còn "đừng nhồi từ khoá" thì đóng lại một thói quen mà nhiều bên vẫn đang tính phí. Nhưng với người tự làm nội dung, đây có khi là con số hữu ích nhất của cả nghiên cứu, vì nhồi từ khoá là thói quen SEO cũ mà rất nhiều người mang nguyên sang thời AI.
Con số thứ ba: "Semrush 2025: GEO tăng 30% tỷ lệ trích dẫn"
Con số này thú vị nhất danh sách, vì nó chưa từng là một trích dẫn thật.
Nguồn gốc của nó là một bài hướng dẫn tiếng Việt khá phổ biến, trong đó tác giả dạy cách viết câu văn có số liệu để dễ được AI trích, và đưa ra một câu ví dụ minh hoạ, đại ý "Theo báo cáo Semrush 2025, GEO giúp tăng 30% tỷ lệ được AI trích dẫn". Câu đó nằm trong bài với vai trò là mẫu câu, không phải thông tin.
Người đọc lướt chép câu ví dụ thành sự thật, và thế là một báo cáo không tồn tại bắt đầu được trích dẫn. Nếu bạn thấy con số này ở đâu đó, giờ bạn biết gốc gác của nó. Và nó là lời nhắc tốt nhất cho thói quen phải truy về bài gốc trước khi trích bất kỳ số nào.
Con số thứ tư: "Gartner: tìm kiếm truyền thống giảm 25%"
Con số này có thật, nhưng thường bị chép thiếu hai chữ quan trọng: dự báo.
Bản gốc là thông cáo của Gartner tháng 2 năm 2024, dự báo rằng lượng tìm kiếm truyền thống sẽ giảm 25% vào năm 2026 do người dùng chuyển sang chatbot AI và trợ lý ảo. Nhiều bài tiếng Việt chép thành chuyện đã xảy ra, kiểu "tìm kiếm đã giảm 25%", thậm chí có bản chép thành "traffic website giảm 25%", một thứ hoàn toàn khác.
Dự báo là dự đoán về tương lai, có thể đúng có thể sai, và bản thân Gartner sống bằng nghề đưa dự báo. Dùng thì ghi rõ là dự báo, kèm năm đưa ra. Sự khác nhau giữa "sẽ giảm" và "đã giảm" là sự khác nhau giữa một giả thuyết và một sự kiện.
Con số thứ năm: "hơn 80% nguồn AI trích là earned media", và bài học về phiên bản
Con số này mình xếp vào loại thật nhưng cần cẩn thận, vì đang có hai phiên bản cùng lưu hành: có bài ghi 82%, có bài ghi 85,5%, cùng gán cho nghiên cứu Generative Pulse của Muck Rack.
Khả năng cao hai con số đến từ hai đợt công bố khác nhau của cùng dòng nghiên cứu, vì loại khảo sát này được cập nhật theo kỳ. Bài học ở đây không phải chọn số nào, mà là: với nghiên cứu có nhiều phiên bản, hãy ghi kèm thời điểm, và khi hai nguồn lệch nhau thì trích ở mức chắc chắn, ví dụ "trên 80%".
Còn phần cốt lõi thì hai phiên bản thống nhất: đại đa số nguồn được AI trích dẫn là báo chí và nội dung bên thứ ba viết về thương hiệu, không phải website của chính thương hiệu. Đây là con số nền cho cả chiến lược làm sao để ChatGPT nhắc đến thương hiệu của bạn.
Và một lời hứa không có số nào chống lưng
Khép danh sách bằng một thứ ngược lại: không phải con số bị chép sai, mà là lời hứa được rao như có số trong khi không có.
Đó là lời hứa file llms.txt giúp tăng khả năng được AI trích dẫn. Dữ liệu hiện có nói ngược lại: khảo sát của SE Ranking trên 300.000 tên miền không tìm thấy mối liên hệ giữa việc có file này và việc được trích dẫn nhiều hơn, còn Google tuyên bố thẳng là không hỗ trợ. Toàn bộ bằng chứng, gồm cả phần file này thật sự có ích ở đâu, nằm trong bài llms.txt có tác dụng thật không.
Tự truy một con số trong mười phút
Kỹ năng truy nguồn nghe ghê gớm nhưng làm thử một lần là quen. Đây là đúng quy trình mình dùng cho bài này, lấy con số 40% làm ví dụ.
Bước một, tìm bằng cụm nguyên văn trong ngoặc kép kèm chữ tiếng Anh khả dĩ của nó, kiểu "GEO 40% visibility". Kết quả trang đầu thường toàn bài chép lại lẫn nhau, đó chính là dấu hiệu nhận diện: các bài dùng cùng một cách diễn đạt gần như chắc chắn chép từ một chỗ.
Bước hai, thêm chữ "study" hoặc "paper" vào truy vấn, hoặc giới hạn tìm trong arxiv.org và các trang hội nghị. Với con số 40%, đường này dẫn thẳng tới bài của nhóm Princeton.
Bước ba, đọc phần tóm tắt và phần kết quả của bản gốc, đối chiếu ba thứ: con số chính xác là bao nhiêu và có chữ "lên tới" không, đo trong điều kiện nào, và tác giả tự ghi nhận giới hạn gì. Mười phút này thay đổi hẳn cách bạn dùng con số: từ chép lại thành trích dẫn có hiểu.
Nếu truy không ra bản gốc thì cũng đã có câu trả lời: con số không truy được nguồn là con số không dùng được, bất kể nó xuất hiện ở bao nhiêu bài.
Bộ lọc bốn câu cho mọi con số bạn gặp
Ngành này sẽ còn sinh ra nhiều con số nữa, nên thay vì nhớ từng cái, hãy mang theo bộ lọc.
Con số có link về bài gốc không, hay chỉ nêu tên nguồn suông? Bài gốc nói "lên tới" hay nói "trung bình", đo trên hệ thật hay hệ mô phỏng? Nó là số đã đo hay là dự báo, và đưa ra năm nào? Và người đang trích con số đó có bán thứ mà con số ủng hộ không?
Bốn câu đó lọc được phần lớn rác. Điều trớ trêu dễ chịu là: viết nội dung vượt qua được chính bộ lọc này, tức có số thật, nguồn thật, thời điểm rõ, lại chính là cách được AI trích dẫn nhiều hơn theo đúng nghiên cứu Princeton. Trung thực, hoá ra, là chiến thuật GEO tốt nhất đang có bằng chứng.