Schema JSON-LD cho AI: code dán được ngay, không cần lập trình
Dữ liệu có cấu trúc giúp gì và không giúp gì cho việc được AI trích dẫn, ba đoạn JSON-LD dán thẳng vào website, và cách tự kiểm tra sau khi gắn.

Mình đọc sáu bài tiếng Việt đang xếp hạng cao nhất cho chủ đề tối ưu website cho AI. Năm trong sáu bài đều khuyên gắn schema markup.
Không bài nào đưa ra một dòng code.
Người đọc xong biết mình cần làm gì, không biết làm thế nào, và thường dừng lại ở đó. Bài này lấp đúng khoảng đó: ba đoạn code dán được ngay, kèm phần nói thật về việc chúng giúp gì và không giúp gì.
Nói thẳng phần không giúp trước
Google viết trong tài liệu chính thức rằng để xuất hiện trong AI Overviews hay AI Mode thì không cần loại dữ liệu có cấu trúc đặc biệt nào. Không có schema riêng cho AI. Ai bán cho bạn thứ gọi là "schema tối ưu cho AI" thì thứ đó không tồn tại.
Vậy vì sao vẫn nên gắn?
Vì lý do gián tiếp nhưng vững. Các tính năng AI của Google chỉ lấy nội dung từ những trang đã được lập chỉ mục và đủ điều kiện hiển thị trong tìm kiếm thông thường. ChatGPT thì lấy qua chỉ mục của Bing. Nghĩa là điều kiện cần để được AI trích dẫn là được cỗ máy tìm kiếm hiểu và tin trước đã. Schema chuẩn giúp đúng việc đó: nói cho máy biết trang này là loại nội dung gì, ai viết, viết khi nào, trả lời câu hỏi nào.
Nói gọn: schema không phải cửa sau để lọt vào câu trả lời của AI. Nó là việc vệ sinh cơ bản, và bỏ qua thì mất một phần cơ hội mà không được gì.
Còn thứ có bằng chứng trực tiếp làm tăng khả năng được trích dẫn thì là chuyện khác hẳn, nằm ở nội dung chứ không nằm ở code, mình viết trong bài làm sao để ChatGPT nhắc đến thương hiệu của bạn.
Ba loại đáng gắn, xếp theo mức đáng công
Organization cho trang chủ, khai báo doanh nghiệp bạn là ai. Gắn một lần, dùng mãi.
Article hoặc BlogPosting cho từng bài viết, khai báo tiêu đề, tác giả, ngày đăng, ngày sửa. Đây là loại có ích nhất với site có nội dung.
FAQPage cho những trang có phần hỏi đáp thật. Đây là loại hay bị lạm dụng nhất, và phần sau mình nói vì sao lạm dụng lại phản tác dụng.
Ba loại đó phủ gần hết nhu cầu của một website doanh nghiệp thông thường. Các loại khác như Product, HowTo, LocalBusiness thì gắn khi có đúng nội dung đó, đừng gắn cho đủ bộ.
Cách gắn
Dán đoạn code vào trong thẻ head của trang, hoặc cuối body cũng được. Nếu dùng WordPress thì phần lớn plugin SEO đã sinh sẵn Organization và Article, kiểm tra trước khi gắn tay để khỏi có hai bản chồng nhau.
Đoạn thứ nhất, cho trang chủ:
Trường sameAs quan trọng hơn vẻ ngoài của nó. Nó nối website với các hồ sơ chính thức của bạn ở nơi khác, giúp máy hiểu tất cả những chỗ đó là cùng một thực thể. Liệt kê đủ những kênh bạn thật sự sở hữu.
Đoạn thứ hai, cho một bài viết:
Hai trường hay bị làm ẩu là author và dateModified. Để tên một con người thật thay vì để tên công ty, vì tín hiệu về người viết là thứ máy tìm kiếm coi trọng. Và dateModified phải cập nhật thật mỗi lần sửa bài, đừng để trùng mãi với ngày đăng.
Đoạn thứ ba, cho phần hỏi đáp:
Để ý câu trả lời mẫu ở trên: nó có con số cụ thể chứ không nói chung chung. Đây là chỗ mà schema chạm vào phần có bằng chứng, vì nghiên cứu GEO của nhóm Princeton tại KDD 2024, đọc được ở arxiv.org, đo được rằng thêm số liệu cụ thể làm tăng khoảng 41% khả năng nội dung được đưa vào câu trả lời của AI. Một đoạn FAQ có số thật vừa hợp lệ về mặt kỹ thuật, vừa là loại nội dung dễ được trích.
Ba lỗi khiến schema thành vô ích hoặc có hại
Khai điều không hiện trên trang. Đây là lỗi nặng nhất. Google yêu cầu dữ liệu có cấu trúc phải khớp với nội dung người đọc nhìn thấy. Khai FAQPage với mười câu hỏi trong khi trang không hiển thị câu nào là vi phạm, và có thể bị mất luôn quyền hiển thị nâng cao.
Gắn FAQPage cho mọi trang. Rất nhiều site nhét một khối hỏi đáp giả xuống cuối mọi trang chỉ để gắn được schema. Người đọc bỏ qua, máy nhận ra, và bạn nhận về rủi ro chứ không nhận về lợi ích. Chỉ gắn khi trang thật sự có phần hỏi đáp mà người đọc dùng tới.
Gắn xong rồi quên. Bảng giá đổi, dịch vụ ngừng, số điện thoại đổi, mà schema vẫn giữ dữ liệu cũ. Lúc đó bạn đang chủ động cung cấp thông tin sai cho máy, ở định dạng mà máy tin tưởng nhất. Đây cũng là nguyên nhân thường gặp nhất khi AI nói sai về một doanh nghiệp.
Ba chỗ vướng riêng của website tiếng Việt
Phần này không có trong tài liệu tiếng Anh, nhưng gặp thường xuyên khi làm cho site Việt.
Dấu tiếng Việt trong JSON. File phải lưu ở dạng UTF-8, và trang phải khai <meta charset="utf-8">. Nếu bảng mã sai, dấu sẽ vỡ thành ký tự lạ và máy đọc được cú pháp nhưng hiểu sai nội dung. Cách kiểm nhanh: xem nguồn trang, nếu chữ trong khối JSON hiện đúng dấu là ổn.
Số điện thoại và địa chỉ. Số điện thoại nên viết dạng quốc tế, +84966866616 thay vì 0966866616, vì đó là định dạng máy hiểu chắc chắn. Địa chỉ thì addressCountry để VN, và nên khai cả addressLocality là tên tỉnh thành, vì thiếu trường này thì thông tin địa phương của bạn yếu hẳn.
Tên công ty có nhiều cách viết. Rất nhiều doanh nghiệp Việt có tên đầy đủ trên giấy phép, tên giao dịch, và tên viết tắt mà khách quen dùng. Chọn một tên chính cho trường name, rồi khai các cách gọi còn lại vào alternateName. Việc này giúp máy hiểu ba cái tên đó là cùng một thực thể, thay vì coi là ba tổ chức khác nhau.
Kiểm tra sau khi gắn
Đừng tin là xong cho tới khi máy xác nhận. Hai công cụ miễn phí, dùng mất năm phút.
Rich Results Test của Google nhận đường dẫn hoặc đoạn code, báo lỗi cú pháp và cho biết trang đủ điều kiện hiển thị dạng nào. Schema Markup Validator của schema.org kiểm tra chặt hơn về mặt chuẩn.
Sau khi gắn cho cả site, mở Search Console mục Enhancements để theo dõi lỗi phát sinh. Một lỗi lặp ở nhiều trang thường là do template chứ không phải do từng trang, sửa một chỗ là hết.
Việc quan trọng hơn schema
Nếu website của bạn chưa gắn schema, làm trong một buổi là xong và nên làm. Nhưng đừng nghĩ xong rồi là đã tối ưu cho AI.
Có một thứ có thể chặn bạn hoàn toàn mà nhiều người không kiểm: file robots.txt. ChatGPT lấy thông tin qua chỉ mục của Bing, nên nếu bot không vào được thì mọi schema đều vô nghĩa. Mở file đó ra xem có dòng nào chặn OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot không, vì nhiều site đã chặn từ hồi lo bị lấy dữ liệu huấn luyện rồi quên mở lại.
Và trước khi làm bất cứ điều gì, nên biết mình đang đứng ở đâu để còn có cái mà so. Cách tự đo miễn phí trong ba mươi phút nằm ở bài tự kiểm tra thương hiệu có được AI nhắc không. Còn nếu bản báo giá dịch vụ nào đó đang bán cho bạn file llms.txt kèm lời hứa tăng khả năng được AI trích dẫn, mời bạn đọc phần bằng chứng về nó trước khi ký.