llms.txt có tác dụng thật không, dữ liệu nói gì
llms.txt là gì, ai thật sự đọc nó, bằng chứng hiện có nói gì về việc nó giúp được AI trích dẫn, và nên làm gì thay vì chạy theo nó.

Trong gần như mọi bài viết tiếng Việt về tối ưu website cho AI, có một mục xuất hiện đều đặn ở cuối danh sách việc cần làm: tạo file llms.txt.
Nó được mô tả như tấm vé vào cửa. Không có file này thì AI không hiểu website bạn, có rồi thì cơ hội được trích dẫn tăng lên. Vài nơi bán hẳn thành hạng mục trong gói dịch vụ.
Mình đi tìm bằng chứng cho lời hứa đó, và thứ tìm được không khớp với những gì đang được nói. Bài này trình bày đúng những gì kiểm chứng được, gồm cả phần nó thật sự có ích, để bạn tự quyết có làm hay không.
llms.txt là gì
Đó là một file văn bản đặt ở thư mục gốc website, ví dụ ai5phut.com/llms.txt, viết bằng Markdown. Nội dung là bản đồ rút gọn của site: giới thiệu ngắn về trang web, rồi danh sách những đường dẫn quan trọng kèm mô tả từng cái.
Ý tưởng đằng sau khá hợp lý. Một trang HTML hiện đại chứa rất nhiều thứ không phải nội dung: menu, quảng cáo, mã theo dõi, khối liên quan. Mô hình ngôn ngữ lại có giới hạn về lượng chữ đọc được mỗi lần. Vậy nên đưa sẵn một bản chưng cất, sạch sẽ, là giúp máy đỡ phải lọc.
Ý tưởng hợp lý và việc nó có tác dụng hay không là hai chuyện khác nhau. Chuyện thứ hai mới là chuyện đáng tiền.
Bằng chứng hiện có
Ba mảnh dữ liệu, xếp từ mạnh nhất.
Google nói thẳng là không hỗ trợ. Trong tài liệu chính thức cho người làm web về các tính năng AI, Google viết rằng không có yêu cầu nào thêm để xuất hiện trong AI Overviews hay AI Mode, và nói rõ rằng bạn không cần tạo file máy đọc mới, không cần file văn bản dành cho AI, không cần loại dữ liệu có cấu trúc đặc biệt nào. Kỹ sư John Mueller của Google còn so sánh llms.txt với thẻ meta keywords, thứ đã bị bỏ từ lâu vì bị lạm dụng đến mức mất hết giá trị.
Số liệu thực nghiệm không thấy mối liên hệ. SE Ranking khảo sát 300.000 tên miền, thấy tỷ lệ có file này khoảng 10,13%, tức sau chừng một năm rưỡi bàn tán thì cứ mười site mới có một site làm. Đáng chú ý hơn: khi họ dựng mô hình dự đoán tần suất một trang được AI trích dẫn rồi thử bỏ biến llms.txt ra khỏi mô hình, độ chính xác lại tăng lên. Nghĩa là trong dữ liệu của họ, file này đóng vai trò nhiễu chứ không phải tín hiệu.
Nó chưa phải chuẩn. Việc đưa llms.txt thành chuẩn chính thức đã được bàn nhưng chưa có kết quả. Tới giờ nó vẫn là một quy ước cộng đồng, không phải tiêu chuẩn có tổ chức nào bảo chứng.
Phần công bằng: ai thật sự đọc file này
Nếu dừng ở đây thì bài viết này thành một chiều, và như vậy cũng không trung thực hơn những bài nó đang phản biện.
Anthropic có xác nhận công khai là hỗ trợ. Về phía OpenAI, GPTBot có lúc tải file này nhưng hiếm, và họ không cam kết gì công khai.
Nhóm đọc file này nhiều nhất lại không phải công cụ tìm kiếm, mà là các trợ lý lập trình. Cursor, Claude Code, GitHub Copilot, Cline, Aider đều tìm /llms.txt và /llms-full.txt khi được trỏ vào một trang tài liệu kỹ thuật.
Chi tiết đó định vị lại toàn bộ câu chuyện. llms.txt sinh ra và có ích thật trong bối cảnh tài liệu kỹ thuật cho lập trình viên: bạn có bộ tài liệu API và muốn công cụ lập trình đọc đúng, đọc gọn. Nó bị mang sang bối cảnh marketing rồi được kể lại thành công cụ tăng khả năng được ChatGPT trích dẫn, và đó là chỗ lời hứa vượt quá bằng chứng.
Vậy làm hay không
Câu trả lời của mình phụ thuộc bạn là ai.
Nếu bạn có trang tài liệu kỹ thuật hoặc bán sản phẩm cho lập trình viên, hãy làm. Có người dùng thật, có ích thật, và tốn khoảng một buổi.
Nếu bạn là doanh nghiệp thường, một công ty phân phối, một chuỗi cửa hàng, một công ty dịch vụ, thì đây không phải việc của quý này. Không có bằng chứng nó giúp bạn được trích dẫn, mà chi phí thật của nó không nằm ở lúc tạo file, nằm ở việc phải cập nhật mỗi khi site đổi. Một file bản đồ lỗi thời tệ hơn không có file.
Điều tuyệt đối đừng làm là trả tiền cho nó như một hạng mục dịch vụ. Nếu một bản báo giá tối ưu AI có dòng "thiết lập llms.txt" với mức phí đáng kể, đó là dấu hiệu để hỏi lại. Câu hỏi nên hỏi rất đơn giản: anh chị dựa vào bằng chứng nào để nói việc này làm tăng khả năng được AI trích dẫn? Cách họ trả lời câu đó nói lên nhiều điều hơn cả phần còn lại của bản báo giá.
Nếu bạn thuộc nhóm nên làm, file đó trông thế nào
Phần này dành cho ai có trang tài liệu kỹ thuật và quyết định làm. Đặt file tại tencongty.com/llms.txt, viết bằng Markdown, cấu trúc như sau:
Ba điểm quyết định file có ích hay không. Thứ nhất, mô tả sau dấu hai chấm mới là phần quan trọng, vì nó giúp máy chọn đúng trang cần đọc mà không phải mở hết. Thứ hai, trỏ tới bản Markdown nếu có, vì đó chính là lý do file này sinh ra, tránh cho máy phải lọc HTML. Thứ ba, mục Tuỳ chọn là phần được phép bỏ qua khi máy bị giới hạn dung lượng, nên xếp thứ ít quan trọng vào đó.
Và điều quan trọng nhất: đặt việc cập nhật file này vào quy trình phát hành. Một bản đồ trỏ tới những trang đã đổi đường dẫn còn tệ hơn không có bản đồ nào.
Bốn việc đáng làm hơn, cùng công sức
Nếu bạn định dành một buổi cho chuyện AI đọc website, đây là bốn thứ có bằng chứng tốt hơn hẳn.
Kiểm tra robots.txt không chặn nhầm bot của AI. Đây mới là thứ có thể chặn bạn hoàn toàn. ChatGPT lấy thông tin qua chỉ mục của Bing, nên nếu trang không được thu thập thì không có tối ưu nào cứu được. Mở file robots.txt của mình ra xem có dòng nào chặn OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot không. Nhiều site chặn nhầm từ hồi lo AI lấy dữ liệu huấn luyện rồi quên mở lại. Đáng lưu ý là bot dùng cho tìm kiếm và bot dùng cho huấn luyện là hai nhóm khác nhau, chặn nhóm huấn luyện vẫn giữ được khả năng bị trích dẫn.
Đưa số thật và nguồn thật vào nội dung. Nghiên cứu GEO của nhóm Princeton, công bố tại KDD 2024 và đọc được ở arxiv.org, đo được rằng thêm số liệu làm tăng khoảng 41% khả năng được đưa vào câu trả lời, thêm trích dẫn trực tiếp tăng khoảng 38%, dẫn nguồn tăng khoảng 34%. Cùng nghiên cứu đó cho thấy nhồi từ khoá làm giảm khoảng 10%.
Gắn dữ liệu có cấu trúc chuẩn. Không phải loại đặc biệt cho AI, thứ đó không tồn tại, mà là schema thông thường như Article, Organization, FAQPage. Nó giúp cỗ máy tìm kiếm hiểu trang, và trang được hiểu đúng thì mới được lấy làm nguồn. Code dán được ngay mình để trong bài schema JSON-LD cho AI.
Đo trước khi làm bất cứ điều gì. Không có con số gốc thì ba tháng nữa bạn không biết việc mình làm có tác dụng không. Quy trình tự đo miễn phí trong ba mươi phút nằm ở bài tự kiểm tra thương hiệu có được AI nhắc không.
Cách đọc mọi lời khuyên về tối ưu cho AI
Lĩnh vực này mới, chưa có chuẩn, và đang có tiền chảy vào. Ba điều kiện đó cộng lại luôn sinh ra một lượng lớn lời khuyên nghe rất chắc chắn mà không dựa trên gì.
Nên có một phép thử đơn giản cho mọi thứ bạn đọc được, kể cả bài này: người nói có dẫn được nguồn kiểm chứng không, và người nói có bán thứ mà họ đang khuyên không.
Mình không bán dịch vụ tối ưu AI. Mọi số trong bài này đều có nguồn để bạn tự tra lại. Và nếu tháng sau có nghiên cứu mới cho thấy llms.txt thật sự có tác dụng, mình sẽ sửa bài này và ghi rõ đã sửa gì.