Noindex và Disallow khác nhau thế nào?
noindex yêu cầu công cụ tìm kiếm không hiển thị URL trong kết quả. Disallow trong robots.txt yêu cầu crawler không truy cập URL khớp quy tắc. Theo Google Search Central, URL phải được crawl để Google đọc và xử lý noindex. Nếu vừa Disallow vừa đặt noindex trong HTML, Google có thể không nhìn thấy chỉ thị này.
Đây là lỗi Technical SEO phổ biến: người quản trị muốn “chặn chắc hơn” nên dùng cả hai. Kết quả là URL vẫn có thể tồn tại trong index với thông tin hạn chế vì Google biết URL qua link nhưng không được phép đọc trang.
Trước khi đi vào chi tiết, nếu bạn chưa nắm phần nền, xem thêm technical SEO là gì.
- Muốn trang không xuất hiện trên Google: dùng noindex và cho crawl.
- Muốn giảm crawl một pattern không cần thiết: dùng Disallow.
- Muốn bảo vệ dữ liệu: dùng authentication và authorization.
- Muốn xóa nội dung vĩnh viễn: trả 404/410 hoặc redirect tới trang thay thế thực sự tương đương.
Đây là một quyết định trong SEO Technical, không phải mẹo chọn câu lệnh mạnh hơn. Trước khi thay đổi, hãy xác định URL cần tồn tại cho người dùng, cần xuất hiện trên Search hay chỉ cần giảm crawl.
Bảng so sánh Noindex, Disallow và các phương án khác
| Công cụ | Crawl | Index | Dùng khi |
|---|---|---|---|
| noindex | Cần cho phép để bot đọc chỉ thị | Yêu cầu không index | Trang cần cho người dùng nhưng không nên lên Search |
| Disallow | Chặn crawl pattern | Không bảo đảm chặn index | Khu vực không cần bot truy cập |
| 401/403 | Không truy cập nội dung | Không dùng như trang công khai | Nội dung cần quyền |
| 404/410 | Bot nhận URL không còn | Dần bị loại | Nội dung đã xóa và không có thay thế |
| Canonical | Vẫn có thể crawl | Gợi ý URL đại diện | Các URL trùng hoặc rất giống nhau |
Cách thêm noindex
Trang HTML
<meta name="robots" content="noindex">Đặt trong <head> và kiểm tra HTML thực tế. Với SPA, đừng để route noindex kế thừa meta của route trước hoặc ngược lại.
PDF và file không phải HTML
X-Robots-Tag: noindexKiểm tra HTTP header trên response cuối. Header có thể được cấu hình tại Nginx, Apache, CDN hoặc ứng dụng.
Cách dùng Disallow
User-agent: *
Disallow: /admin/
Disallow: /internal-search/
Quy tắc áp dụng theo host. Test URL có và không có slash, chữ hoa, query parameter và file tài nguyên. Đọc cách tạo robots.txt trước khi dùng wildcard, đồng thời kiểm tra URL noindex không còn nằm trong sitemap XML.
Mỗi lần đội kỹ thuật thêm Disallow cho chắc ăn, một trang đang gắn noindex có thể kẹt lại trong index. Chúng tôi bóc tách đúng loại xung đột này khi chạy dịch vụ SEO audit.
Quy trình gỡ URL khỏi Google an toàn
- Xác định trạng thái hiện tại: URL có index, trả status gì, canonical tới đâu và robots.txt có chặn không.
- Gỡ Disallow nếu cần: Google phải crawl để đọc noindex.
- Thêm noindex: dùng meta robots hoặc X-Robots-Tag.
- Loại khỏi sitemap và internal link chính: không tiếp tục khai báo URL muốn loại.
- Kiểm tra live: dùng URL Inspection và xem Googlebot có thể đọc chỉ thị.
- Dùng Removals đúng vai trò: Google hướng dẫn kết hợp yêu cầu ẩn nhanh với một phương án xóa vĩnh viễn như noindex, 404/410 hoặc loại nội dung khỏi trang.
Chọn giải pháp theo tình huống
Trang cảm ơn sau khi gửi form
Dùng noindex nếu trang cần tồn tại cho người dùng và analytics. Không dùng robots.txt như cơ chế bảo vệ dữ liệu.
Kết quả tìm kiếm nội bộ vô hạn
Noindex cho trang cần truy cập và cân nhắc Disallow pattern sau khi đã kiểm soát index. Cần xử lý internal link và URL parameter để không tạo không gian crawl vô hạn.
Trang staging
Bảo vệ bằng authentication hoặc giới hạn mạng. Noindex và Disallow chỉ là lớp bổ sung, không phải bảo mật.
Sản phẩm ngừng bán
Nếu còn nhu cầu, thay thế hoặc thông tin hữu ích, có thể giữ trang. Nếu có trang thay thế tương đương, 301. Nếu xóa hẳn và không có thay thế, 404/410.
Sai lầm thường gặp
- Thêm noindex và Disallow cùng lúc.
- Viết
noindextrong robots.txt, Google không hỗ trợ quy tắc này. - Dùng nofollow thay cho noindex.
- Canonical tới trang A nhưng noindex trang A.
- Giữ URL noindex trong sitemap.
- Dùng Removals mà không sửa nguyên nhân.
- Dùng robots.txt để bảo vệ dữ liệu.
Quyết định trang nào nên vào index gắn với cấu trúc site, phân bổ internal link và mục tiêu chuyển đổi, nên chúng tôi chốt nó ở giai đoạn lập kế hoạch SEO tổng thể thay vì xử lý rời rạc.
Noindex và Disallow ảnh hưởng GEO như thế nào?
Tài liệu AI features của Google nêu rằng trang phải được index và đủ điều kiện hiển thị snippet để có thể xuất hiện như một supporting link. Trang noindex không đáp ứng điều kiện đó, còn Disallow có thể ngăn hệ thống đọc nội dung. Vì vậy, index control là nền tảng của cả SEO và GEO, không phải một tối ưu riêng cho AI.
Khi audit, kiểm tra robots.txt, meta robots, X-Robots-Tag, canonical và sitemap cùng nhau. Một chỉ thị đúng nhưng mâu thuẫn với ba tín hiệu khác vẫn là vấn đề. Xem GEO là gì, hướng dẫn Google Search Console và dịch vụ SEO Audit.
Cách phát hiện tín hiệu mâu thuẫn
Một URL có thể nằm trong sitemap nhưng lại noindex, bị Disallow và canonical sang URL khác. Mỗi tín hiệu đang nói một điều: sitemap yêu cầu xem xét URL, noindex yêu cầu không hiển thị, robots ngăn đọc noindex, canonical đề xuất trang khác. Audit phải đọc cả bộ tín hiệu trên cùng một dòng URL.
Tạo bảng gồm status, robots allowed, meta robots, X-Robots-Tag, canonical, sitemap, internal links và index status. Nhóm theo pattern để tìm rule template. Một URL sai có thể là lỗi editor. Hàng nghìn URL sai cùng cấu trúc thường là lỗi template, plugin hoặc middleware.
Trường hợp website đã gỡ nhầm trang khỏi Google và chưa rõ nguyên nhân đến từ noindex hay robots.txt, brief SEO miễn phí là chỗ để mô tả hiện trạng trước khi bàn tới chi phí.
Noindex và Disallow trên WordPress
Tùy chọn “Discourage search engines from indexing this site” có thể thêm noindex trên toàn website. Nó phù hợp trong một số môi trường thử nghiệm, nhưng production cần smoke test để không bị bật nhầm. Plugin SEO có thể đặt noindex cho post type, taxonomy, author archive và trang riêng.
Kiểm tra output thực tế vì theme, plugin và header máy chủ có thể cùng thêm robots. Nếu meta robots nói index nhưng X-Robots-Tag nói noindex, chỉ thị hạn chế hơn có thể chi phối. Sau khi thay cấu hình, xóa cache CDN và page cache rồi request lại.
Noindex trong React, Next.js và SPA
Route metadata phải được render đúng cho từng URL. Lỗi phổ biến là trang A noindex, chuyển client-side sang trang B nhưng thẻ robots không được thay. Lỗi ngược lại còn nguy hiểm hơn khi trang cần noindex kế thừa index,follow.
Kiểm tra initial HTML trực tiếp, HTML sau hydration và navigation giữa route. SSR hoặc prerender giúp metadata có trong response, nhưng build cache và route fallback vẫn cần test. Với PDF được phục vụ qua CDN, meta HTML không có tác dụng, phải dùng X-Robots-Tag.
Đọc thêm: redirect 301 vs 302 · kiểm tra mobile friendly
Xác nhận trong Google Search Console
- Kiểm tra URL để xem trạng thái index và canonical Google chọn.
- Chạy Live Test sau khi bản sửa đã deploy và cache được làm mới.
- Xác nhận Googlebot được phép crawl và nhìn thấy noindex khi mục tiêu là gỡ URL.
- Loại URL khỏi sitemap và link nội bộ quan trọng.
- Theo dõi Page Indexing theo pattern, không request indexing lặp lại mỗi ngày.
Bẫy noindex trong migration
Môi trường staging thường có noindex. Khi build được đưa lên production, metadata này có thể đi theo. Checklist go-live phải crawl trang chủ, template dịch vụ, blog, category và sản phẩm để phát hiện noindex. Không chỉ xem source trang chủ.
Thiết lập monitor phát hiện số URL indexable giảm đột ngột, robots.txt chặn toàn site hoặc header X-Robots-Tag xuất hiện bất thường. Nếu lỗi ảnh hưởng trang chuyển đổi hoặc toàn site, xử lý P0 và rollback trước khi phân tích dài.
Cây quyết định index control
- Trang có cần bảo mật? Dùng xác thực, không dựa vào robots.
- Trang có cần tồn tại cho người dùng nhưng không lên Search? noindex và cho crawl.
- Trang đã di chuyển? 301 đến trang thay thế tương đương.
- Trang đã xóa và không có thay thế? 404 hoặc 410.
- Nhiều URL là bản sao? canonical và kiểm soát internal link.
- Pattern tạo không gian crawl vô hạn? sửa link sinh URL, canonical/index strategy, sau đó cân nhắc Disallow.
Câu hỏi thường gặp
Disallow có xóa URL khỏi Google không?
Không bảo đảm. URL bị Disallow vẫn có thể được index nếu Google biết URL qua link. Muốn gỡ URL, cho phép crawl và dùng noindex, hoặc trả status code phù hợp.
Noindex mất bao lâu?
Phụ thuộc lịch crawl và tầm quan trọng của URL. Google cần crawl lại và xử lý chỉ thị. Với trường hợp khẩn cấp, Removals có thể ẩn tạm trong khi noindex được xử lý.
Noindex có truyền link equity không?
Không nên dùng noindex như một công cụ phân phối PageRank. Nếu hai trang trùng nhau, canonical hoặc redirect thường phù hợp hơn. Chọn theo mục tiêu URL, không theo mẹo giữ link equity.
Kết luận
Noindex và Disallow giải quyết hai việc khác nhau. Noindex kiểm soát khả năng xuất hiện trong kết quả, Disallow kiểm soát crawl. Hãy bắt đầu từ mục tiêu, kiểm tra tín hiệu mâu thuẫn và theo dõi URL live thay vì gắn cả hai để “chắc chắn”.