Bỏ qua tới nội dung
Kiến thức Website· ·14 phút đọc

Noindex là gì, khi nào nên dùng để chặn Google không lập chỉ mục trang

Nguyen Hien
Cỡ chữ

Không phải mọi trang trên website đều nên xuất hiện trong kết quả Google. Trang xác nhận đơn hàng, trang lọc sản phẩm tạo ra hàng nghìn URL trùng nhau, trang đăng nhập nội bộ, tất cả có lý do để không lên kết quả tìm kiếm. Noindex là cách bạn báo cho Google biết điều đó, và khi dùng sai có thể là cách nhanh nhất để mất traffic tự nhiên.

Noindex là gì

Noindex là một chỉ dẫn (directive) đặt trong trang web hoặc HTTP response header, yêu cầu các công cụ tìm kiếm hỗ trợ quy tắc này không đưa trang đó vào chỉ mục (index) của họ.

Theo tài liệu của Google Search Central, khi Googlebot ghé trang và phát hiện noindex, trang sẽ bị loại ra khỏi kết quả tìm kiếm của Google hoàn toàn, bất kể có bao nhiêu trang khác đang dẫn link về đó.

Có hai cách thêm noindex. Cách thứ nhất là meta tag trong phần <head> của trang HTML:

<meta name="robots" content="noindex">

Có thể kết hợp thêm nofollow để vừa không lập chỉ mục vừa không theo dõi link: content="noindex, nofollow". Hoặc chỉ áp dụng cho Google: <meta name="googlebot" content="noindex">.

Cách thứ hai là HTTP response header, dùng cho các tài nguyên không phải HTML như PDF, file video, file ảnh:

X-Robots-Tag: noindex

Hai cách có hiệu lực như nhau với Google. Chọn cách nào phụ thuộc vào loại tài nguyên và quyền truy cập vào cấu hình server.

Sơ đồ hai cách thêm noindex: meta tag trong phần head của HTML cho trang web thông thường, và HTTP header X-Robots-Tag cho PDF và tài nguyên không phải HTML
Hai cách thêm noindex vào trang, với lưu ý quan trọng là trang không được bị robots.txt chặn trước.

Vì sao không phải trang nào cũng nên lên Google

Website có thể có hàng nghìn URL nhưng không phải tất cả đều mang lại giá trị khi xuất hiện trong kết quả tìm kiếm. Một số trang thậm chí gây hại nếu bị Google lập chỉ mục, bởi vì chúng tạo ra nội dung trùng lặp hoặc tiết lộ thông tin không dành cho người tìm kiếm nói chung.

Trang lọc sản phẩm trong shop online là ví dụ điển hình. Một cửa hàng thời trang với 500 sản phẩm có thể tạo ra hàng chục nghìn URL chỉ từ các bộ lọc (màu sắc, size, giá, thương hiệu, sắp xếp theo). Phần lớn các URL này chứa cùng sản phẩm được xem từ góc độ khác nhau, và Google nhận ra đây là nội dung trùng lặp.

Trang xác nhận sau khi điền form (trang “Cảm ơn bạn, yêu cầu đã được gửi đi”) cũng không có lý do gì để lên kết quả tìm kiếm. Người dùng đến trang đó chỉ sau khi đã điền form, không phải từ Google.

Noindex, robots.txt và canonical khác nhau như thế nào

Đây là điểm dễ nhầm nhất. Ba công cụ này đều liên quan đến việc “kiểm soát những gì Google làm với trang”, nhưng chúng làm việc theo cơ chế hoàn toàn khác nhau. Nhầm lẫn ở đây có thể dẫn đến mất traffic, lập chỉ mục trùng hoặc chặn nhầm trang quan trọng.

Công cụLàm gì với trangGoogle còn crawl trang không?Khi nào dùngRủi ro hay gặp
Noindex
<meta name="robots" content="noindex">
Chặn lập chỉ mục. Trang vẫn hoạt động, người dùng vẫn truy cập được qua link trực tiếp.Có, Google vẫn crawl để đọc quy tắcTrang xác nhận đơn hàng, lọc sản phẩm, đăng nhậpVô tình thêm vào trang quan trọng, mất traffic tự nhiên hoàn toàn
Robots.txt
Disallow: /thu-muc/
Chặn Googlebot vào trang. Không kiểm soát được lập chỉ mục.Không, Googlebot bị chặn ngay từ cửaTiết kiệm crawl budget, chặn trang admin, tài nguyên nội bộGoogle vẫn có thể lập chỉ mục URL nếu có link từ nơi khác trỏ vào, mà không biết nội dung bên trong
Canonical
<link rel="canonical" href="URL">
Gộp nhiều URL về một URL chính. Cả hai URL vẫn tồn tại, chỉ một URL được lập chỉ mục.Có, Google crawl cả hai nhưng chỉ lập chỉ mục URL canonicalNhiều URL cùng nội dung, tham số UTM, phân trangCanonical trỏ sai URL, báo Google lập chỉ mục trang sai

Điểm dễ nhầm nhất trong bảng trên: nếu bạn dùng robots.txt để chặn Googlebot vào trang, nhưng trang đó có noindex trong HTML, Googlebot sẽ không bao giờ thấy noindex vì không vào trang được. Kết quả là trang vẫn có thể xuất hiện trong kết quả Google vì Google biết URL tồn tại qua link từ nơi khác, nhưng không biết nội dung bên trong. Đây là lý do noindex và robots.txt không nên dùng đồng thời trên cùng một URL.

Bảng so sánh chi tiết ba công cụ kiểm soát lập chỉ mục: noindex meta tag, robots.txt disallow và canonical link, với mục đích, cách Google crawl trang và rủi ro khi dùng sai
Ba công cụ kiểm soát Google nhưng hoạt động theo cơ chế khác nhau. Noindex và robots.txt không nên dùng song song trên cùng một URL.

Khi nào nên dùng noindex

Một số loại trang trên website có lý do chính đáng để không xuất hiện trên Google. Dưới đây là những trường hợp noindex là lựa chọn đúng:

  • Trang xác nhận sau khi điền form: Trang “Cảm ơn bạn, đơn hàng đã được ghi nhận” không có giá trị với người tìm kiếm.
  • Trang lọc và sắp xếp sản phẩm: URL dạng /products?color=do&size=L tạo ra hàng nghìn biến thể URL từ cùng nội dung, gây nội dung trùng lặp với trang danh mục chính.
  • Trang đăng nhập, đăng ký tài khoản: Không ai tìm “đăng nhập vào tài khoản [tên website]” trên Google, và trang này lên kết quả tìm kiếm không giúp ích gì cho người dùng mới.
  • Trang kết quả tìm kiếm nội bộ: URL dạng /search?q=giay+nike do chính trang web tạo ra thường chứa nội dung không ổn định và không hữu ích với người dùng Google.
  • Landing page chỉ dành cho quảng cáo trả tiền: Đôi khi bạn không muốn người dùng tìm thấy trang đó qua tìm kiếm tự nhiên, chỉ muốn họ đến từ quảng cáo.
  • Bản staging hoặc môi trường thử nghiệm: Bản dựng thử trước khi ra mắt không nên lên Google.
Hai cột chia loại trang nên dùng noindex gồm trang cảm ơn, trang lọc sản phẩm, trang đăng nhập và loại trang không nên noindex gồm trang dịch vụ, bài viết blog, trang danh mục có nội dung tốt
Trang nào nên noindex và trang nào không nên. Loại sai có thể làm mất traffic tự nhiên hoàn toàn.

Lỗi chặn nhầm và hậu quả

Đây là lỗi nghiêm trọng nhất liên quan đến noindex, và xảy ra thường xuyên hơn bạn nghĩ. Vô tình thêm noindex vào trang quan trọng là cách nhanh nhất để mất traffic tự nhiên.

Tình huống phổ biến nhất: Trong quá trình phát triển website, thêm noindex vào toàn bộ site để Google không lập chỉ mục bản chưa hoàn thiện. Đến lúc website ra mắt thật, quên tắt noindex. Google đến thấy quy tắc cũ và dần dần rút toàn bộ trang ra khỏi chỉ mục.

Plugin SEO cài sai: Yoast SEO và Rank Math có cài đặt toàn cục ảnh hưởng đến nhiều loại trang cùng lúc. Nếu vô tình bật tùy chọn “Không cho phép tìm kiếm” cho loại trang post hoặc page, toàn bộ bài viết hoặc trang tĩnh sẽ bị noindex.

Dấu hiệu nhận biết có thể đang bị noindex nhầm: traffic tự nhiên tụt đột ngột không có lý do rõ ràng, trang không xuất hiện khi tra site:domain.com/url-cu-the trên Google, hoặc Google Search Console báo số trang bị loại trừ (Excluded) tăng bất thường với lý do “noindex”.

Khi tìm hiểu về các yếu tố kỹ thuật ảnh hưởng đến SEO, alt text là gì là bài bổ sung góc nhìn ngược lại: thay vì kiểm soát trang nào Google được phép lập chỉ mục, alt text giúp Google hiểu đúng nội dung của những trang bạn đang muốn Google lập chỉ mục.

Cách kiểm tra noindex có hoạt động chưa

Noindex không có hiệu lực ngay. Googlebot cần ghé lại trang để đọc quy tắc. Quá trình này có thể mất vài ngày đến vài tuần tùy tần suất Google crawl website của bạn.

Kiểm tra ngay lập tức: Xem mã nguồn trang (chuột phải, chọn “Xem mã nguồn” hoặc “View page source”), tìm dòng <meta name="robots" trong phần <head>. Thấy content="noindex" thì noindex đã được gắn vào HTML.

Xác nhận Google đã xử lý: Dùng công cụ URL Inspection trong Google Search Console, nhập URL cần kiểm tra và xem phần “Lập chỉ mục”. Kết quả sẽ cho biết Google đã lập chỉ mục trang này chưa và có phát hiện quy tắc noindex hay chưa. Nếu muốn Google xử lý nhanh hơn, dùng nút “Yêu cầu lập chỉ mục” (Request indexing) sau khi đã thêm noindex.

Quy trình kiểm tra noindex bốn bước: xem mã nguồn trang tìm thẻ meta robots, dùng URL Inspection trong Search Console, yêu cầu Google crawl lại, giám sát danh sách trang bị loại trừ trong phần Coverage
Quy trình kiểm tra noindex từ kiểm tra tức thì trong mã nguồn đến giám sát định kỳ trong Search Console.

Người không rành kỹ thuật cần quan tâm tới mức nào

Nếu bạn dùng WordPress với Rank Math hoặc Yoast SEO, hai việc đáng làm ngay là:

Thứ nhất, vào cài đặt SEO tổng quát và kiểm tra xem có loại trang quan trọng nào đang bị đặt noindex hàng loạt không. Thường gọi là “Search Visibility” hoặc “Cho phép tìm kiếm”. Đặc biệt chú ý các mục Posts, Pages, Products.

Thứ hai, thỉnh thoảng vào Google Search Console, phần Lập chỉ mục, chọn Trang, lọc theo lý do “Được người dùng chọn noindex”. Danh sách trang ở đây là những gì Google thấy bạn đang chặn. Xem qua có trang nào không nên ở đó không.

Câu hỏi thường gặp về noindex

Noindex có nghĩa là Google không crawl trang đó không?

Không. Noindex chỉ yêu cầu Google không đưa trang vào chỉ mục. Google vẫn crawl trang để đọc quy tắc. Khác biệt với robots.txt là công cụ chặn hẳn Googlebot không được vào trang ngay từ đầu.

Trang noindex có mất link authority không?

Không mất theo cách trực tiếp. Link từ các trang khác trỏ vào trang noindex vẫn được Googlebot theo, và link từ trang noindex trỏ đi vẫn có giá trị. Điều bị mất là chính trang đó, vì Google không lập chỉ mục và không hiển thị nó trong kết quả tìm kiếm.

Bao lâu thì Google xử lý noindex?

Không có con số cố định. Google cần ghé thăm trang lần tiếp theo để đọc quy tắc. Với trang được crawl thường xuyên, thường vài ngày là đủ. Với trang ít crawl hơn có thể mất vài tuần. Dùng tính năng “Yêu cầu lập chỉ mục” trong Search Console URL Inspection để Google xử lý sớm hơn.

Xóa bài khỏi WordPress có giống với noindex không?

Không. Xóa bài trong WordPress sẽ trả về lỗi 404 hoặc chuyển hướng, trang biến mất hoàn toàn. Noindex giữ trang đó vẫn hoạt động và người dùng vẫn truy cập được qua link trực tiếp, chỉ là Google không đưa nó vào kết quả tìm kiếm.

Kỹ thuật SEO như noindex, alt text, canonical và nhiều yếu tố kỹ thuật khác cần được kiểm tra và thiết lập đúng ngay từ đầu để tránh mất traffic không đáng. Web22 cung cấp dịch vụ SEO bao gồm audit kỹ thuật toàn diện, phát hiện các lỗi cấu hình noindex, chuẩn hoá alt text và nhiều hạng mục khác, với báo cáo cụ thể từng vấn đề cần xử lý.

Đọc tiếp

Bài viết
cùng chủ đề.

Tất cả bài viết
Chat Zalo