File robots.txt chuẩn SEO với hướng dẫn bot và sitemap — NguyenThaiMMO
SEO & Content

Robots.txt Là Gì? Cách Tạo File Robots.txt Chuẩn SEO

Thẩm định nội dung

Nội dung trên nguyenthaimmo.com được trực tiếp triển khai, kiểm thử và biên soạn bởi NguyenThaiMMO – người có nhiều năm kinh nghiệm thực chiến trong WordPress, SEO kỹ thuật, Automation, MMO & Affiliate.

Mỗi bài viết đều được thẩm định dựa trên trải nghiệm thực tế, ưu tiên hướng dẫn từng bước, chỉ ra lỗi thường gặp và giải pháp cụ thể, nhằm giúp người đọc áp dụng được ngay, hạn chế rủi ro và tối ưu hiệu quả lâu dài.

Cập nhật ngày 14/08/2026.

File robots.txt chuẩn SEO không cần dài hoặc chứa thật nhiều quy tắc. Nhiều người gọi nhầm là “file robot”, nhưng tên chính xác là robots.txt: một tệp văn bản đặt ở thư mục gốc của website, dùng để hướng dẫn bot tìm kiếm những khu vực nào được phép hoặc không được phép thu thập dữ liệu.

Vấn đề là một file robots.txt dài chưa chắc tốt cho SEO. Chỉ một dòng Disallow đặt sai cũng có thể khiến Google không tải được nội dung, CSS, JavaScript hoặc tài nguyên cần thiết để hiểu trang. Ngược lại, chặn một URL trong robots.txt cũng không đảm bảo URL đó biến mất khỏi kết quả tìm kiếm.

Góc nhìn NguyenThaiMMO: Robots.txt tốt không phải là file có nhiều quy tắc nhất, mà là file ngắn, đúng mục đích, phù hợp cấu trúc website và đã được kiểm tra trước khi áp dụng.

Mục lục nội dung

Robots.txt là gì?

Robots.txt là một phần của Robots Exclusion Protocol. Khi một crawler hỗ trợ giao thức này chuẩn bị truy cập website, nó tải tệp robots.txt ở địa chỉ dạng https://tenmien.com/robots.txt để xác định đường dẫn nào được phép crawl.

Google cho biết mục đích chính của robots.txt là quản lý lưu lượng thu thập dữ liệu và hạn chế bot truy cập các URL không cần thiết hoặc lặp lại. Nó không phải cơ chế bảo mật và cũng không phải công cụ chính để ngăn một trang xuất hiện trên Google.

Robots.txt chỉ có hiệu lực trong đúng phạm vi giao thức, tên miền phụ và cổng nơi tệp được đặt. Ví dụ, file ở https://example.com/robots.txt không tự động áp dụng cho https://shop.example.com/.

Nếu bạn đang xây website mới, hãy xem thêm hướng dẫn làm website WordPress cho người mới để hiểu cấu trúc cơ bản trước khi chỉnh các tệp kỹ thuật.

Robots.txt hoạt động như thế nào?

Sơ đồ file robots.txt chuẩn SEO cho phép hoặc chặn bot thu thập URL

Mỗi nhóm quy tắc thường bắt đầu bằng User-agent, sau đó là một hoặc nhiều dòng AllowDisallow. Dòng Sitemap có thể đặt riêng và không gắn với một user-agent cụ thể.

Ý nghĩa của các directive quan trọng

  • User-agent: xác định crawler được áp dụng quy tắc. Dấu * đại diện cho tất cả crawler phù hợp.
  • Disallow: yêu cầu crawler không truy cập đường dẫn được chỉ định.
  • Allow: cho phép crawl một đường dẫn cụ thể nằm trong khu vực rộng hơn đang bị chặn.
  • Sitemap: khai báo URL đầy đủ của sitemap hoặc sitemap index.

Với Google, crawler chọn nhóm user-agent cụ thể nhất phù hợp. Nhóm dành riêng cho Googlebot và nhóm toàn cục User-agent: * không được tự động gộp lại. Vì vậy, nếu bạn tạo một nhóm riêng cho Googlebot, hãy chắc chắn nhóm đó có đủ quy tắc cần thiết.

Googlebot Smartphone và Googlebot Desktop cùng tuân theo token Googlebot. Bạn không cần tạo một nhóm Googlebot-Mobile riêng để điều khiển phiên bản mobile.

Quy tắc nào được ưu tiên?

Khi nhiều quy tắc cùng khớp một URL, Google chọn quy tắc có đường dẫn cụ thể hơn. Nếu hai quy tắc có độ cụ thể ngang nhau nhưng xung đột, Google dùng quy tắc ít hạn chế hơn. Vì cách so khớp này dễ gây nhầm lẫn, bạn nên giữ file đơn giản và thử từng URL quan trọng sau khi chỉnh sửa.

Robots.txt không giống noindex

So sánh robots.txt chặn thu thập và noindex chặn lập chỉ mục — NguyenThaiMMO

Đây là điểm dễ sai nhất khi tối ưu kỹ thuật SEO:

Công cụMục đích chínhĐiều cần nhớ
robots.txtQuản lý việc crawler truy cập URLURL bị chặn vẫn có thể được phát hiện và xuất hiện không có mô tả nếu có liên kết trỏ tới
noindexYêu cầu công cụ tìm kiếm không lập chỉ mục URLGoogle phải crawl được trang để nhìn thấy lệnh noindex
Mật khẩu hoặc xác thựcBảo vệ nội dung riêng tưPhù hợp khi dữ liệu thực sự không được phép công khai

Nếu một trang đã có thẻ noindex nhưng lại bị chặn trong robots.txt, Google có thể không truy cập được trang để đọc thẻ đó. Vì vậy, đừng dùng đồng thời hai cơ chế mà không hiểu thứ tự hoạt động.

Robots.txt cũng không bảo vệ dữ liệu nhạy cảm. Bất kỳ ai cũng có thể mở tệp này và xem các đường dẫn bạn khai báo. Trang quản trị, dữ liệu khách hàng, hóa đơn hoặc tài liệu nội bộ phải được bảo vệ bằng đăng nhập, phân quyền và cấu hình máy chủ phù hợp.

Vì sao không nên sao chép một file robots.txt “chuẩn SEO” trên mạng?

Mỗi website có cấu trúc URL, plugin, chức năng tìm kiếm, bộ lọc và trang chuyển đổi khác nhau. Một mẫu được viết cho sàn thương mại điện tử có thể chứa các đường dẫn như /buyer/, /mall/ hoặc /shop/, nhưng các đường dẫn này không có ý nghĩa trên một blog WordPress thông thường.

Sao chép một file dài còn tạo ra ba rủi ro:

  1. Chặn nhầm nội dung có giá trị: danh mục, bài viết hoặc tài nguyên cần để Google render trang có thể không được crawl.
  2. Tạo cảm giác tối ưu giả: nhiều directive không liên quan không giúp tăng hạng nhưng làm việc kiểm tra khó hơn.
  3. Khó bảo trì: khi theme, plugin hoặc cấu trúc permalink thay đổi, bạn không biết rule nào còn cần thiết.

Đối với WordPress, hãy ưu tiên một cấu hình tối thiểu rồi chỉ thêm rule khi bạn nhìn thấy vấn đề crawl thực tế trong Google Search Console hoặc log máy chủ.

Ba mẫu robots.txt theo từng loại website

Không có một file robots.txt phù hợp cho mọi website. Hãy chọn đúng mẫu theo mô hình đang vận hành, thay tên miền trong dòng Sitemap, rồi kiểm tra các URL quan trọng trước khi lưu.

MẫuPhù hợpMức độ
Mẫu 1Website WordPress mới bắt đầuTối thiểu, ít rủi ro
Mẫu 2Website thương mại điện tử/WooCommerceCó thêm URL giao dịch
Mẫu 3Website blog/nội dungGiảm crawl khu vực hệ thống

Mẫu 1: Website WordPress mới bắt đầu

Đây là lựa chọn nên dùng nếu website mới hoạt động, số lượng URL chưa nhiều và bạn chưa thấy vấn đề crawl cụ thể trong Search Console.

# ROBOTS.TXT CƠ BẢN CHO WORDPRESS
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tenmiencuaban.com/sitemap_index.xml

Bạn cần sửa: thay https://tenmiencuaban.com bằng tên miền thật. Nếu plugin SEO của bạn dùng sitemap khác, hãy mở sitemap trong trình duyệt và chép đúng URL.

Không cần thêm Allow: /: mặc định bot được phép crawl những đường dẫn không bị chặn. Cấu hình ngắn giúp người mới dễ kiểm tra và ít nguy cơ khóa nhầm website.

Mẫu 2: Website thương mại điện tử hoặc WooCommerce

Mẫu này bổ sung các URL giao dịch thường không cần crawler truy cập. Nó không thay thế việc cấu hình noindex cho giỏ hàng, thanh toán và tài khoản trong plugin SEO.

# ROBOTS.TXT CHO WOOCOMMERCE
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Trang giao dịch
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# URL thao tác tạo bằng tham số
Disallow: /*?add-to-cart=
Disallow: /*?add_to_wishlist=

Sitemap: https://tenmiencuaban.com/sitemap_index.xml

Trước khi dùng: kiểm tra slug thật của trang giỏ hàng, thanh toán và tài khoản trong WooCommerce. Nếu website dùng đường dẫn tiếng Việt hoặc đã đổi slug, các dòng mẫu phía trên sẽ không khớp.

Đối với bộ lọc sản phẩm: không nên chặn hàng loạt filter_, orderby, giá hoặc thuộc tính chỉ vì thấy một mẫu trên mạng. Hãy lấy URL thật từ Search Console hoặc log server. Một số trang bộ lọc có thể mang giá trị tìm kiếm và cần được giữ lại.

Lưu ý: Robots.txt chỉ hạn chế crawl. Nếu mục tiêu là không cho trang giỏ hàng hoặc tài khoản xuất hiện trong Google, hãy cấu hình noindex phù hợp và đảm bảo Google vẫn có thể đọc lệnh đó.

Mẫu 3: Website blog hoặc website nội dung

Blog cần để bot truy cập bài viết, trang, danh mục, ảnh, CSS và JavaScript. Không nên chặn toàn bộ thư mục upload, category hoặc tag nếu chưa đánh giá giá trị của các trang lưu trữ.

# ROBOTS.TXT CHO BLOG WORDPRESS
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Giảm crawl các endpoint hệ thống
Disallow: /wp-login.php
Disallow: /xmlrpc.php
Disallow: /trackback/

Sitemap: https://tenmiencuaban.com/sitemap_index.xml

Không chặn mặc định: /wp-content/, /uploads/, file CSS, JavaScript, ảnh, bài viết, danh mục hoặc tag. Google cần tài nguyên giao diện để render trang; category và tag cũng có thể xếp hạng nếu được tối ưu thành trang chủ đề có giá trị.

Nếu blog có trang tìm kiếm nội bộ dạng /?s=tu-khoa, ưu tiên đặt noindex bằng plugin SEO. Chỉ bổ sung rule crawl sau khi bạn hiểu rõ ảnh hưởng.

Cách chọn nhanh

  • Website mới hoặc chưa chắc chắn: dùng Mẫu 1.
  • Cửa hàng WooCommerce: bắt đầu từ Mẫu 2 nhưng thay đúng slug giao dịch.
  • Blog tập trung SEO nội dung: dùng Mẫu 3 và giữ tài nguyên, category, tag được crawl.
  • Website vừa bán hàng vừa viết blog: dùng Mẫu 2 làm nền, nhưng không chặn thư mục bài viết, category, tag hoặc media.

Cách tạo file robots.txt chuẩn SEO thủ công và lưu ở đâu?

File phải có tên chính xác là robots.txt, viết thường, không phải robot.txt, robots.txt.txt hoặc một file Word. Nó phải là văn bản thuần và được lưu tại document root của đúng tên miền.

Document root thường là public_html đối với tên miền chính, nhưng tên miền phụ hoặc addon domain có thể dùng thư mục khác. Trong WordPress, vị trí đúng thường là thư mục đang chứa wp-admin, wp-content, wp-includeswp-config.php.

Cách 1: Tạo robots.txt bằng cPanel File Manager

Các bước tạo file robots.txt trong cPanel File Manager — NguyenThaiMMO
Minh họa quy trình tạo robots.txt bằng cPanel File Manager; giao diện có thể khác tùy nhà cung cấp hosting.
  1. Sao lưu file hiện tại: mở https://tenmiencuaban.com/robots.txt. Nếu đã có nội dung, sao chép và lưu vào máy trước khi chỉnh.
  2. Mở File Manager: đăng nhập cPanel, chọn Files → File Manager.
  3. Xác định document root: mở public_html hoặc thư mục gốc của tên miền. Hãy tìm các thư mục wp-admin, wp-contentwp-includes để xác nhận.
  4. Kiểm tra file cũ: tìm robots.txt. Nếu có, tải xuống làm bản sao lưu rồi chọn Edit. Nếu chưa có, nhấn + File, nhập robots.txt và chọn Create New File.
  5. Dán một trong ba mẫu: sửa tên miền ở dòng Sitemap và xóa các rule không phù hợp.
  6. Lưu: dùng mã hóa UTF-8, quyền file thông thường 0644, sau đó bấm Save Changes.
  7. Kiểm tra công khai: mở lại https://tenmiencuaban.com/robots.txt trong cửa sổ ẩn danh.

Theo tài liệu cPanel, thao tác tạo file là + File → nhập tên và vị trí → Create New File. Giao diện có thể khác nhẹ tùy nhà cung cấp hosting.

Cách 2: Tạo robots.txt bằng FTP hoặc SFTP

Các bước tải file robots.txt lên document root bằng FTP hoặc SFTP — NguyenThaiMMO
Minh họa quy trình tải robots.txt lên document root bằng FTP/SFTP; giao diện có thể khác tùy phần mềm.
  1. Mở Notepad, VS Code hoặc trình soạn thảo văn bản thuần.
  2. Dán mẫu phù hợp và lưu tên robots.txt với UTF-8.
  3. Kết nối hosting bằng FTP/SFTP.
  4. Mở document root của tên miền — cùng cấp với wp-adminwp-content.
  5. Tải file lên, đặt quyền đọc thông thường 0644.
  6. Mở URL công khai để kiểm tra.

Quan trọng: nếu bạn đã tạo file robots.txt vật lý bằng cPanel/FTP, trình chỉnh sửa robots.txt ảo của Rank Math có thể không có hiệu lực. Hãy chọn một cách quản lý duy nhất.

Thực hành: chèn robots.txt bằng plugin Rank Math

Rank Math tạo một file robots.txt ảo và cho phép chỉnh trong WordPress. Theo hướng dẫn chính thức của Rank Math, nếu server đang có file robots.txt vật lý ở document root, bạn phải sao lưu rồi xóa file đó nếu muốn chuyển sang quản lý bằng Rank Math.

Bước 1: Mở Rank Math SEO

Đăng nhập quản trị WordPress và nhấn Rank Math SEO ở menu bên trái.

Mở menu Rank Math SEO trong quản trị WordPress
Bước 1: Mở Rank Math SEO trong WordPress — nguồn ảnh: tài liệu chính thức Rank Math.

Bước 2: Bật Advanced Mode và mở General Settings

Trong màn hình Rank Math Dashboard, bật Advanced Mode ở góc trên bên phải. Sau đó chọn General Settings. Nếu đang ở Easy Mode, mục chỉnh robots.txt có thể không xuất hiện.

Bật Advanced Mode và mở General Settings trong Rank Math
Bước 2: Bật Advanced Mode và chọn General Settings — nguồn ảnh: tài liệu chính thức Rank Math.

Bước 3: Chọn Edit robots.txt

Trong General Settings, tìm và nhấn Edit robots.txt ở cột tùy chọn.

Chọn Edit robots.txt trong General Settings của Rank Math
Bước 3: Mở trình chỉnh sửa robots.txt — nguồn ảnh: tài liệu chính thức Rank Math.

Bước 4: Dán mẫu robots.txt phù hợp

Sao chép Mẫu 1, 2 hoặc 3 phía trên, dán vào ô chỉnh sửa và thay tên miền ở dòng Sitemap. Không dán cả ba mẫu cùng lúc. Trước khi lưu, tìm và xóa bất kỳ dòng Disallow: / nào trên website đang hoạt động.

Dán mẫu robots.txt vào trình chỉnh sửa của Rank Math
Bước 4: Dán hoặc chỉnh sửa nội dung robots.txt — nguồn ảnh: tài liệu chính thức Rank Math.

Bước 5: Lưu và kiểm tra URL

Với bản miễn phí, nhấn Save Changes rồi dùng liên kết Robots.txt Tester. Với giao diện PRO có công cụ kiểm tra tích hợp, chọn user-agent, nhập URL cần thử và nhấn Test. Hãy thử ít nhất trang chủ, một bài viết, một ảnh, trang quản trị và một trang giao dịch.

Chọn user-agent và kiểm tra URL trong Robots.txt Tester của Rank Math
Bước 5: Chọn user-agent và kiểm tra URL — nguồn ảnh: tài liệu chính thức Rank Math.

Nếu không thấy mục Edit robots.txt

  • Kiểm tra Rank Math đang ở Advanced Mode.
  • Kiểm tra document root có file robots.txt vật lý hay không.
  • Kiểm tra plugin SEO hoặc plugin bảo mật khác có đang tạo robots.txt hay không.
  • Nếu có thông báo file không thể chỉnh sửa, không nên tự ý nới quyền máy chủ. Hãy sao lưu và liên hệ hosting hoặc kiểm tra cấu hình wp-config.php.

Sau khi lưu, luôn mở https://tenmiencuaban.com/robots.txt ở cửa sổ ẩn danh. Nội dung hiển thị tại URL công khai mới là bản crawler thực sự nhận được.

Có nên chặn giỏ hàng, tìm kiếm và URL tham số?

Câu trả lời là: chỉ chặn khi bạn biết chính xác mục tiêu.

Trang giỏ hàng và thanh toán

Với WooCommerce, các trang giỏ hàng, thanh toán và tài khoản thường không cần xuất hiện trong kết quả tìm kiếm. Tuy nhiên, cách kiểm soát lập chỉ mục nên được cấu hình bằng thẻ robots phù hợp trong plugin SEO. Nếu bạn chặn crawl trước, Google có thể không nhìn thấy thẻ noindex.

Kết quả tìm kiếm nội bộ

URL tìm kiếm nội bộ có thể tạo nhiều trang ít giá trị. Trước khi chặn bằng robots.txt, hãy kiểm tra cách theme và plugin SEO đang xử lý canonical và noindex. Đừng áp dụng một rule rộng như Disallow: /search nếu website có bài viết hoặc trang hợp lệ bắt đầu bằng chuỗi đó.

Tham số lọc và URL vô hạn

Website bán hàng có thể phát sinh rất nhiều URL do bộ lọc, sắp xếp, màu sắc hoặc tracking. Đây là trường hợp robots.txt có thể giúp giảm crawl không cần thiết, nhưng rule phải dựa trên cấu trúc URL thật. Hãy lấy mẫu URL trong Search Console hoặc log server rồi thử riêng từng pattern.

Nếu bạn vận hành WooCommerce, có thể đọc thêm bài làm website bán hàng với WooCommerce. Khi chỉnh code hoặc rule hệ thống, nên kết hợp checklist bảo mật trong bài các dạng tấn công website WordPress.

Cách kiểm tra robots.txt trước khi lưu

Quy trình kiểm tra cú pháp URL và sitemap trong robots.txt — NguyenThaiMMO

Bước 1: Sao lưu cấu hình hiện tại

Mở địa chỉ https://tenmien.com/robots.txt, lưu lại nội dung hiện tại và ghi ngày thay đổi. Nếu plugin SEO tạo robots.txt ảo, hãy chụp lại màn hình cài đặt trước khi sửa.

Bước 2: Kiểm tra cú pháp

Đảm bảo mỗi dòng có dạng field: value, tệp là văn bản thuần UTF-8 và đường dẫn bắt đầu bằng dấu /. Google hỗ trợ ký tự đại diện * và ký tự kết thúc URL $, nhưng đừng dùng wildcard nếu một đường dẫn rõ ràng đã đủ.

Bước 3: Thử các URL quan trọng

Lập danh sách ít nhất gồm trang chủ, bài viết, danh mục, ảnh, CSS/JavaScript chính, trang quản trị, trang tìm kiếm và trang chuyển đổi. Với mỗi URL, ghi rõ bạn muốn “được crawl” hay “không crawl”, sau đó đối chiếu với rule.

Bước 4: Kiểm tra sitemap

Mở URL sitemap trong trình duyệt và xác nhận nó trả về nội dung XML hợp lệ, không chỉ dựa vào mã HTTP 200. Sitemap nên chứa các URL chuẩn mà bạn muốn công cụ tìm kiếm khám phá.

Bước 5: Kiểm tra trong Google Search Console

Dùng công cụ Kiểm tra URL để xem Google có được phép crawl trang quan trọng hay không. Sau khi thay đổi, theo dõi báo cáo lập chỉ mục và thống kê crawl. Robots.txt có thể được cache, vì vậy thay đổi không nhất thiết có hiệu lực ngay lập tức.

Sau khi hoàn tất phần crawl, bạn có thể kiểm tra thêm tốc độ bằng hướng dẫn tối ưu Google PageSpeed cho website. Crawl đúng nhưng trang quá chậm vẫn tạo trải nghiệm tìm kiếm kém.

Những lỗi robots.txt thường gặp

  • Dùng Disallow: / trên website thật và vô tình chặn toàn bộ site.
  • Cho rằng robots.txt có thể giữ bí mật URL hoặc dữ liệu nhạy cảm.
  • Chặn trang đang có noindex, khiến crawler không đọc được lệnh.
  • Tạo nhóm riêng cho Googlebot nhưng quên rằng nhóm này không tự gộp với User-agent: *.
  • Chặn CSS, JavaScript hoặc ảnh quan trọng khiến Google render trang không đầy đủ.
  • Sao chép rule của website khác mà không kiểm tra cấu trúc URL.
  • Khai báo sai sitemap hoặc sitemap trả về HTML/lỗi thay vì XML.
  • Dùng nhiều rule trùng lặp và ký tự bị lỗi mã hóa.
  • Chỉnh trực tiếp nhưng không sao lưu và không có cách hoàn tác.

Ai nên và không nên tự chỉnh robots.txt?

Phù hợp: người quản trị hiểu cấu trúc URL, có quyền sao lưu, biết dùng Search Console và có thể thử các URL trước khi triển khai.

Không phù hợp: người chỉ muốn “tăng điểm SEO” bằng cách sao chép một file mẫu dài hoặc không biết trang nào đang tạo doanh thu và organic traffic. Trong trường hợp này, cấu hình tối thiểu của WordPress và plugin SEO thường an toàn hơn.

Câu hỏi thường gặp

Robots.txt có giúp website lên top không?

Không trực tiếp. Tệp này giúp crawler sử dụng tài nguyên hợp lý hơn và tránh một số khu vực không cần thiết. Thứ hạng vẫn phụ thuộc vào chất lượng nội dung, khả năng đáp ứng nhu cầu tìm kiếm, liên kết, trải nghiệm và nhiều tín hiệu khác.

Không có robots.txt thì website có được index không?

Có thể. Khi không có tệp hợp lệ và máy chủ trả về một số trạng thái như 404, Google thường hiểu rằng không có giới hạn crawl. Tuy nhiên, bạn vẫn nên có cấu hình rõ ràng và sitemap đúng nếu website cần quản lý nhiều URL.

Có nên chặn bot AI trong robots.txt không?

Đây là quyết định về phân phối và cấp quyền nội dung, không phải mẹo SEO chung. Trước khi chặn một crawler cụ thể, hãy xác định mục tiêu: giảm tải máy chủ, hạn chế huấn luyện, hay không muốn nội dung xuất hiện trong một sản phẩm nhất định. Mỗi crawler có token và chính sách riêng, vì vậy không nên dùng một danh sách sao chép thiếu nguồn.

Sửa robots.txt bao lâu thì Google nhận?

Google thường cache robots.txt trong một khoảng thời gian và có thể giữ lâu hơn khi không tải được bản mới. Sau khi sửa, hãy kiểm tra file công khai, theo dõi Search Console và chờ crawler tải lại thay vì thay đổi liên tục.

Kết luận

Một file robots.txt chuẩn SEO nên ngắn, đúng cấu trúc website và có thể giải thích được từng dòng. Với WordPress, hãy bắt đầu bằng việc chặn khu vực quản trị, cho phép endpoint AJAX cần thiết và khai báo sitemap. Chỉ bổ sung rule cho tìm kiếm nội bộ, URL tham số hoặc trang chuyển đổi khi bạn có dữ liệu cho thấy chúng đang tạo vấn đề crawl.

Quan trọng nhất: dùng robots.txt để quản lý thu thập dữ liệu, dùng noindex để quản lý lập chỉ mục, và dùng xác thực để bảo vệ dữ liệu riêng tư.

Nguồn tham khảo

Đánh giá bài viết

1/5 - (1 vote)

Đánh giá độ hữu ích của bài viết

Tag Website:

0 GÓP Ý

Đang tải bình luận...
Messenger Zalo YouTube Bình luận