Công cụ Technical SEO miễn phí

Robots.txt Generator - Tạo file robots.txt online

Tạo robots.txt cho WordPress, website doanh nghiệp, E-commerce, Google và các AI crawler chỉ trong vài thao tác. Xem trước, kiểm tra cảnh báo, sao chép hoặc tải file hoàn chỉnh.

Miễn phí
Không đăng ký
Kết quả tức thì

Hỗ trợ crawler Search và AI

robots.txt Đã kiểm tra
  1. User-agent: *
  2. Disallow: /wp-admin/
  3. Allow: /wp-admin/admin-ajax.php
  4.  
  5. User-agent: OAI-SearchBot
  6. Allow: /
  7.  
  8. User-agent: GPTBot
  9. Disallow: /
  10.  
  11. Sitemap: https://example.com/sitemap.xml
PresetWordPress
6+Crawler
được hỗ trợ
Robots.txt Generator

Tạo file robots.txt theo cấu hình website

Chọn preset hoặc tự cấu hình quy tắc chung, Search crawler và AI crawler. Nội dung robots.txt được cập nhật tức thì ở cột kết quả.

Chọn cấu hình nhanh
01

Cấu hình robots.txt

Thiết lập domain, Sitemap và các khu vực cần quản lý.

WordPress
Thông tin websiteDùng để tạo URL Sitemap chính xác
Quy tắc chungÁp dụng cho nhóm User-agent: *
Search & AI crawlersMặc định kế thừa quy tắc chung

Chỉ thị riêng cho crawler sẽ tạo một nhóm User-agent độc lập và không tự kế thừa các path trong nhóm chung.

Đường dẫn tùy chỉnhMỗi dòng nhập một path bắt đầu bằng /
Kiến thức nền tảng

Robots.txt là gì?

Robots.txt là tệp văn bản đặt tại thư mục gốc của website, dùng để hướng dẫn các trình thu thập dữ liệu về những khu vực chúng được phép hoặc không nên truy cập.

Một tệp nhỏ, ảnh hưởng trực tiếp đến cách bot khám phá website

Khi crawler truy cập một tên miền, robots.txt thường là nơi đầu tiên nó kiểm tra. Các quy tắc trong tệp giúp tối ưu ngân sách thu thập dữ liệu, hạn chế bot đi vào trang quản trị, bộ lọc, kết quả tìm kiếm nội bộ hoặc URL không cần thiết.

https://example.com/robots.txt
01

Điều khiển thu thập dữ liệu

Cho phép hoặc hạn chế crawler truy cập các đường dẫn cụ thể.

02

Không phải lệnh xóa index

URL bị chặn crawl vẫn có thể xuất hiện trên kết quả tìm kiếm nếu được liên kết từ nơi khác.

03

Không phải lớp bảo mật

Nội dung tệp được công khai; không dùng robots.txt để che giấu dữ liệu nhạy cảm.

Lưu ý quan trọng: Nếu mục tiêu là không cho một trang xuất hiện trên Google, hãy dùng thẻ noindex và vẫn cho phép Googlebot truy cập trang để đọc thẻ. Chặn bằng robots.txt có thể khiến crawler không nhìn thấy chỉ thị noindex.
Cấu trúc tệp

Các chỉ thị trong robots.txt

Một tệp robots.txt cơ bản được tạo từ nhóm crawler và các quy tắc đường dẫn. Bốn chỉ thị dưới đây đáp ứng phần lớn nhu cầu cấu hình website thông thường.

User-agent

Chọn crawler

Xác định bot hoặc nhóm bot sẽ áp dụng các quy tắc đứng bên dưới. Dấu * đại diện cho tất cả crawler.

User-agent: *

Disallow

Hạn chế crawl

Yêu cầu crawler không truy cập đường dẫn được khai báo. Giá trị / có nghĩa là chặn toàn bộ website.

Disallow: /private/

Allow

Tạo ngoại lệ

Cho phép crawler truy cập một URL cụ thể nằm bên trong thư mục đang bị chặn bởi quy tắc Disallow.

Allow: /wp-admin/admin-ajax.php

Sitemap

Khai báo sơ đồ

Cung cấp URL đầy đủ của XML Sitemap để crawler dễ dàng khám phá các URL quan trọng trên website.

Sitemap: https://example.com/sitemap.xml

Đọc một tệp robots.txt mẫu

Ví dụ này cho phép mọi crawler, chặn thư mục quản trị WordPress, mở ngoại lệ cho AJAX và khai báo vị trí sitemap.

  • Disallow để trống nghĩa là không hạn chế đường dẫn nào trong nhóm đó.
  • Mỗi đường dẫn nên bắt đầu bằng / và được tính từ thư mục gốc của tên miền.
  • Khi tạo nhóm crawler riêng, hãy khai báo đầy đủ quy tắc cần áp dụng cho nhóm đó.
# Áp dụng cho mọi crawler
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Vị trí XML Sitemap
Sitemap: https://example.com/sitemap.xml

Không muốn viết thủ công? Chọn cấu hình phù hợp và xem trước nội dung robots.txt ngay trong công cụ phía trên.

Mở công cụ tạo robots.txt →
Hướng dẫn từng bước

Cách sử dụng công cụ tạo robots.txt

Bạn không cần nhớ cú pháp. Chỉ cần chọn cấu hình phù hợp, kiểm tra nội dung được tạo tự động rồi tải tệp về để đưa lên website.

01

Nhập tên miền và chọn cấu hình mẫu

Điền tên miền website để công cụ gợi ý URL sitemap. Sau đó chọn mẫu phù hợp như WordPress, WooCommerce, website doanh nghiệp, thương mại điện tử hoặc tự cấu hình từ đầu.

example.comWordPressWooCommerce
02

Thiết lập quyền truy cập cho crawler

Chọn cho phép hoặc chặn crawler chung và các bot riêng như Googlebot, Bingbot hoặc crawler AI. Chỉ nên chặn những bot và khu vực thực sự không cần thiết.

User-agentAllowDisallow
03

Thêm đường dẫn cần cho phép hoặc hạn chế

Bổ sung các thư mục không muốn bot thu thập dữ liệu, chẳng hạn trang quản trị, tìm kiếm nội bộ hoặc bộ lọc. Mỗi đường dẫn nên bắt đầu bằng dấu /.

/wp-admin//search//private/
04

Kiểm tra bản xem trước

Đọc lại nội dung robots.txt được tạo ở khung kết quả. Đặc biệt kiểm tra quy tắc Disallow: /, vì chỉ thị này có thể ngăn crawler truy cập toàn bộ website.

05

Sao chép hoặc tải tệp robots.txt

Nhấn Sao chép để lấy nội dung hoặc Tải xuống để nhận tệp. Giữ nguyên tên robots.txt, không đổi sang định dạng Word, HTML hay PDF.

06

Tải lên thư mục gốc và kiểm tra

Đưa tệp vào thư mục gốc của tên miền thông qua hosting, FTP hoặc trình quản lý tệp. Sau đó mở https://tenmien.com/robots.txt để chắc chắn tệp truy cập công khai và hiển thị đúng nội dung.

Kiểm tra đúng vị trí sau khi tải lên

Tệp phải mở được trực tiếp tại thư mục gốc. Nếu URL trả về lỗi 404, chuyển hướng bất thường hoặc hiển thị một trang HTML, crawler có thể không đọc được cấu hình như mong muốn.

# URL kiểm tra
https://example.com/robots.txt

# Ví dụ nội dung hợp lệ
User-agent: *
Disallow: /wp-admin/
Sitemap: https://example.com/sitemap.xml
Kiểm soát dữ liệu AI

Robots.txt và AI Crawlers

Các nền tảng AI sử dụng những crawler khác nhau cho tìm kiếm, truy xuất nội dung theo yêu cầu người dùng và phát triển mô hình. Vì vậy, doanh nghiệp nên thiết lập theo mục tiêu thay vì chặn đồng loạt.

01

Muốn xuất hiện trong kết quả AI

Ưu tiên cho phép crawler phục vụ tìm kiếm và truy xuất nội dung để tăng cơ hội được AI khám phá, trích dẫn hoặc dẫn nguồn.

02

Không muốn dùng để huấn luyện

Chặn riêng crawler phục vụ phát triển mô hình, nhưng vẫn có thể cho phép bot tìm kiếm nếu phù hợp với chiến lược nội dung.

03

Muốn hạn chế toàn bộ

Chặn từng crawler liên quan. Robots.txt là tín hiệu tự nguyện và không thay thế xác thực, tường lửa hay biện pháp bảo vệ dữ liệu.

OPENAI

Tìm kiếm và huấn luyện

OAI-SearchBot

Hiển thị website trong kết quả tìm kiếm của ChatGPT.

Search
GPTBot

Thu thập nội dung có thể dùng để phát triển mô hình.

Training
User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /
ANTHROPIC

Claude Search và Training

Claude-SearchBot

Hỗ trợ khả năng tìm kiếm và chất lượng kết quả.

Search
ClaudeBot

Thu thập nội dung có thể đóng góp cho phát triển mô hình.

Training
User-agent: Claude-SearchBot
Allow: /

User-agent: ClaudeBot
Disallow: /
GOOGLE

Gemini và Google Search

Googlebot

Thu thập dữ liệu phục vụ Google Search.

Search
Google-Extended

Quản lý việc dùng nội dung cho Gemini và khả năng grounding.

AI use
User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Disallow: /
!

Cần phân biệt mục đích của từng bot. Chặn GPTBot không đồng nghĩa chặn OAI-SearchBot; Google-Extended không ảnh hưởng đến việc website có xuất hiện trong Google Search. Một số truy cập do người dùng trực tiếp yêu cầu, như ChatGPT-User, có thể không áp dụng robots.txt theo cách của crawler tự động.

Dùng nhanh, sửa dễ

Thư viện mẫu robots.txt

Chọn mẫu gần nhất với nền tảng của bạn, thay tên miền trong dòng Sitemap và rà soát lại đường dẫn trước khi xuất bản.

Mẫu cho website WordPress

Hạn chế crawler vào trang quản trị nhưng vẫn mở đường dẫn AJAX cần thiết cho giao diện và tính năng website.

Phù hợp

Blog, website tin tức, giới thiệu dịch vụ và website nội dung sử dụng WordPress.

# WordPress cơ bản
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

Mẫu cho WooCommerce

Hạn chế trang giỏ hàng, thanh toán, tài khoản và tham số thêm sản phẩm; giữ cho bot tập trung vào trang sản phẩm và danh mục.

Phù hợp

Website bán hàng dùng WordPress và plugin WooCommerce.

# WooCommerce
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /*?add-to-cart=

Sitemap: https://example.com/sitemap_index.xml

Mẫu cho website doanh nghiệp

Cấu hình đơn giản, cho phép crawler truy cập nội dung công khai và chặn các khu vực nội bộ không cần xuất hiện trong quá trình crawl.

Phù hợp

Website công ty, landing page dịch vụ và hồ sơ năng lực trực tuyến.

# Website doanh nghiệp
User-agent: *
Disallow: /admin/
Disallow: /private/
Disallow: /search/

Sitemap: https://example.com/sitemap.xml

Mẫu cho website E-commerce

Giảm crawl vào giỏ hàng, tài khoản, tìm kiếm nội bộ và URL lọc có tham số. Cần điều chỉnh tên thư mục theo hệ thống thực tế.

Phù hợp

Sàn bán hàng hoặc website thương mại điện tử phát triển riêng.

# E-commerce tổng quát
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search/
Disallow: /*?sort=
Disallow: /*?filter=

Sitemap: https://example.com/sitemap.xml

Mẫu chặn AI Training

Giữ quyền truy cập cho crawler tìm kiếm nhưng từ chối các token dùng để kiểm soát việc sử dụng nội dung cho phát triển mô hình.

Lưu ý

Danh sách bot có thể thay đổi. Nên kiểm tra tài liệu chính thức định kỳ và đánh giá tác động trước khi áp dụng.

# Cho phép crawler tìm kiếm
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /

# Hạn chế sử dụng cho AI
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /

Mẫu cho website thử nghiệm

Chặn crawler truy cập toàn bộ môi trường staging. Hãy kết hợp mật khẩu hoặc giới hạn IP vì robots.txt không phải biện pháp bảo mật.

Cảnh báo

Phải gỡ cấu hình này khi đưa website thật vào hoạt động, nếu không bot sẽ không thể crawl website.

# Chặn toàn bộ website thử nghiệm
User-agent: *
Disallow: /
Kiểm tra trước khi lưu

Những lỗi robots.txt thường gặp

Chỉ một dấu gạch chéo hoặc một quy tắc đặt sai nhóm crawler cũng có thể làm thay đổi phạm vi thu thập dữ liệu. Hãy kiểm tra các lỗi dưới đây trước khi tải tệp lên website.

01

Chặn toàn bộ website ngoài ý muốn

Quy tắc Disallow: / thường được dùng trên website thử nghiệm nhưng bị giữ lại khi website chính thức hoạt động.

Cách sửa: Xóa dấu / hoặc thay bằng đúng thư mục cần hạn chế.
02

Đặt tệp sai vị trí hoặc sai tên

Tệp nằm trong thư mục con, mang tên robots.html hoặc robots.txt.txt sẽ không được crawler xử lý như tệp ở thư mục gốc.

Cách sửa: Đảm bảo mở được tại https://domain.com/robots.txt.
03

Dùng robots.txt để xóa URL khỏi Google

Chặn crawl không đảm bảo URL biến mất khỏi kết quả tìm kiếm; crawler còn không thể đọc thẻ noindex trên trang đã bị chặn.

Cách sửa: Cho phép crawl và dùng thẻ noindex khi cần loại URL khỏi chỉ mục.
04

Chặn tài nguyên cần để hiển thị trang

Hạn chế CSS, JavaScript hoặc hình ảnh quan trọng có thể khiến công cụ tìm kiếm không dựng và đánh giá trang đầy đủ.

Cách sửa: Rà soát các thư mục tài nguyên và chỉ chặn URL thật sự không cần crawl.
05

Nhầm quy tắc giữa các nhóm crawler

Quy tắc đặt dưới một User-agent chỉ thuộc nhóm đó. Cấu trúc thiếu dòng trống hoặc sắp xếp khó đọc dễ dẫn đến cấu hình ngoài ý muốn.

Cách sửa: Tách từng nhóm rõ ràng và khai báo đủ quy tắc cần áp dụng cho từng bot.
06

Khai báo Sitemap sai địa chỉ

Sitemap dùng đường dẫn tương đối, sai giao thức, sai tên miền hoặc trả về lỗi khiến crawler không thể truy cập đúng sơ đồ website.

Cách sửa: Dùng URL đầy đủ, ví dụ https://domain.com/sitemap.xml.
07

Chặn URL tham số quá rộng

Quy tắc wildcard thiếu kiểm tra có thể vô tình bao phủ trang sản phẩm, danh mục hoặc landing page tạo doanh thu.

Cách sửa: Kiểm tra từng mẫu URL thật và bắt đầu bằng phạm vi hẹp.
08

Xem robots.txt như một lớp bảo mật

Nội dung tệp được công khai và crawler không tuân thủ vẫn có thể bỏ qua quy tắc. robots.txt không bảo vệ dữ liệu riêng tư.

Cách sửa: Dùng đăng nhập, phân quyền, giới hạn IP hoặc cấu hình máy chủ cho dữ liệu nhạy cảm.
!

Luôn sao lưu phiên bản đang hoạt động

Trước khi thay đổi, hãy lưu lại tệp cũ để có thể khôi phục nhanh nếu phát hiện traffic crawl hoặc khả năng hiển thị bị ảnh hưởng.

Kiểm tra và tạo lại →
Dành cho nhiều vai trò

Ai nên sử dụng công cụ?

Công cụ phù hợp với người cần tạo nhanh một cấu hình rõ ràng hoặc muốn kiểm tra lại logic trước khi chỉnh sửa robots.txt trên website thật.

01

Chủ website và doanh nghiệp

Tạo cấu hình cơ bản mà không phải tự ghi nhớ toàn bộ cú pháp kỹ thuật.

Nhu cầu: bảo vệ khu vực quản trị và khai báo sitemap.
02

SEO Executive và SEO Manager

Kiểm soát phạm vi crawl, URL tham số, faceted navigation và crawler AI theo chiến lược.

Nhu cầu: tối ưu crawl budget và hạn chế URL không giá trị.
03

Developer và quản trị website

Tạo bản nháp để phối hợp với đội SEO trước khi triển khai trên máy chủ hoặc môi trường production.

Nhu cầu: cấu hình nhất quán, dễ kiểm tra và bàn giao.
04

Agency và người quản lý nhiều website

Dùng mẫu làm điểm khởi đầu cho nhiều nền tảng, sau đó tùy chỉnh theo cấu trúc từng dự án.

Nhu cầu: rút ngắn thời gian thiết lập và giảm lỗi thủ công.

Khi nào bạn nên dùng công cụ ngay?

Nếu có ít nhất một tình huống bên cạnh, bạn có thể tạo bản nháp bằng công cụ rồi gửi cho người phụ trách SEO hoặc kỹ thuật kiểm tra trước khi xuất bản.

Website mới chưa có tệp robots.txt.
Website vừa thay đổi nền tảng, cấu trúc URL hoặc tên miền.
Google crawl quá nhiều URL lọc, tìm kiếm hoặc tham số.
Doanh nghiệp cần thiết lập quyền truy cập cho AI Crawlers.
Cấu hình được tạo trực tiếp trên trình duyệt và có thể tải xuống ngay.Sử dụng công cụ miễn phí →
Chuyên môn đứng sau công cụ

Người xây dựng Robots.txt Generator

Công cụ được phát triển từ nhu cầu tạo cấu hình robots.txt nhanh, dễ kiểm tra và phù hợp hơn với các website đang làm SEO.

Lê Đức Tuấn - Founder và CEO SEO HOTSEO HOT
Founder & Digital Growth Strategist

Lê Đức Tuấn

Founder & CEO SEO HOT, phụ trách định hướng chiến lược SEO, Technical SEO, nội dung và AI Search. Robots.txt Generator được xây dựng để giúp chủ website và người làm SEO chuyển nhu cầu kiểm soát crawler thành cấu hình dễ hiểu, có thể kiểm tra trước khi triển khai.

Dễ sử dụngKhông yêu cầu người dùng ghi nhớ toàn bộ cú pháp.
Có giải thíchMỗi lựa chọn gắn với mục đích và tác động cụ thể.
Có thể tùy chỉnhPhù hợp nhiều nền tảng, crawler và cấu trúc URL.
“Một tệp robots.txt tốt không cần phức tạp. Điều quan trọng là mỗi quy tắc đều có mục đích rõ ràng và được kiểm tra trước khi xuất bản.”
Giải đáp nhanh

Câu hỏi thường gặp về robots.txt

Những câu trả lời ngắn gọn giúp bạn hiểu đúng vai trò của tệp và tránh các cấu hình có thể ảnh hưởng đến khả năng thu thập dữ liệu.

Website có bắt buộc phải có file robots.txt không?

Không bắt buộc. Crawler vẫn có thể truy cập website khi không có robots.txt. Tuy nhiên, tệp này hữu ích khi bạn muốn hướng crawler tránh trang quản trị, tìm kiếm nội bộ, URL tham số hoặc những khu vực không cần thu thập dữ liệu.

File robots.txt phải được đặt ở đâu?

Tệp phải nằm tại thư mục gốc của từng tên miền hoặc subdomain và truy cập được qua địa chỉ dạng https://example.com/robots.txt. Tệp đặt trong thư mục con không điều khiển toàn bộ website.

Disallow trong robots.txt có xóa trang khỏi Google không?

Không. Disallow chủ yếu hạn chế việc crawl URL. Một URL bị chặn vẫn có thể xuất hiện trên kết quả tìm kiếm nếu Google biết đến URL từ liên kết khác. Khi cần ngăn lập chỉ mục, hãy dùng noindex và cho phép crawler truy cập để đọc chỉ thị đó.

Allow và Disallow khác nhau như thế nào?

Disallow khai báo đường dẫn crawler không nên truy cập; Allow thường được dùng để tạo ngoại lệ được phép crawl bên trong một khu vực đã bị chặn.

Có thể khai báo nhiều Sitemap trong robots.txt không?

Có. Bạn có thể thêm nhiều dòng Sitemap, mỗi dòng chứa một URL sitemap đầy đủ. Với WordPress sử dụng sitemap index, thông thường chỉ cần khai báo URL của tệp sitemap index.

Có nên chặn toàn bộ AI Crawlers không?

Không có một lựa chọn phù hợp cho mọi website. Bạn nên phân biệt bot phục vụ tìm kiếm, truy xuất nội dung và phát triển mô hình. Nếu muốn tăng khả năng xuất hiện trong câu trả lời AI nhưng không muốn nội dung dùng cho huấn luyện, có thể cho phép bot tìm kiếm và chặn riêng bot training.

Sau khi sửa robots.txt, thay đổi có hiệu lực ngay không?

Tệp mới có hiệu lực khi crawler tải và xử lý lại robots.txt. Thời gian cập nhật tùy từng hệ thống. Sau khi thay đổi, hãy kiểm tra URL của tệp, theo dõi log máy chủ và báo cáo crawl hoặc index trong công cụ quản trị tìm kiếm.

Công cụ này có tự động cập nhật robots.txt trên website không?

Không. Công cụ tạo nội dung và tệp để bạn tải xuống. Bạn vẫn cần đưa robots.txt lên thư mục gốc thông qua hosting, FTP, trình quản lý tệp hoặc nhờ đơn vị quản trị website triển khai.

SEO HOT · Technical SEO

Tạo robots.txt đúng ngay từ đầu

Sử dụng công cụ miễn phí để tạo cấu hình trong vài phút. Nếu website có hàng nghìn URL, bộ lọc phức tạp hoặc vấn đề crawl và index, SEO HOT có thể hỗ trợ kiểm tra Technical SEO toàn diện.

Tạo robots.txt miễn phí Tìm hiểu dịch vụ SEO
Không cần đăng ký để sử dụng công cụ.
SEO HOT
SEO HOT là công ty SEO tại TPHCM chuyên cung cấp các gói dịch vụ SEO tổng thể website, cùng các gói dịch vụ Digital Marketing, thiết kế website trọn gói.