Một tệp nhỏ, ảnh hưởng trực tiếp đến cách bot khám phá website
Khi crawler truy cập một tên miền, robots.txt thường là nơi đầu tiên nó kiểm tra. Các quy tắc trong tệp giúp tối ưu ngân sách thu thập dữ liệu, hạn chế bot đi vào trang quản trị, bộ lọc, kết quả tìm kiếm nội bộ hoặc URL không cần thiết.
https://example.com/robots.txtĐiều khiển thu thập dữ liệu
Cho phép hoặc hạn chế crawler truy cập các đường dẫn cụ thể.
Không phải lệnh xóa index
URL bị chặn crawl vẫn có thể xuất hiện trên kết quả tìm kiếm nếu được liên kết từ nơi khác.
Không phải lớp bảo mật
Nội dung tệp được công khai; không dùng robots.txt để che giấu dữ liệu nhạy cảm.

