File Robots.txt là gì? Hướng dẫn cấu hình chuẩn SEO cho Website Next.js

2026-07-24 7 phút đọcBởi Uwmee Software

File robots.txt là tệp văn bản nằm ở thư mục gốc của website (ví dụ: uwmee.com/robots.txt) chứa các chỉ thị hướng dẫn cho các con bọ cào (Web Crawlers) biết trang nào được phép càotrang nào bị cấm cào. Đây là công cụ nền tảng để kiểm soát Crawl Budget.

1. Cấu trúc cơ bản của file Robots.txt

# Cho phép tất cả bot cào mọi trang
User-agent: *
Allow: /

# Chặn bot cào trang quản trị
User-agent: *
Disallow: /admin/
Disallow: /api/

# Liên kết Sitemap
Sitemap: https://uwmee.com/sitemap.xml

2. Các chỉ thị quan trọng trong Robots.txt

  • User-agent: Xác định con bọ nào áp dụng quy tắc (Googlebot, Bingbot, hoặc * cho tất cả).
  • Disallow: Cấm cào đường dẫn cụ thể hoặc thư mục con.
  • Allow: Cho phép cào một đường dẫn con nằm trong thư mục đã bị Disallow.
  • Sitemap: Khai báo URL tuyệt đối tới file Sitemap.xml.

3. Tạo file robots.txt động trong Next.js App Router

Trong Next.js App Router, tạo file app/robots.js (hoặc app/robots.ts):

export default function robots() {
  return {
    rules: [
      {
        userAgent: '*',
        allow: '/',
        disallow: ['/admin/', '/api/'],
      },
    ],
    sitemap: 'https://uwmee.com/sitemap.xml',
  };
}

Kết luận

Cấu hình robots.txt đúng cách là bước nền tảng giúp kiểm soát hành vi cào dữ liệu của Googlebot. Uwmee Software cấu hình sẵn robots.txt và sitemap.xml chuẩn SEO cho mọi website Next.js bàn giao. Đọc thêm bài viết Noindex và Nofollow là gì.

Cần vượt Closed Testing nhanh chóng?

Đội 12+ tester thật của Uwmee tương tác hằng ngày đủ 14 ngày — trọn gói chỉ 300.000đ, chạy lại miễn phí nếu không đạt.

Câu hỏi thường gặp