⚙️ 规则配置 (可添加多个 User-agent 规则组)
🗺️ Sitemap 声明 (可选,可多个)
📄 生成的 robots.txt
# 请在左侧配置规则
📊 规则统计
UA组:0
Allow:0
Disallow:0
Sitemap:0
警告:0
💡 robots.txt 规范与使用提示
- 位置:robots.txt 必须放在站点根目录,如
https://www.example.com/robots.txt,全小写文件名 - User-agent:指定规则适用的爬虫,
*表示所有爬虫;特定爬虫如Googlebot、Baiduspider、bingbot - Disallow:禁止爬取的路径。
Disallow: /会屏蔽全站,谨慎使用;Disallow:(空值)表示允许全部 - Allow:允许爬取的路径,优先级高于 Disallow,常用于在屏蔽目录中放行特定页面
- 通配符:
*匹配任意字符序列,$匹配行尾。如/*.pdf$匹配所有 PDF 文件 - Crawl-delay:爬取延迟(秒),部分爬虫(如 Bing)支持,Google 已不再使用
- Sitemap:声明站点地图位置,帮助爬虫发现页面,可声明多个
- 大小限制:单个 robots.txt 建议 ≤500KB,规则行数无硬性限制但建议精简
- 本地处理:所有配置与生成在浏览器本地完成,不上传任何内容