SEO 与站长

robots.txt 生成与校验器

在浏览器中生成、校验和解析 robots.txt 爬虫规则,支持多个 User-agent 分组与 Sitemap URL。

在浏览器本地运行

生成规则

常用模板

User-agent 分组

调整规则后即可生成 robots.txt。

如何使用 robots.txt 工具

在生成模式中编辑多个 User-agent 分组、Allow、Disallow 和 Crawl-delay,再添加多个 Sitemap;也可以填写非标准的 Host。粘贴现有文件后切换到解析模式,工具会保留标准规则的顺序、注释和重复分组,并对未知指令与结构问题给出提示。

语义与兼容性边界

robots.txt 是爬虫协定,不是权限、认证或安全控制。空的 Disallow 表示不禁止任何路径;Crawl-delay 并非所有爬虫支持;Host 不是标准指令,仅部分搜索引擎识别。

常见问题

空 Disallow 是什么意思?

例如 Disallow: 表示该 User-agent 没有被禁止的路径,相当于不添加 Disallow 限制;不要把它误读成屏蔽整个网站。

重复 User-agent 分组会怎样?

工具不会静默合并重复分组,会保留出现顺序并发出提示。不同爬虫对重复分组的处理可能不同,上线前请按目标爬虫文档确认。

Sitemap URL 有什么要求?

Sitemap 应是可公开访问的绝对 HTTP(S) URL,例如 https://example.com/sitemap.xml;相对路径和其他协议会被拒绝。