robots.txt 生成

用用户代理、路径和站点地图写出 robots.txt。页面标签仍在 Meta 标签

这一页做什么

robots.txt 告诉爬虫可以抓什么。这一页按页面上的字段写出这些行。标题和 Open Graph 仍在 Meta 标签。

怎么用

  1. 用户代理一开始是 *。允许、禁止和站点地图都是一行一条。爬取间隔可以空着。
  2. 转换只做一次。显示示例把用户代理设为 *,允许设为 /,禁止设为 /admin 和 /search,爬取间隔留空,站点地图设为 https://example.com/sitemap.xml。
  3. 结果是 User-agent: *、Allow: /、Disallow: /admin、Disallow: /search、Sitemap: https://example.com/sitemap.xml。
  4. 全部清除把用户代理设回 *,并清空其他字段和结果。复制结果复制这段文本。

规则和边界

框里的空行会跳过。先写全部用户代理,再写全部允许,再写全部禁止,爬取间隔有数字时写 Crawl-delay,最后写每条站点地图。爬取间隔不是整数会报错。只有用户代理,没有允许、禁止、间隔或站点地图,也会报错。输出里的字段名保持 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap。

用在哪

  • 禁止 /admin 和 /search,其余放开。
  • 加上一条站点地图网址。
  • 把这五行抄进 robots.txt。

常见问题

为什么示例里没有 Crawl-delay?

显示示例把这一栏留空,所以这一行不写。

这一页会写 hreflang 吗?

不会。它只写 robots.txt。