用用户代理、路径和站点地图写出 robots.txt。页面标签仍在 Meta 标签
robots.txt 告诉爬虫可以抓什么。这一页按页面上的字段写出这些行。标题和 Open Graph 仍在 Meta 标签。
*。允许、禁止和站点地图都是一行一条。爬取间隔可以空着。*,允许设为 /,禁止设为 /admin 和 /search,爬取间隔留空,站点地图设为 https://example.com/sitemap.xml。User-agent: *、Allow: /、Disallow: /admin、Disallow: /search、Sitemap: https://example.com/sitemap.xml。*,并清空其他字段和结果。复制结果复制这段文本。框里的空行会跳过。先写全部用户代理,再写全部允许,再写全部禁止,爬取间隔有数字时写 Crawl-delay,最后写每条站点地图。爬取间隔不是整数会报错。只有用户代理,没有允许、禁止、间隔或站点地图,也会报错。输出里的字段名保持 User-agent、Allow、Disallow、Crawl-delay 和 Sitemap。
显示示例把这一栏留空,所以这一行不写。
不会。它只写 robots.txt。