Robots.txt检查
获取并查看任何网站的robots.txt文件。
Robots.txt 是网站用于与网络爬虫和搜索引擎机器人进行通信的标准。我们的 robots.txt 检查器从任何 URL 获取并显示该文件,准确显示哪些路径被禁止以及哪些用户代理受到影响。
实际应用
Robots检查实战
站点迁移后你的Google流量骤降。运行robots检查器,你会发现暂存服务器的"Disallow: /"被复制到了生产环境。修一行robots.txt就够了——检查器立刻确认修复生效。
常见问题
什么是robots.txt?
Robots.txt是放在网站根目录的文件,告诉搜索引擎爬虫哪些页面可以访问。
如何在线检查robots.txt文件?
输入网站URL,工具会抓取其/robots.txt,以易读形式显示所有规则。它还会显示文件是否存在——这是个意外常见的问题。
robots.txt里的"Disallow: /"是什么意思?
它要求所有爬虫远离整个站点。有些网站在开发时使用它,然后忘记删除——这就是改版后页面从搜索结果中神秘消失的原因。
robots.txt能阻止页面被收录吗?
robots.txt阻止爬取但不保证取消收录。如果页面在其他地方被链接,搜索引擎可能不访问也收录它。要移除已收录的页面请用noindex标签——robots.txt是第一层防线,不是唯一一层。