抓取和索引是两件事:抓取是搜索引擎的爬虫访问了你的网址、读取了页面内容;索引是搜索引擎把该网址作为可展示结果存入自己的数据库。一个网址被抓取,不代表它一定被索引;被索引了,也不代表它一定有排名。想判断“网站快速被收录”卡在哪一步,就要分别查“爬虫来过没有”和“这个网址能不能被搜到”。
很多新手看到访问日志里出现搜索引擎爬虫的 User-Agent,就认为页面已经被收录。这个判断不成立。日志只能证明抓取行为发生过,不能证明内容被采用。爬虫可能只是发现链接、抓了首页、抓了重复页面,或者抓取后因为内容质量、重复度、robots 规则、canonical 指向等原因没有进入索引。反过来,索引结果里出现某个网址,也不一定意味着你刚刚提交后立刻被抓取,它可能是历史抓取留下的旧版本。
判断原则:抓取看日志和抓取统计,索引看搜索结果和站点查询指令。两者要分开记录,不能用一个指标代替另一个。
如果你有服务器访问日志,可以按下面步骤做一次最小检查:
适用条件:日志能拿到、且时间范围覆盖你关注的提交或更新之后。若日志被 CDN 或缓存层遮挡,先确认你看到的是源站日志还是边缘节点日志。判断结果:有抓取记录且状态码正常,说明“访问抓取”这一步基本通过;没有记录,则先解决发现和抓取,不要急着讨论收录。
索引状态不能靠“搜品牌词能不能看到”来判断,因为品牌词结果可能来自首页或其他页面。更直接的方法是搜索完整网址,或使用各搜索引擎提供的站点收录查询语法。不同搜索引擎支持情况不同,需要分别核查。
site: 查询:它展示的是该搜索引擎愿意返回的已索引页面样本,不是精确总数,也不能当作收录率报告。注意:站点地图提交不保证收录,它只是帮助发现网址。HTTPS 也不保证页面安全无漏洞或一定获得更好排名,它只是传输层加密。把这些当成收录保证,会误判问题所在。
如果日志显示爬虫抓取了目标页,但完整网址搜不到,可以按以下检查项逐条排除:
<meta name="robots" content="noindex">。noindex 是索引层面的指令,和 robots.txt 的抓取限制不是一回事。判断结果:如果上述检查都通过,但完整网址仍搜不到,说明问题更可能在索引选择阶段,而不是抓取阶段。此时应继续观察该网址在搜索结果中的变化,而不是反复提交同一网址。
拿一个表格,左列记录“抓取证据”:日志时间、状态码、被抓 URL;右列记录“索引证据”:查询日期、完整网址是否出现、标题摘要是否一致。每次只改一个变量,比如内链、robots 设置或页面内容,然后分别复查两列。这样你就能分清:当前卡住的是访问抓取,还是索引结果。