抓取、索引和排名是三个先后不同、可分别验证的环节:抓取是搜索引擎发现并读取页面,索引是把读取后的内容存入可供检索的库,排名是用户搜索某个词时,搜索引擎从索引中挑选并排序结果。行业SEO协作中,最常见的返工是把“没排名”直接当成“没收录”,或把“没收录”当成“没抓取”,结果改错对象。下面用一个假设任务说明如何一步步区分。
假设某团队上线了一篇行业解决方案页,目标词是“工业废水处理设备选型”。上线一周后,运营说“搜不到”,技术说“服务器日志里有抓取”,内容编辑说“站内搜索能搜到”。这三个说法并不矛盾,但指向的环节不同:日志有抓取记录,只说明搜索引擎来过;站内搜索能搜到,只说明站内数据库有这条内容;对外搜不到,可能是未索引,也可能是已索引但排名靠后。
此时不要先改标题或堆词。先建立一张三列表:抓取证据、索引证据、排名证据。抓取证据看服务器访问日志或搜索平台提供的抓取统计;索引证据看站点限定查询是否返回该页;排名证据看目标词结果页中该页是否出现、大致处于什么位置。三项分开记录,才能判断问题停在哪一环。
抓取是搜索引擎爬虫请求并读取页面的过程。可执行的检查项包括:
常见错误是把“日志里出现过”当成“已经完成抓取”。如果日志显示的是404、301跳转链过长、403或频繁超时,爬虫可能只是尝试过,并未取得有效内容。另一种情况是页面能被抓取,但内容由客户端脚本渲染,抓取阶段拿到的正文很少,这会影响后续索引质量。判断结果应写成“已成功抓取”“抓取受阻”或“尚无可确认抓取”,不要用“应该抓了”含糊带过。
索引是搜索引擎把抓取到的内容分析、去重、存储,并使其可被检索的过程。验证索引最直接的方法,是在搜索引擎中使用站点限定查询,例如把页面标题或URL特征与站点范围组合检索,观察目标页是否作为独立结果出现。也可以用搜索平台提供的URL检查类功能查看已登记状态,但不同平台名称和入口不同,应以实际界面为准。
已抓取却未索引,可能原因包括:内容与站内其他页面高度重复;页面质量不足以独立成篇;canonical指向了别的URL;noindex标签阻止收录;参数或分页造成多个近似地址;新页面尚未完成处理。这里要区分“可能原因”和“已经定位的原因”:只有核对页面源代码、响应头、规范标签和重复内容后,才能把某一项写成确定原因。
多人协作时,索引检查项应固定为:目标URL、检查时间、使用的查询方式、返回结果、是否被规范到其他URL。这样交接时不会因为“我搜过没有”而反复争论。
排名发生在索引之后。用户搜索一个词时,搜索引擎从索引中召回候选页面,再按相关性、内容质量、页面体验、链接与意图匹配等因素排序。页面已被索引,却不在前几页,属于排名问题,不是抓取或索引问题。
区分排名问题要控制变量:
如果目标页完全不在结果中,而站点限定查询也查不到,优先回到索引环节;如果站点限定查询能查到,但目标词结果中没有,才按排名环节处理。这个顺序能减少大量无效改动。
假设团队要交付一份行业SEO诊断,可要求每个页面回填以下内容:
常见错误是三项证据混在一句话里,例如“页面没排名,可能是没收录,也可能是内容不行”。这类结论无法执行。更合适的写法是:“站点限定查询可检索到该URL,判定已索引;目标词结果页未出现,判定为排名问题;下一步对比前三名页面的内容结构与意图匹配,不修改robots或canonical。”适用条件是页面已被索引且目标词明确;如果站点限定查询也查不到,则先处理索引,不进入排名优化。
下一步,挑一个当前争议最大的页面,按抓取、索引、排名三列各填一条可核对证据,再决定只改哪一环。