抓取、索引和排名不是同一件事。抓取是搜索引擎发现并读取页面;索引是把可用的页面内容存入可供检索的库;排名是用户搜索某个词时,搜索引擎从索引中挑出页面并决定先后顺序。判断问题出在哪一步,直接决定你该改服务器、改页面内容,还是改关键词与竞争策略。时间和人手有限时,先定位环节,再决定先做什么,能避免把力气花在错误的地方。
抓取环节看的是搜索引擎有没有来、能不能读到内容。可以检查服务器日志里搜索引擎爬虫的访问记录,看目标页面是否被请求过、返回状态码是什么。如果页面长期没有被请求,或者频繁返回超时、5xx、被robots.txt拦截,问题更可能停在抓取层。
索引环节看的是页面有没有进入可检索库。可以用站点查询指令看页面是否出现,也可以看页面在搜索结果中是否以正常标题和摘要展示。如果页面能被抓取,但查询不到,或者只出现在补充性结果里,问题更可能在索引层,常见原因包括内容重复、质量不足、被noindex标记、内链太弱。
排名环节看的是有索引的页面在具体关键词下排在哪里。如果页面能被搜到,但搜某个词时排在很后,问题才进入排名层。此时要比较的是页面与前列结果的匹配度、内容深度、外部链接、用户点击与停留表现等。
不要同时改十件事。按下面顺序走,每一步只回答一个是非题:
200且内容可读?不是,先修可访问性。这个链条的价值在于:如果第一步就断了,后面三步的优化都不会生效。例如页面被robots.txt屏蔽,你改标题、加内链、发外链都没有意义,因为搜索引擎根本没读到它。假设一个页面返回200、日志有抓取、但站点查询找不到,那么优先检查是否误加了<meta name="robots" content="noindex">,而不是先写新内容。
先处理阻断抓取和索引的问题,再处理排名问题。原因是抓取和索引是排名的前置条件,前置条件不成立时,排名优化没有可作用的页面。具体可以这样分配:
robots.txt、站点地图、服务器响应速度和内链入口。noindex、规范标签、重复内容和页面是否有独立价值。判断结果的方式很直接:修复抓取或索引问题后,观察日志中目标页面的请求是否增加、站点查询是否能找到页面。只有这两个信号转为正常,排名优化才值得投入。若页面已正常索引,排名仍无变化,说明瓶颈在竞争与内容匹配,而不是技术可访问性。
假设某页面在搜索品牌名时能出现,但搜具体产品词时排到第五页。这说明抓取和索引大概率正常,问题在排名层。此时不该去改robots.txt,而应检查该页面是否真的围绕产品词组织内容、是否比前列结果更完整、是否有足够的内链和外部引用。反过来,如果搜品牌名也找不到该页面,优先怀疑索引甚至抓取,而不是排名。
下一步:挑一个你关心的页面,按上面的四步检查链走一遍,记录每一步的结果。只对断掉的那一层动手,处理完再复查同一组信号。