检查访问状态,核心是确认搜索引擎能不能正常抓到页面、服务器返回什么状态码、以及页面内容是否可被索引。时间有限时,先查最可能阻断收录的环节:HTTP状态码、robots限制、canonical指向和页面是否返回有效内容。不要一上来就查排名或外链,那些是访问正常之后才需要处理的事。
“访问状态”容易混淆,实际要分别检查:
三者结果可能不一致。例如爬虫被CDN拦截返回403,但用户浏览器正常;或者页面返回200但内容是空壳,搜索引擎拿不到有效信息。判断时以搜索引擎抓取结果为准,因为收录和排名依赖它。
直接请求目标URL,看返回的HTTP状态码。常用命令示例:
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page
把UA换成目标搜索引擎的爬虫标识,观察返回结果。判断规则如下:
注意:状态码正常不代表内容可索引。返回200但正文由JavaScript异步渲染、且渲染失败时,搜索引擎可能只看到空页面。此时要检查渲染后的HTML是否包含主要文本。
抓取被允许、索引却被禁止,是常见的“访问正常但搜不到”原因。按顺序检查:
/robots.txt,确认目标路径没有被Disallow规则覆盖。<meta name="robots">,确认没有noindex或nofollow误用。X-Robots-Tag,它同样能阻止索引,且容易被忽略。如果robots.txt禁止抓取,搜索引擎可能连noindex都读不到,页面仍可能被收录为无描述的结果。所以先放开抓取、再处理索引指令,顺序不能反。
时间和人手有限时,按影响面排序,而不是按检查项数量排序。可以这样安排:
验收标准要具体:状态码为200、robots允许抓取、无noindex、canonical指向自身、渲染后正文包含核心内容。五项都满足,才算访问状态正常。只满足其中一两项,不要急着做内容优化。
比较改动前后时,要考虑季节、搜索需求变化和数据采集差异,不要用单日数据下结论。访问状态检查解决的是“能不能被正常抓取和索引”,不承诺收录时间或排名结果。
下一步:选一个近期发布但未被收录的页面,按上面的状态码、robots、canonical、渲染正文四项逐一核对,先修掉阻断抓取或索引的那一项,再重新提交检查。