网页能打开,为什么搜索里还没有它?

把上线、抓取、索引和搜索展示分开检查,避免把一个正常网页误判成故障,也避免把一次测试通过当成搜索效果。

网页在手机上打开了,文字和图片都正常。几天后搜索标题,却没有找到它。于是又检查服务器、重交站点地图,甚至考虑改一套框架。

问题是,“能打开”和“能被搜到”之间,还有几件不同的事。排查之前,先弄清楚手里的证据能回答哪一个问题。

先问:访问到的真是这一版吗?

正常打开首页,只能说明这个地址此刻有页面。它未必是刚改好的那一版。

一个简单的办法是选一处本次特有的改动:新的标题、刚补的入口,或者更正过的一句话。直接访问正式地址,确认它出现了。需要更严格的发布检查时,再比较成品文件和线上文件的摘要。

这一步解决的是版本问题。它不能说明搜索引擎已经看过新版。

抓取、索引、展示,各自查什么?

下面这张表可以当作排查顺序。每一行都有自己的证据,不用拿上一行的结果代替下一行。

状态 要回答的问题 可以查看什么
上线 正式地址是不是预期的页面? 页面内容、HTTP 状态、版本特征
抓取 搜索引擎能不能取到页面? 实时网址测试、抓取时间、获取结果
索引 搜索引擎有没有把页面纳入索引? 网址的存储索引状态、规范网址
展示 页面有没有出现在搜索结果中? 搜索效果中的曝光、查询与落地页

Google 的网址检查工具区分已有索引信息和当前页面的实时测试。一个页面可以在实时测试中允许抓取、允许索引,同时在存储报告中仍然尚未收录。这两份结果回答的问题不同。Google 的工具说明也明确列出了实时测试的范围。

因此,看见“可建立索引”时,先记录测试结果,再回到存储索引状态确认后续进展。没有必要当场把它解释成“已经搜得到”。

别为了清空报表,把正常跳转改坏了

网站可能同时被访问为 HTTP、HTTPS、带 www 和不带 www 的几个地址。选择一个稳定的正式入口,再让其他变体跳过去,是正常的路由安排。

例如,一个站点选择 https://www.example.com/,那么 HTTP 首页返回重定向,并不意味着首页丢了。真正要检查的是:跳转目标对不对、是否形成循环、最终页面是否能打开。

不存在的链接则是另一回事。404 页面可以认真设计,告诉读者发生了什么,并提供文章或应用支持入口;HTTP 状态仍应准确表示页面不存在。把所有错误地址都当作成功页面返回,会把真正的问题藏起来。关于状态码与抓取行为,可以查看 Google 的 HTTP 状态码说明。

留下能指导下一步的记录

排查记录不必很长。写下网址、读取日期、页面版本,以及看到的是实时测试还是存储报告,通常就够用了。

如果当前页面获取失败,先修路由或资源;如果获取正常、尚未收录,就围绕索引状态继续检查;有了曝光之后,再看查询是否符合内容目的。这样做,下一次维护就能接着上一次的证据往前走。

站点地图被读取、网页被收录和读者真正看到内容,仍然是三个不同的结果。网站维护可以把每一步做扎实,搜索效果则要用之后的数据来回答。