与开发人员交接“搜索引擎不收录”问题,核心不是把“页面没收录”这句话丢过去,而是把现象、可复现证据、可能原因和期望改动整理成一份对方能直接排查的工单。下面这份清单按“查什么、怎么查、结果说明什么”组织,你可以逐项填写后交给开发。
要查什么:不收录的具体对象和范围。
怎么查:用搜索引擎的站点收录查询指令,分别测试首页、栏目页、详情页各一个代表 URL;再在服务器日志或搜索资源平台中查看这些 URL 是否被抓取过。注意不同搜索引擎的查询语法和支持情况需要分别核查,不能用一个引擎的结果推断另一个。
结果说明什么:如果整站都不收录,优先怀疑 robots.txt、服务器返回状态或全站 meta 指令;如果只是某个目录不收录,重点看该目录的模板、分页和参数;如果只是个别页面不收录,通常是内容质量、内链或抓取预算问题。范围不同,交给开发的排查方向完全不同。
要查什么:页面返回给爬虫的真实响应,而不是浏览器里看到的样子。
怎么查:用命令行工具请求目标 URL,记录 HTTP 状态码、响应头和正文前若干行,例如:
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1)" https://example.com/page
把返回的 HTTP/1.1 200 OK、301、403、503 等状态码,以及 X-Robots-Tag 响应头一并截图或粘贴进工单。同时查看页面 HTML 中的 <meta name="robots"> 标签内容。如果站点有 robots.txt,也要把对应规则原文附上。
结果说明什么:状态码为 200 且无 noindex,说明页面本身允许被抓取和索引,问题可能在内容或内链;出现 301/302 跳转链、403、503,说明爬虫拿不到正常内容;robots.txt 中 Disallow 命中该 URL,说明抓取被限制。需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除,它只约束抓取行为,不能替代 noindex 或删除操作。
要查什么:爬虫是否来过、是否抓成功、是否被允许索引。
怎么查:在服务器访问日志中按爬虫 User-Agent 过滤,统计目标 URL 的请求次数和状态码;再对照搜索资源平台里的抓取统计与索引状态。若日志里完全没有该爬虫记录,属于抓取层面的问题;若有抓取记录但未被索引,属于索引层面的问题。
结果说明什么:抓取问题通常交给开发处理,例如服务器屏蔽、防火墙拦截、页面渲染依赖 JavaScript 而爬虫拿不到内容;索引问题则更多与内容质量、重复页面、canonical 指向有关,需要 SEO 与开发共同确认。把这两类混在一张工单里,开发往往不知道从哪里下手。
要查什么:目标 URL 是否出现在站点地图中,以及站内是否有可点击链接指向它。
怎么查:打开站点地图文件,搜索目标 URL;再在站内用站内搜索或导航路径,确认是否存在至少一条从首页出发、经过可点击 <a> 链接到达该页面的路径。不要只看 JavaScript 路由生成的链接,要检查渲染后的 HTML 中是否有真实链接。
结果说明什么:站点地图不保证收录,它只是提交候选 URL 的辅助手段;但如果 URL 既不在站点地图,也没有任何内链指向,爬虫发现它的概率会明显降低。此时应让开发补充内链或把 URL 加入站点地图,并说明这是发现路径问题,不是收录保证。
把以下内容整理成一条工单,而不是一段聊天消息:
如果涉及 HTTPS,不要把它当作收录问题的万能解释。HTTPS 不保证安全无漏洞,也不保证排名,证书配置错误导致爬虫握手失败才需要单独排查。交接时把证书链、协议版本等作为独立检查项列出即可。
下一步:挑一个当前未被收录的代表 URL,按上面的清单逐项填写,形成一条完整工单后交给开发,并约定改动完成后的复查时间点。