这通常说明爬虫暂时没有顺利发现、访问或读取更深层页面,不等同于网站内容没有价值。要判断原因,应把首页访问时间、深层链接状态、robots.txt、站点地图、服务器日志和页面源码放在一起看;如果客户依赖 AI 搜索,还要单独记录答案引用与引荐点击,不能把抓取次数当成实际效果。
只访问首页通常说明什么
首页被访问,只能说明爬虫已经找到一个入口。它没有继续进入栏目页、文章页或产品页,常见解释是首页没有清晰的内部链接,深层页面需要搜索框、按钮或脚本触发,或者后续请求返回了限制访问的结果。单凭一次访问记录,不能判断平台已经完成了对网站的整体了解。
这里要把“抓了首页”和“引用了页面”分开记录。爬虫访问属于中间信号,答案中出现页面属于另一层信号,用户从答案点进来又是新的信号。Google 搜索中心关于抓取和索引的说明,也把抓取、处理和呈现视为不同环节,这正是排查时不宜混为一谈的原因。
先看入口,别急着猜算法
一个页面能否被继续发现,先取决于它有没有普通 HTML 链接通向其他页面。若首页只放了图片、轮播图或需要点击后才出现的菜单,爬虫看到的路径就会变短;若重要内容只存在于站内搜索结果中,外部抓取程序也未必能沿着搜索框继续走。
可以在浏览器查看首页源代码,搜索栏目页、文章页和产品页的链接,并逐个打开链接检查返回结果。若页面在源码中没有链接,只在脚本执行后出现,就要把关键入口改成清晰的文本链接,同时让每个重要页面能从栏目、专题或面包屑中被找到。
robots.txt和状态码会不会挡住深层页
robots.txt中的规则会影响特定爬虫能否请求某些路径,但它不等同于索引指令。查看根目录下的 robots.txt,重点观察是否把文章目录、栏目目录、静态资源或整站路径写进了 Disallow。规则还要结合实际爬虫名称阅读,不能只看到一条限制就直接下结论。
服务器日志比浏览器页面更能说明问题。把首页请求与深层路径放在同一时间段比较,查看是否出现 3xx 跳转、4xx 请求错误、5xx 服务错误、超时或频繁拒绝。根据 HTTP 状态码的通用语义,页面能在本地浏览器打开,并不代表同一请求在爬虫环境下也能顺利完成。
页面打开了,内容也未必读得到
如果正文、标题、产品说明或作者信息依靠客户端脚本加载,抓取程序取得的初始 HTML 可能只剩一个空壳。可以关闭浏览器脚本后查看页面,或直接查看服务端返回的源码:若核心文字、规范化链接和结构化数据都不在初始内容里,就需要调整渲染方式,而不是只增加关键词。
结构化数据用于描述页面实体和属性,Schema.org 的类型定义可以帮助开发者选择合适的数据结构,但它不代表页面一定可能被引用。内容仍要有清楚的主题、可读的正文和一致的实体名称;组织名称、作者、产品名、更新时间在页面标题、正文和结构化数据中出现差异时,后续处理会更难判断。
站点地图能帮忙,但不是通行证
站点地图适合列出希望被发现的规范网址,尤其适用于栏目较多、页面层级较深或内部链接尚未完善的网站。它不能替代 robots.txt,也不能把不可访问、重复或带有错误状态的页面变成可用入口。提交后仍要把其中的网址与服务器日志、页面响应和规范链接放在一起观察。
还要留意网址版本是否统一,例如带参数、带尾斜杠、大小写不同或多套协议同时存在。一个页面如果不断跳转到另一地址,或者 canonical 指向不同页面,爬虫可能反复处理入口,却没有继续深入。整理站点地图时,应保留真实可访问、主题明确且内容独立的页面。
用一轮记录把原因定位出来
不要只盯着“访问首页”这一条现象,可以做一张简短记录表,把路径、时间、爬虫名称、响应状态、是否跳转、页面源码是否含正文、是否存在内部链接和是否进入站点地图放在一起。观察窗口应覆盖一次完整发布周期,具体长短按网站更新频率设定,不把某个固定天数当成行业标准。
- 从服务器日志挑出首页和深层页面请求,标记状态码、响应耗时与失败原因。
- 打开 robots.txt 和站点地图,检查重要目录是否被限制,网址是否能正常返回。
- 用不执行脚本的方式查看关键页面,比较源码与浏览器最终显示内容。
- 沿首页、栏目、专题和面包屑逐层点击,记录哪一层出现断链或跳转。
- 把 AI 引荐点击、落地页、有效表单和成交状态分开记录,主转化事件只选一个,并按实际销售周期设定归因窗口。
如果日志显示深层页面返回正常,却始终没有继续访问,下一步应检查入口链接、站点地图与页面主题是否对应;如果出现大量错误状态或超时,应先处理服务器和渲染问题。效果判断要用自家日志、分析工具和 CRM 数据完成,不能用爬虫到访次数替代转化判断。