小站点应采用“识别来源、分层限流、保留必要抓取、持续观察”的做法,而不是直接封掉所有自动访问。适用前提是服务器日志能看到请求时间、路径、状态码和 User-Agent;涉及抓取后的引用、索引或流量变化,无法通用判断,需用自家数据验证。
先分清是哪类访问在占资源
AI爬虫、搜索引擎爬虫和普通用户请求,不一定具有相同目的。日志里可以把 IP、User-Agent、请求路径、响应状态、响应耗时和单页请求次数放在一起看;同一标识反复请求图片、搜索接口或不存在的路径,处理方式应与访问文章页区分开。
“爬虫访问”只代表服务器收到请求,不等于页面已经被索引,也不等于内容出现在 AI 回答中。AI回答中的引用、用户点击进入的 AI 引荐、自然搜索点击和品牌词搜索,属于不同记录层,不能把抓取次数直接当成内容效果。
robots.txt该管什么
robots.txt适合表达抓取范围,例如限制后台、个人资料页、站内搜索结果和无价值参数页面。根据 Internet Engineering Task Force 的 RFC 9309《Robots Exclusion Protocol》,该文件用于说明自动化客户端可访问的路径,但它不是服务器层面的访问控制。
因此,robots.txt不能替代登录权限、WAF规则或服务端限流。若某类请求已经造成资源紧张,可以在服务器或网关层设置速率限制,再用robots.txt减少后续合规爬虫对无关路径的访问;修改后要检查文件是否位于站点根路径、语法是否能被读取。
别把文章页和接口放在同一档
小站点的内容页、图片、CSS、JavaScript、站内搜索、登录接口和管理后台,资源价值与承受能力不同。文章正文需要保持可访问,搜索接口和分页接口则可以增加请求间隔、限制参数组合,后台与个人数据页面应通过权限控制保护。
页面本身也要减少无意义的重复请求。可把稳定图片、样式文件和字体交给缓存,把文章页中的相关推荐改成有限链接;动态接口返回的数据量应与用户动作对应。这样做是资源管理建议,不代表一定带来索引或 AI 引荐提升,相关变化仍需用日志与站长平台记录判断。
限流时怎么避免误伤正常用户
访问压力上升时,可以按路径、来源标识、请求频率和响应耗时设置分层规则。对文章页可返回正常内容,对短时间连续请求的接口降低响应频率,对明显异常的请求返回状态码。RFC 9110《HTTP语义》对429表示请求过多、503表示服务暂时无法处理作出了定义。
不要只按 User-Agent 做决定,因为标识可能被伪造,真实用户也可能共享网络出口。规则上线后应观察正常页面打开、登录、投稿和后台操作是否受到影响;如果服务器仍频繁出现5xx状态,就需要回看数据库查询、图片体积和缓存命中情况,而不是继续提高拦截强度。
页面结构要让人和机器都读得懂
每篇文章应有明确标题、摘要、正文层级、作者或维护说明、更新时间和相关页面链接。结构化数据可以按 Schema.org 的类型和属性定义填写,但它描述的是页面内容,不等于获得 AI 引用或搜索展示,效果结论无法通用判断,需用自家数据验证。
站点还应保持实体名称、栏目名称、作者信息和主题描述前后一致。XML Sitemap 可帮助搜索系统发现站点中的网址,但不能替代页面可访问性、合理的HTTP响应和正文质量;根据 Google Search Central《搜索抓取与索引指南》,站长仍需从抓取、索引状态和页面内容三个层面分别观察。
用一张小表把处理闭环跑起来
不要只盯着服务器当天的请求峰值。可以建立一张按日期记录的表,把自动访问、正常用户、AI引荐点击和自然搜索点击分开,主转化事件只选一个,例如有效表单;如果销售周期较长,归因窗口按实际业务周期设定。
- 看什么:记录请求来源、落地页、状态码、响应耗时、有效表单和成交状态;不确定来源的访问标为“未识别”。
- 怎么改:先调整缓存和接口频率,再修改robots.txt,最后处理持续异常的来源;每次只改一组规则。
- 怎么判断:比较改动前后的服务器错误、页面可访问性、AI引荐点击和有效表单,不把爬虫次数当成订单或线索。
- 怎么留档:保留规则版本、上线时间、日志样本和页面变更记录,出现访问下降时可以回退到上一版。
如果变化涉及成本、周期、单量或转化,无法通用判断,需用自家数据验证。记录周期应覆盖一次完整业务观察期,再决定继续收紧、恢复路径,或把精力转向内容匹配与页面可理解性。