不能只靠已经失效的网站本身判断 AI 是否理解准确;如果页面无法打开,就要改用历史快照、站内备份、搜索结果和曾经发布的结构化内容进行比对。判断重点不是 AI 有没有提到页面,而是它能否正确还原实体、结论、限制条件与时间版本,并把每次查询和人工判定留下记录。

页面打不开,先别把沉默当答案

“死站”可能是域名失效、服务器停止响应、页面返回错误状态,或内容已经被迁移。HTTP 状态码的含义应按 IETF《HTTP Semantics》理解:访问失败只说明当前请求结果异常,不能直接推出 AI 已经忘记内容,也不能证明它仍保留旧页面。

如果 AI 没有提到该站,也不能据此判断它没有理解;如果 AI 提到了站名,同样不能据此判断回答正确。需要把原文中的实体名称、事实句、时间范围和限制条件拆开,逐项与回答比对,避免把“出现名称”误当成“理解内容”。

真正要比的,是原文和回答有没有对上

验证时可把问题分成四种:这是谁、提供什么、在什么条件下成立、哪些情况不适用。四类问题分别对应实体、服务范围、事实边界和例外条件,能减少只问一句“你知道这个网站吗”带来的模糊判断。

举个假设核验场景:历史页面写着“服务面向企业客户,支持某类接口,不包含线下交付”。若回答只说“提供相关服务”,就算提到了页面主题,也没有完整保留对象、能力和限制。此类差异应标为“部分理解”,而不是简单判为正确或错误。

没有现网页,哪些内容还能拿来比

可用材料包括站点备份、团队保存的正文、搜索引擎结果页中的摘要、历史快照、导出的结构化数据,以及曾经发布的产品或帮助页面。每份材料都要记录采集日期、页面标题、正文版本和来源位置;不同版本混在一起,结论会失去时间边界。

网页快照只能代表某个时间点,搜索摘要也可能截断句子,结构化数据则只表达页面明确标记的实体和属性。Schema.org 的类型与属性定义能帮助判断标记表达了什么,但不能单独证明 AI 对整页内容的理解,也不能推出引用率或收录结果。

抓取、索引和 AI 回答不是一回事

Google Search Central《搜索抓取与索引指南》把抓取、处理和索引作为搜索系统中的不同环节。页面曾经被抓取,不等于它会出现在某次回答中;回答里出现站名,也不等于用户点击进入,更不等于产生表单或订单。

死站状态下,抓取记录只能说明过去发生过访问,不能代表当前页面仍可读取。若要判断后续影响,应分别记录爬虫访问、答案出现、AI 引荐点击、自然搜索点击和品牌词搜索,无法区分来源的访问标为未识别,不把几种信号合并成一个结果。

一套能复用的验证清单

  1. 整理一份固定原文,标出实体名、核心事实、适用条件、排除项和版本日期,并给每条内容编号。
  2. 准备一组固定问题,覆盖定义、能力、限制和时间变化;每次使用相同问题,记录提问日期、平台、回答全文与是否出现来源说明。
  3. 由人工把回答逐句标为一致、缺失、扩大解释或与原文冲突,特别记录条件被删掉、时间被改写、实体被混淆的地方。
  4. 把结果放进表格,字段包含问题、原文编号、回答片段、判断结果、版本和复核人;不要只截图,因为截图难以持续比较。
  5. 再次检查现有域名状态、历史快照和站点备份,若内容已迁移,把新旧页面分开记录,不能拿新页面替代旧版本。

怎样把验证结果变成下一步动作

可建立一个小型闭环:观察 AI 回答中的事实片段,记录提问平台、问题、回答、引用页面、落地页、有效表单和成交状态,再规定一个归因窗口,并只选一个主转化事件。这样能区分“回答出现”与“用户真正到站”,避免把展示当成业务结果。

成本、周期、单量和效果无法通用判断,需用自家数据验证。若连续记录后发现限制条件经常被省略,就回到可访问的新页面补充清晰的实体说明、更新时间和引用来源;若只是旧站失效,则先处理内容迁移和版本标记,再重新测试,不能凭一次回答下结论。