把 AI 的回答当作待验证的线索,而不是可直接引用的结论,是做事实核查更稳妥的起点。拿到 AI 回答之后,有哪些实操方式做事实核查,关键不在于反复换一种问法,而在于把一句看似完整的话拆成来源、时间、范围和结论,再用能回溯的原始页面逐项比对。涉及页面抓取、索引和引用表现时,单次搜索结果也不足以下判断,需要留存查询条件与页面版本。

先把一句话拆成几条能判断的断言

AI 常把多个信息拼进一句话,例如某页面已被抓取、内容已进入索引、结构化数据有效、某平台会引用该页面。这其实是四类不同的断言,不能因为其中一项成立,就顺带接受其余几项。把回答复制到记录页后,可按“谁做了什么、发生在何时、面向什么范围、依据是什么”切开。

拆分后要给每条断言标注类别:原文直接写明的事实、根据事实作出的推测、缺少出处的结论。原文写明的内容可以回到该页对应段落比对;推测只能保留条件;没有出处的内容应暂缓采用。这样处理能避免 AI 把相邻概念混在一起,例如把爬虫访问写成内容已被收录。

原始出处比二次转述更值得花时间

事实核查应尽量回到规则制定方、数据产生方或事件当事方的原始材料。若 AI 提到抓取规则,可查看搜索引擎关于抓取与索引的说明;若提到结构化数据属性,可查看 Schema.org 对类型和属性的定义;若提到某篇文章的观点,则应阅读文章原文而非只看摘要。

阅读时别只找相同关键词。要看原文是否真的回答了 AI 的那句话,尤其留意适用对象、例外条件和更新时间。一个页面写“允许抓取”,不等于写“会被索引”;一个页面标注了结构化数据,也不等于出现特定展示或被 AI 回答采用。原文说到哪里,结论就停在哪里。

时间、版本和范围最容易被悄悄带偏

很多回答在逻辑上没有明显问题,却把旧规则、旧页面或局部案例说成当前通用结论。查看页面日期、文档修订记录、产品版本和适用地区,能排除不少这类偏差。没有明确日期的页面,可以记录访问日期,并在引用时避免写成长期不变的规则。

范围也要单独写出来。例如“某搜索引擎支持某项标记”不等于所有搜索服务都有相同行为;“某网页可访问”也不等于移动端、不同地区或未登录用户看到的内容一致。涉及 AI 搜索时,不同产品、不同提问方式和不同时间的回答都可能变化,效果无法通用判断,需用自家数据验证。

页面能打开,不等于机器能正确理解

面向 GEO 的内容核查,不应只盯着文字对不对,还要检查页面是否能被访问和理解。浏览器中能正常打开的页面,可能因为登录限制、脚本加载失败、返回状态异常或页面重复,导致搜索服务获取到的内容与读者所见不同。Google Search Central 的《抓取、编入索引和呈现》说明了抓取、编入索引与呈现是不同环节,应分开观察。

结构化数据也要看它是否与页面正文一致。Schema.org 对类型与属性提供词汇定义,但它描述的是信息含义,不替代正文事实。企业名称、作者、日期、产品名称、地址等实体信息若在标题、正文、页面标记和其他自有页面中写法不一致,AI 可能难以判断它们是否指向同一对象。这里的重点是消除自相矛盾,不是堆更多标记。

把核查做成五步,结果才方便复盘

下面这套做法适合核对 AI 对网页、规则说明、机构信息和数据结论的回答。它把“我看过了”变成可回看的一组记录,也方便团队成员在后续页面更新时找到判断依据。

  1. 摘出原句:保留 AI 的完整表述,并圈出人名、机构、日期、数字、因果关系和范围词。
  2. 找到原始材料:优先寻找规则文本、原始数据页、完整公告或原文页面;找不到时,把该句标为待定,不把它写进正式内容。
  3. 逐项比对:记录原文对应段落、页面标题、访问日期和不同之处;数字要同时看统计口径与时间范围。
  4. 检查页面状态:查看页面能否直接访问、正文是否完整呈现、是否存在重复版本;涉及网页机制时,把抓取、索引、展示和引用分别记录。
  5. 建立观察闭环:选定一个主转化事件,例如有效表单;连续记录引荐来源、落地页、有效表单和成交状态,并按销售周期设定归因窗口。AI 引荐点击、答案出现和爬虫访问应分开统计,效果无法通用判断,需用自家数据验证。

遇到说不清的内容,别硬把它写成事实

来源之间不一致时,先不要急着选一边。可以并列写出各自的时间、适用范围和原话,再判断它们是否回答的是同一个问题。有时所谓矛盾,只是一个材料讲技术规则,另一个材料讲产品界面;一个描述历史版本,另一个描述当前版本。

如果原始材料没有给出明确结论,更合适的写法是“现有材料只说明了某项条件”或“该结果仍需用自家查询记录验证”。这比补足一个听起来顺畅的答案更有用。对外发布前,把事实、推测和行动建议分段写,读者与 AI 摘要系统都更容易识别内容边界。