可复用的办法是做一套“已知答案加故意干扰”的双轨测试:让 AI 先回答明确事实,再处理改写、缺条件和互相冲突的材料。这样能分开观察它是在理解内容,还是只抓住了熟悉词语;测试结论只代表当前页面、当前模型和当前提问方式,换版本后仍需重新记录。
别只问一道题,先准备答案底稿
测试前把页面里的关键结论整理成简短底稿,每条写清原文位置、适用条件和不能推出的内容。底稿不是给模型看的参考答案,而是人工判断回答对错的尺子。若页面本身表述含糊,先改写页面,再测试模型,避免把内容缺陷误判成理解能力问题。
题目可以围绕事实提取、条件判断和范围边界来写。例如让模型回答“这项服务适用于谁”,再追问“哪些情况不适用”。只有复述名词不算完整理解,能同时说出结论和限制,才更接近可用回答。
三类题能看出它是不是只会抓关键词
事实题用于看模型能否从页面找出明确内容,定位题要求它指出依据所在段落,边界题则故意加入“如果条件改变会怎样”的追问。三类题放在一起,能区分记住词语、找到原文和理解关系这几种情况。
再加一组反事实题,把原文中的时间、对象或适用范围替换掉,但不要改动其他句子。若模型仍沿用原答案,说明它可能没有处理条件变化。这个结果只能作为当前测试样本的观察,不应推成所有模型或所有页面的规律。
同一问题换几种问法再看
同一事实可以写成直接问法、口语问法、倒装问法和带干扰的问法。每种问法都保留同一个判断标准,记录答案是否改变、是否漏掉限制、是否把页面没有说过的内容补出来。若答案不同,不要急着判定模型失常,先看问题是否改变了对象、时间或条件。
适合 GEO 的测试还应加入引用题,例如“请只根据页面内容回答,并指出支持结论的原句”。页面能被访问,不代表回答一定会引用它;抓取记录、答案中的引用、用户点击和后续表单属于不同信号,不能混在一起计算。
页面本身也要过一遍基础检查
AI 理解测试不能脱离页面状态。根据 Google Search Central《搜索抓取和索引编排》,页面是否允许抓取、服务器返回的状态以及页面是否能被发现,都会影响搜索系统接触内容的机会;这些是访问条件,不等于 AI 已经理解或引用页面。
结构化数据也要看它写的是什么。Schema.org《Schema.org词汇表》说明了类型与属性的定义,但使用某个类型并不代表回答质量会提升。测试时应把页面正文、标题、描述和结构化数据里的实体名称放在一起比对,发现同一对象名称、规格或服务范围不一致,就先修内容。
把错误分成几类,才知道改哪里
建议把回答问题分成几种:找不到原文、把条件漏掉、把推测说成事实、混淆页面中的两个实体、引用位置与结论不相称。每次只记录一个主要错误,另加一句修订方向,例如“补充适用范围”或“把两个服务对象拆开”,后续才能看出改动是否有效。
如果模型答案看着流畅,却无法指出原文依据,可以标成“表达顺畅但依据不足”,不要因为语言自然就判为理解正确。反过来,答案较短但准确覆盖条件,也不必用字数评价。判断标准应服务于页面目标,比如产品说明重视参数边界,知识文章重视概念关系。
用一张记录表跑完测试闭环
把测试做成固定记录,而不是临时聊天。每轮使用同一页面版本,保留提问文本、回答文本、模型名称、测试时间、页面地址、引用位置、错误类别和人工结论。页面内容发生变化时,另建版本记录,不能把新旧答案混在一轮里。
- 选定一组事实题、定位题、边界题和反事实题,给每题写人工答案。
- 在同一模型和同一页面状态下重复提问,记录完整回答,不只截图结论。
- 逐题比对结论、条件、实体和原文位置,标出遗漏、混淆与无依据补充。
- 把答案分为正确、部分正确和错误,并给每条部分正确答案写出缺失点。
- 修改页面或题目后重跑同一组问题,再比较错误类型是否变化。
效果不能通用判断,需用自家数据验证。可以把“有效回答率”设为企业内部指标,但口径要先写清:分母是全部题目,还是完成引用要求的题目;观察对象可包括 AI 引荐点击、有效表单和成交状态,主转化事件只选一个,归因窗口按销售周期设定,无法确认的访问标为未识别。
哪些结果不能直接下结论
一次回答正确,只能说明这次提问得到正确结果,不能说明页面已经被稳定理解。一次回答错误,也可能与页面更新、上下文长度、模型版本、问题措辞或访问状态有关。若要判断改版是否有帮助,应保留旧版本题目和回答,再用同一组条件进行复测。
若关注 AI 引荐,观察链路应写成“答案出现、用户点击、进入页面、完成主转化事件”。爬虫访问不等于答案引用,答案出现也不等于点击,点击更不等于订单。成本、周期、单量和效果无法通用判断,需用自家数据验证,别拿单次聊天结果替代业务记录。