判断 AI 回答是否部分正确,关键是把整段话拆成一个个可验证的断言,再分别对照原始材料、时间条件和推理过程,而不是因为其中一半说对了就整体采信。适合先做三件事:标出事实句,找到对应出处,记录答案生成时间;涉及网页时,再看页面能否访问、是否允许抓取,以及引用内容有没有被断章取义。
别把整段答案当成一个结论
一段回答里可能同时有事实、计算、推测和建议。比如“某政策在某地执行,因此所有人都能申请”就包含两个层次:政策是否这样写,以及“所有人都能申请”是否越过了条件限制。前一句有原文支持,后一句仍要单独判断,不能因为前半句正确就放行后半句。
可把每句话改写成“谁、在什么时间、做什么、适用什么条件”的形式。缺少主体、时间或范围的句子,不一定就是错误,但它属于信息不完整,不能直接当作确定事实使用。
真正要比对的是这四类证据
事实类内容看原文是否出现,数字类内容看单位、计算口径和上下文,时效类内容看页面更新时间或适用日期,因果类内容则要区分“材料明确说明”与“模型自行推断”。这四类判断不能共用一个标准,否则容易把观点误当事实。
如果答案写了政策名称、产品参数或机构名称,应回到对应页面逐句比对;如果答案给出比例、金额或日期,要重新计算并记录取值来源。没有找到对应材料时,较稳妥的标记是“暂无法确认”,而不是直接改判为错误。
引用了来源,也不等于整句成立
引用是否有效,要看来源是否真的支持前面的完整表述。常见情况是,出处只说明“某功能存在”,回答却扩展成“效果一定更好”;或者原文限定了地区和日期,回答把限定条件删掉了。此时引用本身可能真实,但整句仍然只能算部分成立。
可以把回答中的引用句和原文放在同一屏,标出对应句子、条件和例外。若原文只支持其中一部分,就把答案改写成“材料明确写到……,至于……仍需另外确认”,这样比简单贴上“正确”或“错误”更能保留信息边界。
网页抓取和索引要怎么看
页面打不开、需要登录、被访问规则限制,都会影响外部系统读取内容。Google Search Central 的《搜索抓取和索引概览》说明了抓取、处理与索引之间的关系;能被抓取不代表页面已经进入索引,也不代表答案一定会引用它,这几个信号要分开记录。
页面测试时,可依次观察 HTTP 返回状态、robots.txt 规则、页面正文是否由脚本延迟生成,以及 sitemap 中是否存在该地址。一个页面即使能在浏览器打开,若返回异常状态或正文无法被读取,AI 依据它生成答案时仍可能缺少关键上下文。
结构化数据能帮什么,不能帮什么
Schema.org 的《Schema.org 词汇表》定义了类型与属性的表达方式,例如文章、产品和组织可以用不同类型描述。它能帮助机器理解页面里的实体关系,但不能单独证明正文事实,也不能推出页面可能被收录、展示或引用。
实际使用时,让结构化数据中的名称、作者、日期和页面正文保持一致;若标记写了一个实体,正文却没有对应说明,或日期与页面显示不一致,机器读取到的信号就会互相冲突。判断答案时仍以正文和可追溯材料为主。
用一张记录表把判断做完
不要只在聊天窗口里凭印象打分。把每条断言记录下来,至少保留原回答、生成时间、断言文本、对应页面、页面日期、判断结果和备注。判断结果可以写成“成立、部分成立、无法确认、不成立”,并在备注里说明缺的是条件、时间还是出处。
- 拆句:把长回答切成可独立判断的事实句和推断句。
- 对照:回到原文或权威文件,逐句比对主体、范围、日期、单位和限制条件。
- 复算:遇到数字,重新计算;遇到日期,记录所在时区和适用期间。
- 查页面:记录访问状态、正文可读性、robots.txt 和 sitemap 情况,避免把抓取信号当成答案正确率。
- 留版本:保存回答文本、页面快照或文件版本,下一次模型回答变化时重新比较。
闭环可以这样跑:观察断言是否成立,记录出处与页面状态,约定“部分成立”必须指出缺失条件,再按团队设定的完整记录周期复看。若同一问题反复出现同类偏差,就修改提示语、补充权威材料或调整页面表达;不要只改答案表面措辞。
遇到矛盾答案,先查时间再下判断
两个回答看起来相反,未必有一个完全错误。政策、价格、产品版本和网页内容都可能发生变化,先把回答生成时间、引用页面日期和适用地区放在一起比较。若时间不同,应分别标注“截至某日期”的结论,避免用新内容否定旧时点下的回答。
如果原始材料之间也不一致,可以按权威层级、发布时间、适用范围和文本明确程度分别记录,不要靠语气强弱决定。面向用户输出时,直接说明存在条件差异,并给出下一次查询需要带上的日期、地区或版本信息。