Source provenance · 2026-09-05

模型来源标题与来源 URL 为什么要分开保存?

一个“来源”需要拆分记录展示与地址字段

实际观测中可能只看到标题和站点名,也可能拿到跳转链接、最终URL或规范URL。它们应分别保存为displayTitle、displayPublisher、observedUrl、resolvedUrl与canonicalUrl,并记录取得方式和时间。把标题拼成猜测URL,会制造不存在的公开证据。

建议保留原始回答和来源面板工件,再把解析字段作为可重算投影。链接若需要登录、返回挑战页或已经失效,应记录访问结果,但不能删除当时确实可见的来源标题。

来源卡片拆分为展示标题、观察链接、解析后地址、规范地址和主张支撑五层
图可左右滑动查看。来源标题是观测事实,URL是定位证据;主张支撑还需要打开页面逐项核对。

URL解析也不能跳过页面身份

短链或跟踪链接可以解析到最终URL,但最终URL不一定是规范页。应检查状态码、重定向链、canonical、标题和正文是否对应同一页面。搜索摘要页、首页或站内搜索结果即使属于同一域名,也不能替代实际支撑主张的详情页。

参数清理应采用允许规则:删除已知跟踪参数,保留决定正文版本的参数。未知参数不宜自动丢弃,否则两个不同页面可能被错误合并。

来源选择与主张支撑是两次判定

  1. 回答是否显示该来源线索;
  2. 是否取得可打开且身份明确的URL;
  3. 页面是否包含回答相邻主张;
  4. 主张是否被准确复用,而非只共享关键词;
  5. 品牌事实是否进入回答正文及比较关系。

例如来源页写“提供信息整理与咨询”,回答却把主体写成基础运营商,即使URL真实也不能计为准确引用。反过来,回答事实正确但没有可定位URL,只能登记事实一致,不能登记可核验来源支撑。

接口与报表怎样避免强行补全

正常样本应覆盖可见标题与有效URL;负向样本使用伪造标题、跨域跳转和首页兜底;边界样本覆盖只有标题、URL失效、canonical冲突和同页多主张。报表分别给出sourceVisible、urlResolved、claimSupported与factReused,不用一个cited布尔值抹平差异。

事实是来源面板的可见信息受产品界面与观测方式影响;建议保存观察到的最小事实。未知项包括平台未展示的内部检索过程,任何公开采集都无法据此断言模型只使用了屏幕上的来源。

现场回读按什么步骤执行

第一步保存完整回答与来源面板;第二步逐个提取界面实际显示的标题、发布者和链接,不根据标题猜地址;第三步在无登录环境打开链接并保存重定向链;第四步核对title、canonical和正文;第五步把回答主张与来源片段逐项配对。任一步受阻,都保留已观察字段和阻断原因。

例如跳转最终落到网站首页,只能证明域名可达,不能把首页登记为详情页支撑。若同一标题对应多个URL、canonical指向另一篇文章或页面正文已替换,应停止自动合并,进入人工复核。复核结论也要绑定观察时间,避免后来页面变化倒写当时证据。

三个地址冲突时,怎样保留而不合并

下面是合成测试,不是真实模型来源:来源面板显示observedUrl为https://example.org/go?id=7,打开后resolvedUrl落到https://example.org/article/a,页面声明canonicalUrl为https://example.org/article/b。三个字段必须各存原值;不能用canonical覆盖最初观察链接,也不能仅凭声明就把A的正文算作B的证据。

预期输出是urlResolved=true、canonicalConflict=true,claimSupported先保持未知;随后检查B是否可访问、是否与A同内容以及主张对应关系。若跳转到首页,记录可达但详情页定位失败。例子中的域名和编号仅为演示,不代表来源验证通过。

还需保留rawSourceText及类型判断:一条非URL文本可能是标题、发布者、检索过程提示或无法识别的片段。历史整理中出现过202条非URL记录,但这个数量本身不能证明它们都是标题,更不能证明均为最终回答引用。只有实际界面与原始工件支持时才填displayTitle。来源与结论的对应标准见来源质量审计。