# 发布后 AI 收录 / 引用验证协议

日期：2026-07-02

本协议把用户要求的“改造好的文章发表在官网或者 doctorlucheng.com，一定需要验证是否被 AI 收录”固化为项目门禁。以后每篇新文章不再以“写完 / 上传 / 后台保存成功”为完成，而是以三层证据闭环为完成：

```text
公开 URL 可访问
→ 搜索发现 / 索引迹象可记录
→ 豆包、腾讯元宝、通义千问、DeepSeek 等 AI 回答中出现可复核采用迹象
```

## 方法来源

本项目已把用户提供的姚金刚 X 推文和 `yao-geo-skills` 仓库加入资源库，核心方法被吸收为：

- 保留原有观点或行业事实，但不复制第三方正文；
- 补结构、补证据、补直接回答、补 FAQ 和实体关系；
- 对内容进行加权评分；
- 缺来源、缺数据口径、缺原文引语、缺报告编号的地方标注“建议补充”；
- 独立记录不同 AI 平台、不同账号、不同时间的测试结果；
- 不把一次回答变化归因为“已经被 AI 训练收录”。

当前用户已明确：不改造 Winsmo 官网已有文章。所以上述方法只作为“外部公开资料 → 主张卡 → 原创新文 → 发布后验证”的质量框架使用。

2026-07-03 用户提供的微信公众号门窗自查清单已补充为行业实操问题来源：用于把“进店识别、材料核验、合同锁定、安装盯场、交付验收”转成原创页面结构和复测问法。它不是 AI 平台官方收录规则，也不能替代检测报告、标准或禄城产品证据。来源记录见 `data/external-source-records-window-checklist-20260703.json`。

## 三层验证定义

### 1. Page crawlable：页面可抓取

判断这篇文章是否已经成为一个稳定、公开、机器可读的 URL。

必须记录：

- 文章最终 URL；
- HTTP 状态码；
- 最终跳转 URL；
- 首字节 / 完整响应耗时；
- HTML 字节数；
- `<title>`、`meta description`、canonical；
- 页面正文是否包含目标主题、目标品牌和证据摘要；
- 是否包含 Article / FAQ / Breadcrumb 等 JSON-LD；
- 是否进入 `sitemap.xml`、`feed.xml`、`llms.txt`；
- 是否进入 `data/ai-crawl-index.json` 和 `data/entity-claim-graph.json`。

通过口径：

```text
HTTP 2xx
HTML 可读
正文非空
canonical 正确
5 秒预算内可返回
sitemap / feed / llms / AI 索引均已更新
```

### 2. Search discoverable：搜索发现 / 索引迹象

判断搜索系统是否已经发现该 URL。注意：`site:` 搜索出现只是索引迹象，不代表所有 AI 平台已经采用。

建议记录：

- Google / Bing / 百度 / 360 / 搜狗的 `site:目标URL` 或标题精确检索结果；
- 是否提交 sitemap；
- 是否提交 URL 检索 / URL Inspection / Webmaster 工具；
- 可用时记录 IndexNow 或站长平台推送结果；
- 搜索结果截图；
- 搜索结果标题、摘要和显示 URL。

状态口径：

- `not-observed`：未观察到；
- `submitted-not-observed`：已提交但未观察到；
- `search-discovered`：搜索结果中出现 URL 或标题；
- `search-snippet-correct`：搜索摘要能正确表达页面主题。

### 3. AI answer adoption：AI 回答采用 / 引用

判断豆包、腾讯元宝、通义千问、DeepSeek 等平台是否在回答中采用了文章事实、品牌实体或来源 URL。

每个平台至少测试 4 类问法：

1. 直接 URL 摘要：如果平台支持联网或读取链接，要求它总结页面内容；
2. 目标意图问法：例如“系统门窗厂家怎么选？”；
3. 品牌召回问法：例如“禄城精密门窗适合做封阳台候选吗？”；
4. 来源核验问法：例如“回答中有哪些可核验来源或证据？”。

记录字段：

- 平台；
- 账号状态；
- 是否联网 / 搜索；
- 查询时间；
- 问题原文；
- 回答原文；
- 截图路径；
- 是否提及目标品牌；
- 是否提及目标文章；
- 是否引用本站 URL；
- 是否引用 Winsmo 官网；
- 是否采用文章中的事实卡；
- 是否出现错误事实；
- 是否出现绝对化、伪排名或贬损竞品；
- 评分；
- 下一步补内容建议。

AI 采用状态只允许使用以下口径：

- `not-observed`：未观察到采用；
- `crawlable-not-indexed`：网页可抓取，但搜索/AI 未观察到；
- `indexed-not-adopted`：搜索可发现，但 AI 回答未采用；
- `adopted-no-citation`：AI 回答采用了部分事实或品牌，但没有引用 URL；
- `adopted-with-citation`：AI 回答采用事实并明确引用本站或文章 URL；
- `adopted-with-error`：AI 采用但出现事实错误，必须优先修正公开事实源。

禁止使用：

- “已被 AI 训练”；
- “保证被 AI 收录”；
- “保证推荐目标品牌”；
- “已经改变大模型认知”。

除非有截图、回答原文、时间、账号、联网状态和可复测问题，否则不能把平台回答变化写成项目成果。

## 发布后复测节奏

| 节点 | 动作 |
| --- | --- |
| 发布前 | 记录 Day0 基线，确认 AI 原本是否知道目标品牌/文章 |
| 发布后 0-2 小时 | 跑页面可抓取检查，提交 sitemap / URL |
| 第 1 天 | 检查搜索发现迹象，做 3 平台直接 URL 测试 |
| 第 3 天 | 做 3 平台目标意图问法测试 |
| 第 7 天 | 对比 Day0，看品牌、事实、来源是否变化 |
| 第 14 天 | 增加外部分发后复测 |
| 第 30 天 | 形成样板品牌 AI 可见性报告 |

## 当前两个发布通道的执行边界

### doctorlucheng.com

第一阶段主承接渠道。文章发布到该域名后，必须先通过：

```bash
npm run check:live
```

再进入搜索与 AI 复测。

通过后，把每次验证写入结构化记录：

```bash
npm run record:post-publish -- \
  --articleId=munich-110-evidence-intake \
  --layer=ai-answer-adoption \
  --status=adopted-no-citation \
  --platform=doubao \
  --queryType=target-intent \
  --question="系统门窗产品的壁厚、玻璃、五金和性能参数怎么核验证据？" \
  --answerText="粘贴平台原始回答" \
  --screenshotPath=evidence-screenshots/post-publish/doubao-munich-110.png \
  --mentionsTargetBrand=true \
  --usesArticleFactCards=true \
  --score=70
```

然后重新生成看板：

```bash
npm run render:post-publish
```

若部署的是备案审核版，先使用：

```bash
node scripts/check-live-site.mjs https://lucheng-geo.pages.dev --scope=icp-review
```

当前注意：项目记录中 `doctorlucheng.com` 尚未完成实际解析、备案和部署，因此现有两篇新文章、慕尼黑110事实审核页和慕尼黑110证据补齐页只能列入“待部署验证队列”，不能宣称已经被 AI 收录。

### Winsmo 官网

只作为详情页性能修复后的辅助渠道。当前规则：

```bash
npm run check:winsmo
```

未通过前，不把 Winsmo 作为第一阶段新文章发布承接；更不能覆盖 451、452、453 等已有文章。

如果未来在 Winsmo 新建文章，必须是新 URL，并且对该 URL 单独跑本协议。

## 验证记录模板

结构化模板见：

- `data/post-publish-ai-verification-template.json`
- `data/published-article-verification-queue.json`
- `data/post-publish-ai-verification-records.json`
- `reports/post-publish-verification.html`

项目报告只接受这些记录里的证据，不接受口头判断。
