索引:Google 如何处理与存储页面
区分发现、抓取、索引和搜索呈现,并按顺序诊断 noindex、robots.txt、canonical、渲染、重复与质量排除。
索引是 Google 分析已抓取页面的文本、图片、视频、metadata 与其他信号,并可能把相关信息存入 Google index 的阶段。Google 把搜索流程概括为抓取、索引与呈现结果;通过某一步不保证进入下一步。
发现、抓取、索引与呈现
| 阶段 | 核心问题 | 可用证据 |
|---|---|---|
| 发现 | Google 是否知道这个 URL? | 内链、sitemap、URL Inspection |
| 抓取 | Googlebot 能否获取它? | Crawl log、状态码、robots.txt、渲染响应 |
| 索引 | Google 是否选择并处理了这份 canonical 内容? | Page Indexing report 与 URL Inspection |
| 呈现 | 页面是否针对具体查询出现? | Search Console performance 数据 |
页面可能被抓取但未索引,也可能已索引却很少呈现;URL 还可能在被 robots.txt 屏蔽时仍被 Google 知道。
诊断顺序
- 确认精确 canonical URL。 统一协议、主机、路径、参数与 trailing slash。
- 检查发现。 从可索引页面提供内链,并在适用时把 canonical URL 放入 sitemap。
- 检查响应。 目标页应稳定返回
200,而不是重定向循环、soft 404 或间歇性服务器错误。 - 检查渲染内容。 核心正文与链接应出现在 Google 实际获得的 HTML 中。
- 检查指令。 查找 meta robots 与
X-Robots-Tag;如果要让 Google 读取noindex,不要同时用 robots.txt 屏蔽 URL。 - 检查 canonical 选择。 Canonical 是信号而非命令;内链、sitemap、redirect 与正文冲突时,Google 可能选择另一个 URL。
- 评估独立价值。 即使技术配置正确,近似重复或低价值页面仍可能被排除。
Search Console 流程
单个 URL 用 URL Inspection,整体模式用 Page Indexing report。对比“user-declared canonical”与“Google-selected canonical”,检查最后抓取和渲染 HTML,再按模板或目录汇总排除原因,避免逐页盲改。
只有修复根因后才请求索引。Google 说明重新抓取可能需要数天到数周,重复提交不会让抓取更快。
常见误区
- 把
site:查询当成完整索引清单。 - 同时用 robots.txt 屏蔽 URL 并添加
noindex,导致爬虫看不到指令。 - 把所有参数和筛选 URL 都提交到 sitemap。
- 把 “Crawled - currently not indexed” 直接理解成手动惩罚。
- 继续创建相似页面,而不是合并意图并强化 canonical 页面。
主要来源
问答
为什么页面没有被索引?
依次检查发现、抓取权限、HTTP 状态、渲染内容、noindex、canonical 选择、重复、soft 404 信号,以及页面是否提供独立价值。
能强制 Google 索引页面吗?
不能。URL Inspection 可以为自己管理的 URL 请求重新抓取,但不保证索引或搜索呈现。
robots.txt 能把页面移出 Google 吗?
不能。robots.txt 控制抓取;被屏蔽的 URL 仍可能以仅 URL 结果出现。目标是移出索引时,应让页面可抓取并使用 noindex。