最近检查收录发现小魏博客收录了很多分类页。

因为这容易造成内容摘要重复、权重分散、浪费爬虫预算(Crawl Budget)等问题。
分页收录重复解决办法
1、给所有分页加noindex, follow(最推荐的技术方案)
如果你有用WordPress后台yoast插件,那么可以利用Yoast提供的过滤器(Filter)给所有第 2 页及以上的页面添加 noindex, follow:
在主题的 functions.php 文件末尾添加以下代码:
add_filter( 'wpseo_robots', 'my_noindex_paginated_pages' );
function my_noindex_paginated_pages( $robots ) {
if ( is_paged() ) {
return 'noindex, follow';
}
return $robots;
}效果:分页上不会再显示在搜索结果中,但蜘蛛依然能顺着分页上的链接去爬取具体的文章页面。
重点注意:
谷歌曾经表示一个分页长期带有 noindex 标签,搜索引擎最终会对其应用 nofollow,导致深度分页里的文章无法被爬虫抓取和索引。

所以用 noindex,你就必须确保深层文章有其他替代抓取入口:
- Sitemap 100% 覆盖:保证每一篇发布的文章都在 XML Sitemap 中。
- 推荐/相关文章内链:在每篇文章底部加上“相关文章”、“最新文章”、“热门推荐”或标签(Tags),这样蜘蛛即使不走 /page/5/,也能通过网状的文章互链抓到旧文章。
- HTML 站点地图:制作一个包含了所有文章分类和历史文章链接的独立页面(如 /sitemap/),放在脚底(Footer)。
2、设置 Canonical 标签(不推荐)
比如:
第一页:https://xiaoweiboke.com/resource/ 的 Canonical 指向 https://xiaoweiboke.com/resource/
第二页:https://xiaoweiboke.com/resource/page/2/ 的 Canonical 也指向第一页:https://xiaoweiboke.com/resource/ ,这属于误用Canonical
后果:
Google会发现第2页的内容和第1页根本不同(列表里的文章不一样)。
很大程度上会忽略你的Canonical提示,依然强行收录。
同时,因为第2页里面的Canonical指向第1页这还会让蜘蛛认为第2页不需要处理,导致第2页里的文章无法被顺畅爬取。

3、Robots.txt 屏蔽(快速省预算,需谨慎)
可以在 robots.txt 中屏蔽分页路径:
User-agent: *
Disallow: */page/注意:
1.如果你的分页数量极多,消耗了大量的蜘蛛抓取配额
2.robots.txt 只能阻止抓取,不能完全阻止“不抓取但通过外部/内部链接被建立索引”的情况。
3.如果屏蔽了 /page/,请确保网站有提交包含所有文章网址的 XML 站点地图(Sitemap),否则深层页面的文章可能会因缺乏入口而无法被蜘蛛发现。
清理已收录的分页死链/快照
对于已经被百度、Google 等收录的分页,在做完上述设置后:
Google Search Console (GSC):
使用GSC的 “移除” (Removals) 工具,临时隐藏 /resource/page/ 相关的 URL。
结合noindex, follow标签,蜘蛛重新抓取后会自动从数据库中移除该分页。
百度搜索资源平台:
使用“死链提交”或“快照删除/更新”功能清理无用分页。
喜欢这篇内容?
如果你希望以后在Google搜索中更方便找到本站内容,可以将本站设置为你的Google首选来源。

