网站分页收录重复的处理方法
站点历程

分页收录重复处理

最近检查收录发现小魏博客收录了很多分类页。

分页收录重复

因为这容易造成内容摘要重复、权重分散、浪费爬虫预算(Crawl Budget)等问题。

分页收录重复解决办法

1、给所有分页加noindex, follow(最推荐的技术方案)

如果你有用WordPress后台yoast插件,那么可以利用Yoast提供的过滤器(Filter)给所有第 2 页及以上的页面添加 noindex, follow:

在主题的 functions.php 文件末尾添加以下代码:

add_filter( 'wpseo_robots', 'my_noindex_paginated_pages' );
function my_noindex_paginated_pages( $robots ) {
    if ( is_paged() ) {
        return 'noindex, follow';
    }
    return $robots;
}

效果:分页上不会再显示在搜索结果中,但蜘蛛依然能顺着分页上的链接去爬取具体的文章页面。

重点注意:

谷歌曾经表示一个分页长期带有 noindex 标签,搜索引擎最终会对其应用 nofollow,导致深度分页里的文章无法被爬虫抓取和索引。

长期noindex会应用nofollow

所以用 noindex,你就必须确保深层文章有其他替代抓取入口: 

  • Sitemap 100% 覆盖:保证每一篇发布的文章都在 XML Sitemap 中。
  • 推荐/相关文章内链:在每篇文章底部加上“相关文章”、“最新文章”、“热门推荐”或标签(Tags),这样蜘蛛即使不走 /page/5/,也能通过网状的文章互链抓到旧文章。
  • HTML 站点地图:制作一个包含了所有文章分类和历史文章链接的独立页面(如 /sitemap/),放在脚底(Footer)。

2、设置 Canonical 标签(不推荐)

比如:

第一页:https://xiaoweiboke.com/resource/ 的 Canonical 指向 https://xiaoweiboke.com/resource/

第二页:https://xiaoweiboke.com/resource/page/2/ 的 Canonical 也指向第一页:https://xiaoweiboke.com/resource/ ,这属于误用Canonical

后果:

Google会发现第2页的内容和第1页根本不同(列表里的文章不一样)。

很大程度上会忽略你的Canonical提示,依然强行收录。

同时,因为第2页里面的Canonical指向第1页这还会让蜘蛛认为第2页不需要处理,导致第2页里的文章无法被顺畅爬取

分页规范地址

3、Robots.txt 屏蔽(快速省预算,需谨慎)

可以在 robots.txt 中屏蔽分页路径:

User-agent: *
Disallow: */page/

注意:

1.如果你的分页数量极多,消耗了大量的蜘蛛抓取配额

2.robots.txt 只能阻止抓取,不能完全阻止“不抓取但通过外部/内部链接被建立索引”的情况。

3.如果屏蔽了 /page/,请确保网站有提交包含所有文章网址的 XML 站点地图(Sitemap),否则深层页面的文章可能会因缺乏入口而无法被蜘蛛发现

清理已收录的分页死链/快照

对于已经被百度、Google 等收录的分页,在做完上述设置后:

Google Search Console (GSC):

使用GSC的 “移除” (Removals) 工具,临时隐藏 /resource/page/ 相关的 URL。

结合noindex, follow标签,蜘蛛重新抓取后会自动从数据库中移除该分页。

百度搜索资源平台:

使用“死链提交”或“快照删除/更新”功能清理无用分页。


喜欢这篇内容?

如果你希望以后在Google搜索中更方便找到本站内容,可以将本站设置为你的Google首选来源。

小魏博客
我的简称叫做小魏,从2013年开始从事SEO工作至今13年时间,成长轨迹从文章编辑➞发外链➞友链交换➞SEO人员➞SEO主管➞运营主管。 都有哪些技能? 百度SEO做了11年(中间当了一年半的运营主管+品牌宣传维护),谷歌seo做了两年,两年GEO优化,自学网站建设(主要是织梦+帝国+WordPress+易优cms这些CMS),懂些前端的Html+CSS+JS,火车头数据采集,PS软件,剪辑软件等,可谓是五花八门,主要擅长还是SEO优化。

网站迁移

小魏博客加载速度优化

我的SEO博客正式上线

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注