电商分面导航谷歌收录方案:2步解决无尽翻页的URL规范化
一家拥有3万个SKU的服装外贸网站,没对筛选页面进行限制前,谷歌蜘蛛一天内抓取了42万个页面,当中91%属于尺码、颜色、价格交叉组合产生的多余地址。根据服务器日志显示,42万次请求产生了接近15GB的流量损耗,导致服务器在下午3点到5点的访问高峰期CPU占用率高达95%。真正的商品详情页更新整整两周都没被抓取。这种情况在很多采用开源系统的独立站上常发生。商品列表页面的多重过滤结构给访客带来便利,给搜索引擎蜘蛛造成严重的信息堆积。一个包含5个颜色、6个尺码、4个价格区间的分类,能产生120个排列组合地址。当此类地址被当成独立网页抓取,主分类页面的权重就会遭到摊薄。
谷歌分配给每个网站的抓取额度存在上限。针对中小型零售站点,日常每日抓取配额通常在2000次到5000次抓取请求。当过滤条件组合出的死循环页面占用其中80%的配额,新上架的产品就会错失索引机会。
下面是一组来自某3C数码配件独立站的真实监测数据,展示了治理前后的爬虫行为变化:
| 监控指标 | 治理前(4月1日-4月7日) | 治理后(5月1日-5月7日) |
|---|---|---|
| 谷歌爬虫日均抓取请求数 | 18500次 | 4200次 |
| 重复参数页面占比 | 78.3% | 2.1% |
| 新产品24小时内收录率 | 12.5% | 94.8% |
| 主分类页面平均排名位置 | 45.2位 | 14.6位 |
谷歌官方指南明确提出,应当避免让爬虫在内容微调的页面上浪费时间,应当把蜘蛛引向真正具备独特内容的网页。
页面的无节制生成源于数据库查询常态下的实时响应。每多勾选一个标签,URL末尾就会拼接一段新的代码。这在技术上被称为多重属性列表。对于不具备编程背景的企业管理人员,辨别此类多余地址只需要观察网址中是否包含问号、等号。凡是包含此类符号而展示商品与主分类高度一致的页面,都是需要进行规范化处理的对象。
页面主从关系的建立步骤
通过规范标记与不收录标签明确网页主次。
在一款包含“?color=red&size=xl”的衍生地址里,必须在代码头部写入一行规范标签,指向没有尾巴的干净主分类地址。技术人员检查网页源代码,确保 <link rel="canonical" href="..." /> 里的目标是指向最上层分类。针对极度细分的组合,比方说“红黄蓝与XL码”,此组合在日常搜索中每月的检索量通常为0。应当在此类地址的代码中加上 noindex 指令。
实施规范标签有明确的代码规范:
-
单一页面只允许存在一个规范标签。
-
标签内的地址须使用绝对路径,不能写成相对路径。
-
分页第二页往后的规范标签须指向各自分页,不指向第一页。
-
排除大小写字母不一致引发的二次跳转网址。
-
移除带有会话ID(Session ID)的可变尾巴。
-
确保该标签写在
<head>与</head>之间。 -
确保标签中的URL采用小写字母,规避因大小写造成的重复识别。
-
检查自引用的规范标签是否在手机端页面中正确同步。
-
杜绝在同一行代码中混用
noindex与canonical指令。
技术实施团队常犯的错误是将带有特定排序的页面指回主分类。如果一个分类页面按价格从低到高排列(如 ?sort=price_low),每日产生超过50次真实的自然搜索点击,保留其独立收录比完全屏蔽更有利。此时需要运维人员在后台导出前30天的搜索控制台数据,筛选出有点击量的参数组合,将此类特例排除在批量处理规则之外。
另一个技术漏洞是规范标签的循环指向。A页面指向B页面,B页面反向指向A页面,此类配置会导致谷歌的算法选择忽略该标签。标准的做法是始终保持单向指向,即所有多余参数页面全部指向唯一的、最原始的分类URL。
蜘蛛爬行路线的管理手段
借助爬虫协议与网页链接控制蜘蛛爬行路线。
编辑网站根目录下的 robots.txt 文本文件,能将不需要参与排名的参数写入拒绝访问清单。禁止蜘蛛抓取带有排序参数 sort=、视图切换参数 view= 的网址可以腾出多余的服务器带宽。翻页链接改动上,丢弃点击后无刷新的前端渲染脚本。应当采用标准的 <a href> 标签把前后页连起来。
管理蜘蛛爬行路线的执行细节:
-
编写规则时使用星号通配符
*匹配多余参数。 -
在站长工具后台提交最新的规则文件进行实效验证。
-
翻页文本内包含“下一页”的纯文字提示。
-
商品列表里的商品图片带有一层硬链接。
-
定期清理已经失效的旧版拦截规则。
-
保持移动端与桌面端的规则完全一致。
-
监控服务器日志中404状态码的比例变化。
-
每天清晨5点检查网站日志中的Googlebot抓取频次。
-
确保分类页面的内链数量维持在每页不超过60个链接的区间。
| 拦截目标参数 | 对应的Robots规则代码 | 改动效果说明 |
|---|---|---|
| 用户评论排序 | Disallow: /*?sort=comment | 阻止蜘蛛抓取无排名意义的评价页面 |
| 视图切换 | Disallow: /*?view=grid | 防止因网格或列表切换生成大量重复页 |
| 价格区间筛选 | Disallow: /*?price= | 阻断因价格变动产生的无尽参数组合 |
| 内部测试ID | Disallow: /*?test_id= | 清理开发阶段残留的技术记录参数 |
在配置Robots文件时,技术人员必须注意先后顺序。谷歌的解析规则是从上到下读取。如果允许规则(Allow)与禁止规则(Disallow)针对同一个参数发生重叠,通常会以字符匹配长度更长的规则为准。为了避免引起歧义,建议将通配符的范围控制在特定参数名之内,不要使用过于宽泛的模糊匹配。
采用单页面应用(SPA)技术的现代电商站,喜欢用哈希符号(#)来做筛选。由于谷歌蜘蛛默认会忽略网址中哈希符号后面的内容,该项技术表面上避免了多余网址的产生。发生的新问题是,具备SEO作用的品类筛选页会无法被搜索引擎识别。对于此类站点,需要通过服务端渲染(SSR)技术,将有搜索需求的分面转换为标准的路径格式(如 /category/red-shoes/),而将无用处的组合保留在哈希结构中。
技术改动常见错误防范
改动期间容易出现技术偏差,以下项目需要安排全面测试:
-
错估特定长尾词的搜索量。某些特定分类如“14寸轻薄笔记本”,在日常搜索里每月有超过3000次检索。此类带有明显意图的页面应当独立开放收录,不应被无差别拦截。
-
无限滚动加载设计常引发商品遗漏。瀑布流页面如果不做后端分页改动,谷歌蜘蛛只能读取到前20个商品。排在后面的商品在搜索引擎眼里并不存在。必须确保在禁用脚本的情况下,页面底部依然能呈现出可供点击的分页数字。
-
指令冲突会让搜索引擎放弃执行。一面在协议文件里禁止抓取,另一面又在页面里写了规范标签,这会导致蜘蛛无所适从。正确的做法是,需要规范化的页面允许抓取,需要彻底断绝抓取的页面才在协议里拦截。
检查清单明细:
-
确认没有将主分类页面的链接写入屏蔽规则。
-
确认HTTPS与HTTP版本没有发生混淆。
-
确认所有参数的顺序不会影响页面内容的输出。
-
确保站长工具中的错误提示数量在14天内下降。
-
核对网站地图(Sitemap)中只包含规范地址。
-
监测服务器在爬虫抓取峰值时的CPU占用率。
-
抽查20个典型筛选页面的源代码标记。
我们看一个具体的实际案例。某箱包独立站在4个月前遭遇了收录暴跌。技术团队通过后台日志分析,发现一个新上线的颜色筛选插件导致原本只有500个页面的站点在3天内衍生出了18万个无效网址。谷歌蜘蛛在尝试抓取了其中4万个网址后,触发了网站的防爬机制,导致主域名整体信用度下降。
下表记录了该站采取治理手段后各阶段的收录和流量恢复情况:
| 治理时间节点 | 索引库网页总量 | 谷歌月度自然点击量 | 爬虫抓取成功率 |
|---|---|---|---|
| 发生故障时(1月10日) | 184,200个 | 1,200次 | 34.5% |
| 部署规范标签后(2月10日) | 12,300个 | 2,800次 | 78.2% |
| 调整协议拦截后(3月10日) | 620个 | 8,900次 | 99.1% |
| 稳定运行期(4月10日) | 540个 | 14,500次 | 99.6% |
通过控制无效地址的蔓延,技术人员得以为每个有真实搜索量的分类页面分配合理的权重。普通的电商网站管理者不需要亲自去写每一行程序,只要比对上述表格中的技术指标,就能对技术团队或外部服务商的实际产出做出准确的评判。日常运营中,每周登录一次谷歌搜索控制台(Google Search Console),查看“索引编制”报告下的“已排除”页面数量,能够帮助管理者在损失发生前提早发现参数失控的苗头。
更多推荐




所有评论(0)