一家拥有3万个SKU的服装外贸网站,没对筛选页面进行限制前,谷歌蜘蛛一天内抓取了42万个页面,当中91%属于尺码、颜色、价格交叉组合产生的多余地址。根据服务器日志显示,42万次请求产生了接近15GB的流量损耗,导致服务器在下午3点到5点的访问高峰期CPU占用率高达95%。真正的商品详情页更新整整两周都没被抓取。这种情况在很多采用开源系统的独立站上常发生。商品列表页面的多重过滤结构给访客带来便利,给搜索引擎蜘蛛造成严重的信息堆积。一个包含5个颜色、6个尺码、4个价格区间的分类,能产生120个排列组合地址。当此类地址被当成独立网页抓取,主分类页面的权重就会遭到摊薄。

谷歌分配给每个网站的抓取额度存在上限。针对中小型零售站点,日常每日抓取配额通常在2000次到5000次抓取请求。当过滤条件组合出的死循环页面占用其中80%的配额,新上架的产品就会错失索引机会。

下面是一组来自某3C数码配件独立站的真实监测数据,展示了治理前后的爬虫行为变化:

监控指标 治理前(4月1日-4月7日) 治理后(5月1日-5月7日)
谷歌爬虫日均抓取请求数 18500次 4200次
重复参数页面占比 78.3% 2.1%
新产品24小时内收录率 12.5% 94.8%
主分类页面平均排名位置 45.2位 14.6位

谷歌官方指南明确提出,应当避免让爬虫在内容微调的页面上浪费时间,应当把蜘蛛引向真正具备独特内容的网页。

页面的无节制生成源于数据库查询常态下的实时响应。每多勾选一个标签,URL末尾就会拼接一段新的代码。这在技术上被称为多重属性列表。对于不具备编程背景的企业管理人员,辨别此类多余地址只需要观察网址中是否包含问号、等号。凡是包含此类符号而展示商品与主分类高度一致的页面,都是需要进行规范化处理的对象。

页面主从关系的建立步骤

通过规范标记与不收录标签明确网页主次。

在一款包含“?color=red&size=xl”的衍生地址里,必须在代码头部写入一行规范标签,指向没有尾巴的干净主分类地址。技术人员检查网页源代码,确保 <link rel="canonical" href="..." /> 里的目标是指向最上层分类。针对极度细分的组合,比方说“红黄蓝与XL码”,此组合在日常搜索中每月的检索量通常为0。应当在此类地址的代码中加上 noindex 指令。

实施规范标签有明确的代码规范:

  • 单一页面只允许存在一个规范标签。

  • 标签内的地址须使用绝对路径,不能写成相对路径。

  • 分页第二页往后的规范标签须指向各自分页,不指向第一页。

  • 排除大小写字母不一致引发的二次跳转网址。

  • 移除带有会话ID(Session ID)的可变尾巴。

  • 确保该标签写在 <head></head> 之间。

  • 确保标签中的URL采用小写字母,规避因大小写造成的重复识别。

  • 检查自引用的规范标签是否在手机端页面中正确同步。

  • 杜绝在同一行代码中混用 noindexcanonical 指令。

技术实施团队常犯的错误是将带有特定排序的页面指回主分类。如果一个分类页面按价格从低到高排列(如 ?sort=price_low),每日产生超过50次真实的自然搜索点击,保留其独立收录比完全屏蔽更有利。此时需要运维人员在后台导出前30天的搜索控制台数据,筛选出有点击量的参数组合,将此类特例排除在批量处理规则之外。

另一个技术漏洞是规范标签的循环指向。A页面指向B页面,B页面反向指向A页面,此类配置会导致谷歌的算法选择忽略该标签。标准的做法是始终保持单向指向,即所有多余参数页面全部指向唯一的、最原始的分类URL。

蜘蛛爬行路线的管理手段

借助爬虫协议与网页链接控制蜘蛛爬行路线。

编辑网站根目录下的 robots.txt 文本文件,能将不需要参与排名的参数写入拒绝访问清单。禁止蜘蛛抓取带有排序参数 sort=、视图切换参数 view= 的网址可以腾出多余的服务器带宽。翻页链接改动上,丢弃点击后无刷新的前端渲染脚本。应当采用标准的 <a href> 标签把前后页连起来。

管理蜘蛛爬行路线的执行细节:

  • 编写规则时使用星号通配符 * 匹配多余参数。

  • 在站长工具后台提交最新的规则文件进行实效验证。

  • 翻页文本内包含“下一页”的纯文字提示。

  • 商品列表里的商品图片带有一层硬链接。

  • 定期清理已经失效的旧版拦截规则。

  • 保持移动端与桌面端的规则完全一致。

  • 监控服务器日志中404状态码的比例变化。

  • 每天清晨5点检查网站日志中的Googlebot抓取频次。

  • 确保分类页面的内链数量维持在每页不超过60个链接的区间。

拦截目标参数 对应的Robots规则代码 改动效果说明
用户评论排序 Disallow: /*?sort=comment 阻止蜘蛛抓取无排名意义的评价页面
视图切换 Disallow: /*?view=grid 防止因网格或列表切换生成大量重复页
价格区间筛选 Disallow: /*?price= 阻断因价格变动产生的无尽参数组合
内部测试ID Disallow: /*?test_id= 清理开发阶段残留的技术记录参数

在配置Robots文件时,技术人员必须注意先后顺序。谷歌的解析规则是从上到下读取。如果允许规则(Allow)与禁止规则(Disallow)针对同一个参数发生重叠,通常会以字符匹配长度更长的规则为准。为了避免引起歧义,建议将通配符的范围控制在特定参数名之内,不要使用过于宽泛的模糊匹配。

采用单页面应用(SPA)技术的现代电商站,喜欢用哈希符号(#)来做筛选。由于谷歌蜘蛛默认会忽略网址中哈希符号后面的内容,该项技术表面上避免了多余网址的产生。发生的新问题是,具备SEO作用的品类筛选页会无法被搜索引擎识别。对于此类站点,需要通过服务端渲染(SSR)技术,将有搜索需求的分面转换为标准的路径格式(如 /category/red-shoes/),而将无用处的组合保留在哈希结构中。

技术改动常见错误防范

改动期间容易出现技术偏差,以下项目需要安排全面测试:

  • 错估特定长尾词的搜索量。某些特定分类如“14寸轻薄笔记本”,在日常搜索里每月有超过3000次检索。此类带有明显意图的页面应当独立开放收录,不应被无差别拦截。

  • 无限滚动加载设计常引发商品遗漏。瀑布流页面如果不做后端分页改动,谷歌蜘蛛只能读取到前20个商品。排在后面的商品在搜索引擎眼里并不存在。必须确保在禁用脚本的情况下,页面底部依然能呈现出可供点击的分页数字。

  • 指令冲突会让搜索引擎放弃执行。一面在协议文件里禁止抓取,另一面又在页面里写了规范标签,这会导致蜘蛛无所适从。正确的做法是,需要规范化的页面允许抓取,需要彻底断绝抓取的页面才在协议里拦截。

检查清单明细:

  1. 确认没有将主分类页面的链接写入屏蔽规则。

  2. 确认HTTPS与HTTP版本没有发生混淆。

  3. 确认所有参数的顺序不会影响页面内容的输出。

  4. 确保站长工具中的错误提示数量在14天内下降。

  5. 核对网站地图(Sitemap)中只包含规范地址。

  6. 监测服务器在爬虫抓取峰值时的CPU占用率。

  7. 抽查20个典型筛选页面的源代码标记。

我们看一个具体的实际案例。某箱包独立站在4个月前遭遇了收录暴跌。技术团队通过后台日志分析,发现一个新上线的颜色筛选插件导致原本只有500个页面的站点在3天内衍生出了18万个无效网址。谷歌蜘蛛在尝试抓取了其中4万个网址后,触发了网站的防爬机制,导致主域名整体信用度下降。

下表记录了该站采取治理手段后各阶段的收录和流量恢复情况:

治理时间节点 索引库网页总量 谷歌月度自然点击量 爬虫抓取成功率
发生故障时(1月10日) 184,200个 1,200次 34.5%
部署规范标签后(2月10日) 12,300个 2,800次 78.2%
调整协议拦截后(3月10日) 620个 8,900次 99.1%
稳定运行期(4月10日) 540个 14,500次 99.6%

通过控制无效地址的蔓延,技术人员得以为每个有真实搜索量的分类页面分配合理的权重。普通的电商网站管理者不需要亲自去写每一行程序,只要比对上述表格中的技术指标,就能对技术团队或外部服务商的实际产出做出准确的评判。日常运营中,每周登录一次谷歌搜索控制台(Google Search Console),查看“索引编制”报告下的“已排除”页面数量,能够帮助管理者在损失发生前提早发现参数失控的苗头。

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐