老话说,图样画不明白,木料再好也是废的。网站也是这个理,页面做得再精致,底下的架子搭歪了,搜索引擎爬进来转两圈就走。
静态站之所以被反复推荐给需要做收录的站点,原因就在这儿。它不用等浏览器执行脚本,服务器把 HTML 直接吐出来,蜘蛛拿到手的已经是完整内容。这一条省掉的,是一大堆不确定性。
但光“静态”两个字不够。真正决定抓取效率的,是网站设计阶段架子怎么搭。
先看 URL 层级。见过层级挖到五六层的站,首页点进栏目,再点子栏目,再点分类,最后才摸到内容。蜘蛛爬得累,权重也被一层层稀释掉。稳当的做法是压到三层以内,首页、栏目、详情,够了。列表页的分页尽量用参数,不要另开目录;翻到第五页往后那些老内容,加个 noindex,别让蜘蛛在分页里兜圈子。
URL 本身也得能读懂。/anli/1234.html 和 /anli/qiyewangzhan-gaiban.html,后者对蜘蛛、对用户都更友好。中文站用拼音或者英文都行,别出现一长串问号参数。带 session id 的地址更是灾难,同一个页面能生成无数个地址,重复收录就是这么来的。
有个细节容易漏,导航不能用脚本生成。这是静态站最常见的坑。有些站图省事,顶部导航用 JS 拼出来,蜘蛛执行不了脚本,看到的就是一片空白。导航、面包屑、底部链接这些结构性入口,必须老老实实写在 HTML 里。
sitemap 和 robots 各管各的。sitemap 是目录,提交最新最全的地址;robots 是门禁,把后台、搜索页、带参数的重复页面挡在门外。两个文件别互相打架,robots 里屏蔽的地址,就别再写进 sitemap。
过滤和筛选页面要单独处理。商城类的站,筛选条件组合起来能生成几千个地址,内容还高度重复。这类页面要么加 noindex,要么在 robots 里挡掉。否则蜘蛛的抓取配额全耗在这上面,真正的内容页反而排不上队。
架构定下来再改,成本很高。URL 规则一变,原来的链接全废,收录得从头再来一遍。所以网站设计的架构必须在动手画页面之前定死,不能边做边改。
前年有个客户图快,URL 直接用自增数字,两年后想改成带关键词的形式。光 301 跳转规则就写了一整天,还得盯着权重传递有没有损耗。
说到底,架子是给蜘蛛搭的路,也是给自己留的后路。前期花两天想清楚,能省后面两年的麻烦。