SEO 百科

URL 发现

本页目录

网址发现指的是搜索引擎找出网络上存在哪些网页的那一步[2]。发现排在抓取之前:先要知道有这么一个网址,才谈得上访问。所以一个页面哪怕做得再好,只要没有被发现,引擎就永远不会去抓。

发现的起点

第一步要面对的,是一个没有总表的世界。并不存在一份包含所有网页的中央注册表,所以引擎只能不断去找新网页和更新过的网页,加进已知网页的列表[2]。这个过程本身,就是网址发现。

也就是说,发现不是一次完成的动作,而是一个持续的过程。网站上每多一个页面,就多一个待发现的地址。

链接的作用

引擎发现新网页,主要依靠已知网页上的链接[2]。引擎从一个已经知道的页面出发,提取其中指向别处的链接,那些陌生的网址就此进入视野。比如 <a href="/products/cnc-machine">数控机床</a>,这就是一个指向别处的链接。

这也是中心页为什么重要。因为一个分类页会链接到新的文章,引擎由此发现文章。也就是说,链接把网页一层层串起来,让发现可以延续下去。

站点地图的作用

除了顺着链接走,网站还可以主动交出一批网址,方式就是提交站点地图[1][2][3]。它以列表的形式,列出希望引擎关注的网页。

这条途径不依赖别人链接过来,所以在链接稀少的新站点上,它的作用更明显。

站点地图写成一份 XML 文件,放在网站根目录,用 <loc> 列出每个网址,用 <lastmod> 说明最后修改时间:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.example.com/products/cnc-machine</loc>
    <lastmod>2025-10-01</lastmod>
  </url>
</urlset>

发现与抓取的区别

要把发现和抓取分开看。发现只意味着引擎知道了这个网址,是否真的去访问,还要另做判断[2]。所以会发现一批网页,实际抓取的却只是其中一部分。

同样,抓取也不等于收录。这几步是一道道关口,每一步都要单独过。

附录

参见

参考资料

官方(境外)

  1. 《Sitemaps》,Bing 网站管理员工具。
  2. 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。

官方(国内)

  1. 《提交Sitemap》,神马搜索站长平台。

外部链接

无。