SEO 百科
URL 发现
本页目录
网址发现指的是搜索引擎找出网络上存在哪些网页的那一步[2]。发现排在抓取之前:先要知道有这么一个网址,才谈得上访问。所以一个页面哪怕做得再好,只要没有被发现,引擎就永远不会去抓。
发现的起点
第一步要面对的,是一个没有总表的世界。并不存在一份包含所有网页的中央注册表,所以引擎只能不断去找新网页和更新过的网页,加进已知网页的列表[2]。这个过程本身,就是网址发现。
也就是说,发现不是一次完成的动作,而是一个持续的过程。网站上每多一个页面,就多一个待发现的地址。
链接的作用
引擎发现新网页,主要依靠已知网页上的链接[2]。引擎从一个已经知道的页面出发,提取其中指向别处的链接,那些陌生的网址就此进入视野。比如 <a href="/products/cnc-machine">数控机床</a>,这就是一个指向别处的链接。
这也是中心页为什么重要。因为一个分类页会链接到新的文章,引擎由此发现文章。也就是说,链接把网页一层层串起来,让发现可以延续下去。
站点地图的作用
除了顺着链接走,网站还可以主动交出一批网址,方式就是提交站点地图[1][2][3]。它以列表的形式,列出希望引擎关注的网页。
这条途径不依赖别人链接过来,所以在链接稀少的新站点上,它的作用更明显。
站点地图写成一份 XML 文件,放在网站根目录,用 <loc> 列出每个网址,用 <lastmod> 说明最后修改时间:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://www.example.com/products/cnc-machine</loc>
<lastmod>2025-10-01</lastmod>
</url>
</urlset>
发现与抓取的区别
要把发现和抓取分开看。发现只意味着引擎知道了这个网址,是否真的去访问,还要另做判断[2]。所以会发现一批网页,实际抓取的却只是其中一部分。
同样,抓取也不等于收录。这几步是一道道关口,每一步都要单独过。
附录
参见
参考资料
官方(境外)
- 《Sitemaps》,Bing 网站管理员工具。
- 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。
官方(国内)
- 《提交Sitemap》,神马搜索站长平台。
外部链接
无。