• 首 页

网站建设|北京网站建设|北京网站制作|北京网站建设首选品牌【企通互联】

http://www.qitongnet.com 网站建设咨询热线:010-65587978/77/76/75

相关文章

网页设计鱼网战术在seo的应用
网站建设SEO:刚入门还不如不入门
北京网站制作网站优化不能等同于搜索引擎优化
网站建设让三大搜索引擎重新为我敞开大门
北京网站制作怎样写标题标签Title Tag
北京网站建设荷包做站技术与感想
企通互联剖析百度,优化百度收录
企通互联SEO之目录结构和URL路径
北京网站制作正视seo与搜索引擎的关系
北京网站设计林思吾:做好SEO的二十个要点


品牌理念

北京网站建设最佳合作伙伴
北京网站建设专家企通互联
竭诚为您提供网站建设服务!


友好连接

    • 网站建设
    • 网页设计
    • 网站设计
    • 网站制作
    • 网站优化
    • 百度优化
    • google优化
    • seo
    • 网站推广
    • 网络营销
    • 北京网站建设
    • 北京网站制作
    • 北京网页设计
    • 北京网站设计

文章搜索

你的位置:首页 >> 网站优化 >> 网站制作网站建设优化思路:搜索引擎算法之复制网页

网站制作网站建设优化思路:搜索引擎算法之复制网页


作者: 北京网站建设   日期:2008-03-27 06:01:47  来源: http://www.qitongnet.com

搜索引擎判断复制网页一般都基于这么一个思想: 网站建设

Chinaz^com

为每个网页计算出一组信息指纹(Fingerprint),若两个网页有一定数量相同的信息指纹,则认为这两个网页的内容重叠性很高,也就是说两个网页是内容复制的。 Chinaz

很多搜索引擎判断内容复制的方法都不太一样,主要是以下两点的不同:

Chinaz.com

1、计算信息指纹(Fingerprint)的算法;

Www_Chinaz_com

2、判断信息指纹的相似程度的参数。

Www^Chinaz^com

在描述具体的算法前,先说清楚两点:

中 www.qitongnet.com.国站长站

1、什么是信息指纹?

中 北京网站设计.国.站长站

信息指纹就是把网页里面正文信息,提取一定的信息,可以是关键字、词、句子或者段落及其在网页里面的权重等,对它进行加密,如MD5 北京网站制作加密,从而形成的一个字符串。信息指纹如同人的指纹,只要内容不相同,信息指纹就不一样。 中国.站.长站

2、算法提取的信息不是针对整张网页

Www^Chinaz^com

而是把网站里面共同的部分如导航条、logo、版权等信息(这些称之为网页的“噪音”)过滤掉后剩下的文本。 中.国.站长站

分段签名算法 中国站.长.站

这种算法是按照一定的规则把网页切成N段,对每一段进行签名,形成每一段的信息指纹。如果这N个信息指纹里面有M个相同时(m是系统定义的阙值),则认为两者是复制网页。

中.国.站.长.站

这种算法对于小规模的判断复制网页是很好的一种算法,但是对于像google这样海量的搜索引擎来说,算法的复杂度相当高。

Www@Chinaz@com

基于关键词的复制网页算法 Www@Chinaz@com

像google这类搜索引擎,他在抓取网页的时候都会记下以下网页信息:

Www@Chinaz@com

1、网页中出现的关键词(中文分词技术)以及每个关键词的权重(关键词密度)。 [中国站长站 北京网站建设]

2、提取meta descrīption或者每个网页的512个字节的有效文字。

中国站长.站

关于第2点,baidu和google有所不同,google是提取你的meta descrīption,如果没有查询关键字相关的512个字节,而百度是直接提取后者。这一点大家使用过的都有所体会。 站长.站

在以下算法描述中,我们约定几个信息指纹变量:

站长.站

Pi表示第i个网页; Www@Chinaz@com

该网页权重最高的N个关键词构成集合Ti={t1,t2,...tn},其对应的权重为Wi={w1,w2,...wi} 中.国.站长站

摘要信息用Des(Pi)表示,前n个关键词拼成的字符串用Con(Ti)表示,对这n个关键词排序后形成的字符串用Sort(Ti)表示。 Www@Chinaz@com

以上信息指纹都用MD5函数进行加密。

站.长. 网页设计站

基于关键词的复制网页算法有以下5种: Chinaz@com

1、MD5(Des(Pi))=MD5(Des(Pj)),就是说摘要信息完全一样,i和j两个网页就认为是复制网页。

中国.站长站

2、MD5(Con(Ti))=MD5(Con(Tj)),两个网页前n个关键词及其权重的排序一样,就认为是复制网页。

中国站.长站

3、MD5(Sort(Ti))=MD5(Sort(Tj)),两个网页前n个关键词一样,权重可以不一样,也认为是复制网页。 Chinaz.com

4、MD5(Con(Ti))=MD5(Con(Tj))并且Wi-Wj的平方除以Wi和Wj的平方之和小于某个阙值a,则认为两者是复制网页。 企通互联北京网站制作
5、MD5(Sort(Ti))=MD5(Sort(Tj))并且Wi-Wj的平方除以Wi和 网站制作Wj的平方之和小于某个阙值a,则认为两者是复制网页。

Chinaz~com

关于第4和第5的那个阙值a,主要是因为前一个判断条件下,还是会有很多网页被误伤,搜索引擎开发根据权重的分布比例进行调节,防止误伤。

Www~Chinaz~com

这个是北大天网搜索引擎的去重算法(可以参考:《搜索引擎--原理、技术与系统》一书),以上5种算法运行的时候,算法的效果取决于N,就是关键词数目的选取。当然啦,选的数量越多,判断就会越精确,但是谁知而来的计算速度也会减慢下来。所以必须考虑一个计算速度和去重准确率的平衡。据天网试验结果,10个左右关键词最恰当。

Chinaz_com

后记 中国.站长站

以上肯定无法覆盖一个大型搜索引擎复制网页的所有方面,他们必定还有一些辅助的信息指纹判断,本文作为一个思路,给做搜索引擎优化的一个思路。 Www_Chinaz_com

请作者联系本站,及时附注您的姓名。联系邮箱:edu#chinaz.com(把#改为@)。

Www~Chinaz~com

网页设计
字体:【大】【中】【小】

上一篇:北京网站制作优化思路:搜索引擎算法之复制网页

下一篇:网站设计关于搜索引擎工作原理

这是一个与众不同的品牌,企通互联只专注于网站建设领域!中小型企业网站建设最佳合作伙伴!网站建设咨询热线:010-65587978/77/76/75!

Copyright © 2008 网站建设|北京网站建设|北京网站制作|北京网站建设首选品牌【企通互联】. Designed by www.qitongnet.com Free Website Templates