南通颐猩文化传播有限公司

當前位置:首頁 >  站長 >  搜索優(yōu)化 >  正文

百度如何判斷網頁文章的重復度?兩個頁面相似度確認方法介紹

 2022-04-24 15:27  來源: 網絡綜合   我來投稿 撤稿糾錯

  域名預訂/競價,好“米”不錯過

在這個科技高度發(fā)達的時代,百度已經成為人們能獲取消息的主要途徑。但如今的百度,到處充斥著一些重復的內容,對用戶的訪問造成很大的困擾。因此,百度需要對網頁重復進行判斷,對重復的網頁,只選取一些高質量的我那工業(yè),共用戶瀏覽。然而,現(xiàn)有技術中一般是通過比較兩個頁面的內容和借點,來確認兩個頁面的相似度。

這種方法能夠計算的比較準確,可時間復雜度太高,計算很費時間。通過對一個頁面中的某些重要信息進行簽名,然后比較兩個頁面的簽名,來計算相似度,這種方式比較簡單高效,計算速度比較快,比較適合百度這種海量信息的應用場景。

1,網站重復內容的判斷

A,獲取多個網頁;

B,分別提取網頁的網頁正文;

C,從網頁正文中提取一個或多個句子,并根據一個或多個句子計算網頁正文句子簽名;

D,根據網頁正文句子簽名對多個網頁進行聚類;

E,針對每一類下的網頁,計算網頁的附加簽名;

F,根據附加簽名判斷每一類下的網頁是否重復。

通過上述方式,網頁重復的判斷系統(tǒng)及其判斷方法通過包括網頁正文句子簽名在內的多維度簽名有效且快速地判斷網頁是否重復。

網站頁面基本架構

提取正文

A,對網頁進行分塊;

B,對分塊后的網頁進行塊過濾,以獲取包含網頁正文的內容快;

C,從內容塊中提取網頁正文。

正文分句

A,對網頁正文進行分句;

在本步驟中,可利用分號,句號,感嘆號等表示句子完結的標志符號來對網頁正文進行分句。此外,還可以通過網頁正文的視覺信息來對網頁正文進行分句。

B,對分句后的網頁正文進行過濾及轉換;

在步驟中,首先過濾掉句子中的數字信息;版權信息以及其他對網頁重復判斷不起決定性作用的信息。隨后,對句子進行轉換,例如,進行全角/半角轉換或者繁體/簡體轉換,以使得轉換后的句子的格式統(tǒng)一。

C,從過濾及轉換后的網頁正文中提取最長的一個或多個句子;

在本步驟中,過濾及轉換后的網頁正文提取出最長的一個句子或者做場的預定數量連續(xù)句子的組合。例如,某個網頁實例中,經過過濾及轉換后的某段最長,遠超其他句子,因此可選擇該段為網頁正文句子,或者選擇最長的連續(xù)句子組合作為網頁正文句子。

D,對一個或多個句子進行hash簽名運算,以獲取網頁正文句子簽名。

simhash算法就是比較各網頁的附加簽名是否相同或相似來判斷網頁是否重復。具體來說,在比較利用simhash簽名運算獲得的網頁正文簽名時,比較網頁正文簽名的不同位數,不同位越少,表示網頁重復的可能性越高,在比較其他的附加簽名時,若附加簽名相等,表示網頁在該緯度上重復。

總結:

1、兩個網頁的真實標題簽名相同。

2、兩個我那工業(yè)的網頁內容簽名相同。

3、兩個網頁的網頁正文簽名的不同位數小于6.。

4、兩個網頁的網頁位置簽名相同,并且url文件名簽名相同。

5、評論塊簽名、資源簽名、標簽標題簽名、摘要簽名、url文件名簽名中有三個簽名相同。

附加信息整站判斷重復標準:

通過兩兩頁面比較,可以得到真重復url的集合。一般來說,如果這個真重復url集合中的網頁的數量/整個網頁集中網頁的數量大于30%,則認為整個網頁集都是真重復,否則就是假重復。

申請創(chuàng)業(yè)報道,分享創(chuàng)業(yè)好點子。點擊此處,共同探討創(chuàng)業(yè)新機遇!

相關標簽
百度seo

相關文章

  • 最接地氣的SEO指南 讓新入行的你少走一大段彎路

    老賀是2005年開始做網站的,那時候我們國內的網站并不多,但是每天分享知識的人卻不少,整天混跡在A5站長網、站長之家、落伍者上面,不斷的充實自己,不過信息良莠不齊,也走了很多的彎路。之后在實踐、實戰(zhàn)中有了技能,在2008年的時候,老賀開始對外搞SEO,就這樣一晃十多年過去了。今天這篇文章,老賀只寫一

  • 百度會區(qū)別對待不同域名前后綴嗎?

    我曾在另一個SEO博客中發(fā)表過一篇文章,是關于“百度是否會區(qū)別對待不同域名后綴”的文章,在文章中我提出了一個觀點,明確指出“百度不會區(qū)別對待不同后綴的域名”,每一種后綴的域名享有同等待遇。

    標簽:
    百度seo
  • 談談全網SEO矩陣是什么?一般怎么做?【舉例】

    大家好,我是白楊SEO,專注SEO十年,SEO流量實戰(zhàn)派,企業(yè)流量增長顧問。擅長研究各平臺自然搜索流量玩法。曾帶一個PCB項目,從0-1,現(xiàn)該項目年營收10億+。曾靠一篇文章引流精準粉絲1000+,變現(xiàn)3萬+。個人原創(chuàng)公眾號:白楊SEO。一年不到,關注人數從0到5000+,目前關注25000+。

  • 百度正在暴力截流SEO還有用嗎

    百度的核心流量階層基本已經固化,新的站點很難會有太多的流動機會,這個時候就需要去豐富流量的來源類型,避免把雞蛋都裝在一個籃子里。比如下面這個站點,谷歌和必應的流量占比都在不斷的上漲中,這也是平臺向內容生產者釋放出的友好信號,是值得去重點拓展維護的。

    標簽:
    百度seo
  • 怎么巧用百科讓網站排名上升流量倍增?

    怎么巧用百科讓網站排名上升流量倍增?很多朋友的網站優(yōu)化以后還是沒有得到很好的排名,沒關系,今天給大家分享一個技巧,就是使用百科讓沒排名的網站迅速排名,需要的朋友可以參考下

熱門排行

信息推薦