欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区

創(chuàng)新互聯(lián)告訴你,搜索引擎原理詳解

2014-02-15    分類: 網(wǎng)站建設

搜索引擎,通常指的是收集了因特網(wǎng)上幾千萬到幾十億個網(wǎng)頁并對網(wǎng)頁中的每一個詞(即關鍵詞)進行索引,建立索引數(shù)據(jù)庫的全文搜索引擎。當用戶查找某個關鍵詞的時候,所有在頁面內(nèi)容中包含了該關鍵詞的網(wǎng)頁都將作為搜索結果被搜出來。在經(jīng)過復雜的算法進行排序后,這些結果將按照與搜索關鍵詞的相關度高低,依次排列。根據(jù)自己的優(yōu)化程度,獲得相應的名次。接下來就聽聽來自創(chuàng)新互聯(lián)的分享。

原理概述

在搜索引擎的后臺,有一些用于搜集網(wǎng)頁信息的程序。所收集的信息一般是能表明網(wǎng)站內(nèi)容(包括網(wǎng)頁本身、網(wǎng)頁的URL地址、構成網(wǎng)頁的代碼以及進出網(wǎng)頁的連接)的關鍵詞或者短語。接著將這些信息的索引存放到數(shù)據(jù)庫中。

搜索引擎的系統(tǒng)架構和運行方式吸收了信息檢索系統(tǒng)設計中許多有價值的經(jīng)驗,也針對萬維網(wǎng)數(shù)據(jù)和用戶的特點進行了許多修改,如右圖所示的搜索引擎系統(tǒng)架構。其核心的文檔處理和查詢處理過程與傳統(tǒng)信息檢索系統(tǒng)的運行原理基本類似,但其所處理的數(shù)據(jù)對象即萬維網(wǎng)數(shù)據(jù)的繁雜特性決定了搜索引擎系統(tǒng)必須進行系統(tǒng)結構的調(diào)整,以適應處理數(shù)據(jù)和用戶查詢的需要。

工作原理

爬行和抓取

搜索引擎派出一個能夠在網(wǎng)上發(fā)現(xiàn)新網(wǎng)頁并抓文件的程序,這個程序通常稱之為蜘蛛(Spider)。搜索引擎從已知的數(shù)據(jù)庫出發(fā),就像正常用戶的瀏覽器一樣訪問這些網(wǎng)頁并抓取文件。搜索引擎通過這些爬蟲去爬互聯(lián)網(wǎng)上的外鏈,從這個網(wǎng)站爬到另一個網(wǎng)站,去跟蹤網(wǎng)頁中的鏈接,訪問更多的網(wǎng)頁,這個過程就叫爬行。這些新的網(wǎng)址會被存入數(shù)據(jù)庫等待搜索。所以跟蹤網(wǎng)頁鏈接是搜索引擎蜘蛛(Spider)發(fā)現(xiàn)新網(wǎng)址的最基本的方法,所以反向鏈接成為搜索引擎優(yōu)化的最基本因素之一。搜索引擎抓取的頁面文件與用戶瀏覽器得到的完全一樣,抓取的文件存入數(shù)據(jù)庫。

建立索引

蜘蛛抓取的頁面文件分解、分析,并以巨大表格的形式存入數(shù)據(jù)庫,這個過程即是索引(index).在索引數(shù)據(jù)庫中,網(wǎng)頁文字內(nèi)容,關鍵詞出現(xiàn)的位置、字體、顏色、加粗、斜體等相關信息都有相應記錄。

搜索詞處理

用戶在搜索引擎界面輸入關鍵詞,單擊“搜索”按鈕后,搜索引擎程序即對搜索詞進行處理,如中文特有的分詞處理,去除停止詞,判斷是否需要啟動整合搜索,判斷是否有拼寫錯誤或錯別字等情況。搜索詞的處理必須十分快速。

排序

對搜索詞處理后,搜索引擎程序便開始工作,從索引數(shù)據(jù)庫中找出所有包含搜索詞的網(wǎng)頁,并且根據(jù)排名算法計算出哪些網(wǎng)頁應該排在前面,然后按照一定格式返回到“搜索”頁面。

再好的搜索引擎也無法與人相比,這就是為什么網(wǎng)站要進行搜索引擎優(yōu)化。沒有seo的幫助,搜索引擎常常并不能正確的返回最相關、最權威、最有用的信息。

數(shù)據(jù)結構

搜索引擎的核心數(shù)據(jù)結構為倒排文件(也稱倒排索引),倒排索引是指用記錄的非主屬性值(也叫副鍵)來查找記錄而組織的文件叫倒排文件,即次索引。倒排文件中包括了所有副鍵值,并列出了與之有關的所有記錄主鍵值,主要用于復雜查詢。與傳統(tǒng)的SQL查詢不同,在搜索引擎收集完數(shù)據(jù)的預處理階段,搜索引擎往往需要一種高效的數(shù)據(jù)結構來對外提供檢索服務。而現(xiàn)行最有效的數(shù)據(jù)結構就是“倒排文件”。倒排文件簡單一點可以定義為“用文檔的關鍵詞作為索引,文檔作為索引目標的一種結構(類似于普通書籍中,索引是關鍵詞,書的頁面是索引目標)。

全文搜索引擎

在搜索引擎分類部分我們提到過全文搜索引擎從網(wǎng)站提取信息建立網(wǎng)頁數(shù)據(jù)庫的概念。搜索引擎的自動信息搜集功能分兩種。一種是定期搜索,即每隔一段時間(比如Google一般是28天),搜索引擎主動派出“蜘蛛”程序,對一定IP地址范圍內(nèi)的互聯(lián)網(wǎng)站進行檢索,一旦發(fā)現(xiàn)新的網(wǎng)站,它會自動提取網(wǎng)站的信息和網(wǎng)址加入自己的數(shù)據(jù)庫。

另一種是提交網(wǎng)站搜索,即網(wǎng)站擁有者主動向搜索引擎提交網(wǎng)址,它在一定時間內(nèi)(2天到數(shù)月不等)定向向你的網(wǎng)站派出“蜘蛛”程序,掃描你的網(wǎng)站并將有關信息存入數(shù)據(jù)庫,以備用戶查詢。由于搜索引擎索引規(guī)則發(fā)生了很大變化,主動提交網(wǎng)址并不保證你的網(wǎng)站能進入搜索引擎數(shù)據(jù)庫,因此目前最好的辦法是多獲得一些外部鏈接,讓搜索引擎有更多機會找到你并自動將你的網(wǎng)站收錄。

當用戶以關鍵詞查找信息時,搜索引擎會在數(shù)據(jù)庫中進行搜尋,如果找到與用戶要求內(nèi)容相符的網(wǎng)站,便采用特殊的算法——通常根據(jù)網(wǎng)頁中關鍵詞的匹配程度,出現(xiàn)的位置/頻次,鏈接質量等——計算出各網(wǎng)頁的相關度及排名等級,然后根據(jù)關聯(lián)度高低,按順序將這些網(wǎng)頁鏈接返回給用戶。

標題名稱:創(chuàng)新互聯(lián)告訴你,搜索引擎原理詳解
文章分享:http://chinadenli.net/news49/24999.html

成都網(wǎng)站建設公司_創(chuàng)新互聯(lián),為您提供營銷型網(wǎng)站建設、服務器托管網(wǎng)站導航、外貿(mào)建站、網(wǎng)站內(nèi)鏈、品牌網(wǎng)站建設

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉載內(nèi)容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉載,或轉載時需注明來源: 創(chuàng)新互聯(lián)

綿陽服務器托管
九九热九九热九九热九九热| 精品欧美国产一二三区| 国产精品免费自拍视频| 亚洲欧美日韩在线中文字幕| 国产肥妇一区二区熟女精品| 九九热在线视频观看最新| 中文字幕乱子论一区二区三区| 国产一区欧美一区二区| 国产午夜福利在线观看精品| 日韩精品免费一区二区三区| 四十女人口红哪个色好看| 精品人妻av区波多野结依| 日韩精品一区二区亚洲| 国产白丝粉嫩av在线免费观看| 欧美一级内射一色桃子| 特黄大片性高水多欧美一级| 亚洲中文字幕免费人妻| 一本色道久久综合狠狠躁| 午夜亚洲少妇福利诱惑| 91在线国内在线中文字幕| 久久国产精品熟女一区二区三区| 亚洲中文字幕熟女丝袜久久| 日韩欧美91在线视频| 在线免费视频你懂的观看| 日韩精品一区二区三区av在线| 久热久热精品视频在线观看| 大香蕉大香蕉手机在线视频| 在线观看视频日韩精品| 韩国日本欧美国产三级| 亚洲一区二区三区国产| 日韩欧美综合中文字幕 | 日本一二三区不卡免费| 国内精品偷拍视频久久| 欧美亚洲91在线视频| 国产av精品一区二区| 特黄大片性高水多欧美一级| 五月婷婷六月丁香在线观看| 香蕉久久夜色精品国产尤物 | 清纯少妇被捅到高潮免费观看| 亚洲另类欧美综合日韩精品| 国产又粗又猛又黄又爽视频免费|