<ul id="g60s4"><pre id="g60s4"></pre></ul>
<strong id="g60s4"><nav id="g60s4"></nav></strong>
<ul id="g60s4"></ul>
  • <tr id="g60s4"></tr>
  • 
    
  • 或者

    搜索引擎索引系統概述

    作者:聚擎 瀏覽:176 發布時間:2017-04-09
    分享 評論 0

      眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統,以億為單位的網頁庫中查找特定的某些關鍵詞猶如大海里面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

      如果能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:


      (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區域等等;

      (2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;

      (3)之前的準備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?


    久久国产精品成人无码网站| 777亚洲精品乱码久久久久久| 日韩视频免费一区二区三区| 国产成人久久精品77777综合| 国产精品成人不卡在线观看| 奇米精品视频一区二区三区| 久久99久久99小草精品免视看| 国产成人精品免费视频大全| 亚洲欧美日韩一区二区三区| 国产乱色精品成人免费视频| 婷婷99视频精品全部在线观看 | 久久精品九九亚洲精品天堂| 久久夜色精品国产亚洲av| 一区二区三区免费精品视频| 中文字幕日韩精品麻豆系列| 国产剧情AV麻豆香蕉精品| 杨幂精品国产福利在线| 国产精品民宅偷窥盗摄| 精品午夜福利无人区乱码一区| 精品国产V无码大片在线看| 91精品国产91久久久久青草| 久久久久成人精品无码中文字幕| 四虎国产精品永久在线| 久久夜色精品国产噜噜| 久久精品国产99国产电影网 | 国产精品香蕉在线一区| 91国内揄拍国内精品对白不卡| 精品熟女少妇av免费久久| 久久66热人妻偷产精品9| 久久婷婷国产综合精品| 日韩精品无码久久久久久| 杨幂国产精品福利在线观看| 婷婷五月深深久久精品| 99在线视频精品| 91久久亚洲国产成人精品性色| 久久精品aⅴ无码中文字字幕重口| 99ee6热久久免费精品6| 久久久久女人精品毛片| 亚洲AV无码国产精品色| 精品久久久无码21p发布 | 亚洲&#228;v永久无码精品天堂久久 |