停用词
在信息檢索中,为节省存储空间和提高搜索效率,在自然语言处理数据(或文本)之前或之后会自动过滤掉某些字或词,这些字或词即被称为Stop Words(停用词)。 对于一个给定的目的,任何一类的词语都可以被选作停用词。通常意义上,停用词大致分为两类。一类是人类语言中包含的功能词,这些功能词极其普遍,与其他词相比,功能词没有什么实际含义,比如「the、「is」、「at」、「which」、「on」等。但是对于搜索引擎来说,当所要搜索的短语包含功能…
共 4 篇文章
在信息檢索中,为节省存储空间和提高搜索效率,在自然语言处理数据(或文本)之前或之后会自动过滤掉某些字或词,这些字或词即被称为Stop Words(停用词)。 对于一个给定的目的,任何一类的词语都可以被选作停用词。通常意义上,停用词大致分为两类。一类是人类语言中包含的功能词,这些功能词极其普遍,与其他词相比,功能词没有什么实际含义,比如「the、「is」、「at」、「which」、「on」等。但是对于搜索引擎来说,当所要搜索的短语包含功能…
網路計量學為資訊計量學的一分支,是1997年興起的一種新的研究領域,主要是應用資訊計量學與科學計量學的方法去研究網路空間的種種現象。 主要探討的內容 #網路連結 #網路內容 #網路探勘(web mining) #網路影響因素(web impact factor) 網路計量學之問題 #網路上資料數據的收集完全取決於各種搜索引擎的檢索特性。遺憾的是多數搜尋引擎的檢索功能太過簡單,造成數據收集的困難,以至於無法進行進一步的網路計量學的分析。 …
tf-idf()是一種用於資訊檢索與文本挖掘的常用加權技術。tf-idf是一種統計方法,用以評估一字詞對於一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。tf-idf加權的各種形式常被搜索引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了tf-idf以外,互聯網上的搜尋引擎還會使用基於連結分析的評級方法,以確定文件在搜尋結果中出現的順…
个性化检索(),是和信息检索相区别的网络搜索方式。它考虑了用户的区别,利用用户的信息对提问式或者检索结果进行修改或者过滤,以减轻用户的检索复杂度。个性化检索主要有两个方式:对用户的检索本身进行修改,以及对于搜索结果的重新排列。 历史 谷歌在2004年提出了个性化检索的概念,并在2005年为自家的搜索引擎加入了个性化检索,为其全部用户(而非仅仅是注册用户)提供个性化检索服务。目前人们尚未知晓谷歌是如何个性化其搜索结果的,但人们相信,其搜索…