标签:#信息检索

共 20 篇文章

圖像檢索

圖像檢索,又称-{zh-hans:图像检索; zh-hant:圖片搜索;}- ,系統是一個電腦瀏覽的系統,從一個大型的數位圖像資料庫去檢索和檢索圖像。大多傳統和一般圖像檢索的方式是利用一些增加元數據(metadata)的方法,例如:字幕、關鍵詞或是圖像的說明,如此一來就可以透過註解詞完成檢索。人工的圖像註解是費時、費力並且昂貴;為了解決這個問題,已經有大量的研究在做自動圖像註解方面上。此外,越來越多的社會網路應用和語義網已經產生了數個以…

反向图像搜索

反向圖像搜索(以图搜图)是一種基於圖像檢索(CBIR)的查詢技術,它涉及為 CBIR 系統提供樣本圖像,然後系統將基於該樣本圖像進行搜索;在信息檢索方面,樣本圖像在其方式上非常有用。特別是,反向圖像搜索的特點是缺少搜索詞。這有效地消除了用戶猜測可能會或可能不會返回正確結果的關鍵字或術語的需要。反向圖像搜索還允許用戶發現與特定樣本圖像相關的內容,圖像的流行度,並發現操縱版本和衍生作品。 在熱門搜索系統中的應用 Google圖片搜尋 Goo…

引文索引

收藏的印刷版科学引文索引]] 引文索引是一种书目索引,用于记录出版物之间的引用关系,从而方便用户检索并明确后续文献对前序文献的引用情况。引文索引的某种形式最早发现于12世纪的希伯来宗教文献之中。法律引文索引则出现于18世纪,此后通过诸如《谢泼德引文》(Shepard's Citations)等引文检索工具的推广而得以普及。1961年,尤金·加菲尔德的科学信息研究所(ISI)推出了首个针对学术期刊所刊载论文的引文索引,即最初的科学引文索引…

跨語檢索

跨語檢索,或稱「跨語資訊檢索」(Cross-Language Information Retrieval,CLIR),其定義採用 Oard, D. W.在1997年發表的文章《Cross-Language Information Retrieval Defined》。跨語檢索意指使用者使用某種自然語言的檢索詞彙檢索由另一種語言表達的文件。 舉例來說,使用者使用(自己熟悉的)中文產生一組檢索詞彙進行檢索,而其檢索結果皆以(使用者完全不懂或…

問答系統

問答系統(Question Answering System,QA System),是應用自然語言處理與資訊檢索技術回答自然語言提問的電腦系統。問答系統外部的行為上來看,其與目前主流資訊檢索技術有兩點不同:首先是查詢方式為完整而口語化的問句,再來則是其回傳的為高精準度網頁結果或明確的答案字串。以Ask Jeeves為例,使用者不需要思考該使用甚麼樣的問法才能夠得到理想的答案,只需要用口語化的方式直接提問如「請問誰是美國總統?」即可。而系…

搜尋建議下拉式選單

搜尋建議下拉式選單是使用電腦在搜尋時的一種功能,當使用者將欲搜尋的字詞輸入到搜尋框內後,在搜尋完成之前,會在搜尋框下方顯示下拉式選單,提出可供使用者點選的建議搜尋字詞,讓使用者可以快速完成搜尋。這種功能是自動完成的一種形式,此列表與搜尋歷史記錄不同,即使使用者第一次搜尋,也會出現此建議選單。這些建議可能根據熱門搜尋、贊助商、使用者的地理位置或其他原因而有不同 。在作業系統、網頁瀏覽器、搜尋引擎和各類網站中,這種功能很常見,在2014年的…

锚文本

锚文本()是网页中关于超連結的一段描述,通常以文本和图片的方式出现。可以指向文中的某个位置,也可以指向其他网页。 创建锚文本 例如,html脚本 中文维基百科 中的“中文维基百科”就是一个锚文本,它用来描述使其指向链接页面。 锚文本作用 能够将个人的网页链接到其他人的网页上无疑是全球資訊網最具吸引力和最具创造力的特征,这也是其成功的重要组成部分,这些链接是十分方便的,它把相关的信息提供给任何观看网页的人。 锚文本种类 锚文本主要有两种方…

数字书目索引与图书馆项目

-{zh-cn:数字书目索引与图书馆项目;zh-tw:數位書目索引及圖書館計畫}-(,简称*')提供计算机领域科学文献的搜索服务,它只储存这些文献的相关元数据,如标题,作者,发表日期等。最早的DBLP只包含数据库系统和逻辑编程相关方面的文章,所以DBLP之前也可以是DataBase systems and Logic Programming的缩写。随着更多的其他计算机领域的内容的加入,发展成今天的DBLP。DBLP项目由德国特里尔大学的…

搜索结果页

搜索结果页(,SERP)是指搜索引擎对某个搜索请求反馈的结果页面。根据搜索类型的不同,可以有图片、视频、新闻资讯、博客等不同的结果页。现在随着搜索引擎技术的进一步发展,搜索结果页包含的信息也越来越丰富,某些搜索引擎的搜索结果页可能会同时包含几种不同类型的搜索结果,各大搜索引擎都在致力于提供更丰富和方便的搜索结果页。搜索结果列表中的页面通常已按搜索引擎的算法(比如Google的PageRank)排序,越靠前的页面相关性最越高。因为搜索引擎…

信息檢索

資訊檢索()是从信息资源集合获得与信息需求相关的信息资源的活动。搜索可以基于全文或其他基于内容的索引。 自动信息检索系统用于减少所谓的“資訊超載”。许多大學和公共图书馆使用IR系统提供图书、期刊和其他文件的访问。Web搜索引擎是最常见的IR应用程序。 概述 当用户向系统输入查询时,信息检索过程开始。查询是信息需求的正式声明,例如在Web搜索引擎中的搜索字符串。在信息检索中,查询不会唯一地标识集合中的单个对象。相反可以有不止一个对象匹配查…

余弦相似性

余弦相似性通过测量两个向量的夹角的余弦值来度量它们之间的相似性。0度角的余弦值是1,而其他任何角度的余弦值都不大于1;并且其最小值是-1。从而两个向量之间的角度的余弦值确定两个向量是否大致指向相同的方向。两个向量有相同的指向时,余弦相似度的值为1;两个向量夹角为90°时,余弦相似度的值为0;两个向量指向完全相反的方向时,余弦相似度的值为-1。這結果是與向量的長度無關的,仅仅與向量的指向方向相關。余弦相似度通常用于正空間,因此給出的值为0…

Dice系数

戴斯系数(Dice coefficient),也称索倫森-戴斯系数(Sørensen–Dice coefficient),取名於和,是一种集合相似度度量函数,通常用于计算两个样本的相似度: :s = \frac{2 | X \cap Y |} 它在形式上和Jaccard指数没多大区别,但是有些不同的性质。 和Jaccard类似,它的范围为0到1。 与Jaccard不同的是,相应的差异函数 :d = 1 - \frac{2 | X \ca…

语音文档检索

语音文档检索是针对以声音形式存在的文档的信息检索。其基本定义为:是给定一个检索以及一定数量的语音文档,返回与检索需求关系最为接近的文档集合。从狭义上说,检索需求指的是一些检索词或短语,而相关性指的是语音内容与检索需求的关系。从广义上说,检索需求还包括说话人,说话风格等高层次的信息。 最基本的语音文档检索系统有以下三个主要任务: 对语音文档进行切析与识别,提取出语音中内容信息。 对于识别结果建立索引。 *根据用户的检索需求,返回语音文档。…

向量空間模型

向量空间模型是一个把文本文件表示為标识符(比如索引)向量的代数模型。它应用于信息过滤、信息检索、索引以及相關排序。 定义 文档和查詢都用向量来表示。 :d_j = ( w_{1,j} ,w_{2,j} , ... ,w_{t,j} ) :q = ( w_{1,q} ,w_{2,q} , ... ,w_{t,q} ) 每一维都對應於一个個別的词组。如果某个词组出现在了文档中,那它在向量中的值就非零。已经發展出了不少的方法来计算这些值,这些…

相关反馈

相关反馈,起源于信息检索系统领域,其思路是将给定查询最先返回的结果,和这些结果是否与新查询是否相关的信息利用起来。区别三种类型的反馈将很有意义:显式反馈、隐式反馈和盲式或伪反馈。 显式反馈 显式反馈是从相关性评估者那里获取的,这里的相关性表示检索文档与查询的相关程度。只有当评估者(或系统的其他用户)清楚所提供的反馈是被解释为相关性判断依据时,这种类型的反馈才能称为是显式的。 用户可能将相关性用二元或分级的相关机制来显式表示。二元相关反馈…

平均倒数排名

平均倒数排名是统计学中,依据排序的正确性,对查询请求响应结果的评估。查询响应结果的倒数排名是第一个正确答案的倒数积。平均倒数排名是多个查询结果的平均值。: : \text{MRR} = \frac{1} \sum_{i=1}^ \frac{1}{\text{rank}_i}. \! 平均倒数排名和调和平均数有些相似。 例子 比如,想象一下我们有如下三个查询请求,让系统将他们翻译为英语的複数形式。对于每个例子,系统给出三个猜测,结果中第一…

文本信息检索

文本信息检索是针对文本的信息檢索技术。在技术社区中,文本信息检索常常被等同于信息检索技术本身。 相对视频、音频检索而言,文本信息检索是发展较快也较成熟的,其他模态的信息检索技术,往往也要仰赖文本信息检索的支持。 虽然网络搜索引擎目前已不仅仅局限于对文本进行检索,文本信息检索仍然是大部分网络搜索引擎的基础。 历史介绍 自人类的文字产生起,如何快速地从大量的,记录在各种各样的存储媒体中尋找或獲取信息就成为一个引人注目的问题。这个问题关系到人…

关联反馈

相关反馈是一些信息检索系统的特征。 相关反馈背后的观点是,利用起初返回的给定查询的结果,利用那些结果是否相关的结果信息去执行一个新的查询。我们能够有效的区分三种形式的反馈:显式反馈,隐式反馈,盲反馈或“假”反馈。 显式反馈 显式反馈来自一个文档查询的相关性显示的评估者。该种形式的反馈被定义为显式反馈,只有评估者(或其他系统的用户)知道反馈倘若被解释为关联 判断。 用户用“二进制”,或者“按等级的”相关系统来表明相关性显示。二进制相关显示…

词干提取

在词法学和信息检索里,词干提取是去除词缀得到词根的过程─—得到单词最一般的写法。对于一个词的形态词根,词干并不需要完全相同;相关的词映射到同一个词干一般能得到满意的结果,即使该词干不是词的有效根。从1968年开始在计算机科学领域出现了词干提取的相应算法。很多搜索引擎在处理词汇时,对同义词采用相同的词干作为查询拓展,该过程叫做归并。 词干提取项目一般涉及到词干提取算法或词干提取器。 例子 一个面向英语的词干提取器,例如,要识别字符串“ca…

SimRank

SimRank 是一种基于图的拓扑结构信息来衡量任意两个对象间相似程度的模型,该模型由 MIT 实验室的 Glen Jeh 和 Jennifer Widom教授在2002年首先提出。SimRank相似度的核心思想为:如果两个对象和被其相似的对象所引用(即它们有相似的入邻边结构),那么这两个对象也相似。近年来已在信息检索领域引起广泛关注,成功应用于网页排名、协同过滤、孤立点检测、网络图聚类、近似查询处理等。 介绍 结构相似度(Struct…