Tf-idf
tf-idf()是一種用於資訊檢索與文本挖掘的常用加權技術。tf-idf是一種統計方法,用以評估一字詞對於一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。tf-idf加權的各種形式常被搜索引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了tf-idf以外,互聯網上的搜尋引擎還會使用基於連結分析的評級方法,以確定文件在搜尋結果中出現的順…
共 5 篇文章
tf-idf()是一種用於資訊檢索與文本挖掘的常用加權技術。tf-idf是一種統計方法,用以評估一字詞對於一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。tf-idf加權的各種形式常被搜索引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了tf-idf以外,互聯網上的搜尋引擎還會使用基於連結分析的評級方法,以確定文件在搜尋結果中出現的順…
小型語言模型()是用人工智慧進行自然语言处理的語言模型,其參數規模和處理能力比大型语言模型(LLM)要小。 大型语言模型會有上千億個訓練參數,有些模型的訓練參數甚至會超過一万億個。模型裡有許多的參數,可以處理大量的資訊,模型的通用能力很強,也可以提昇輸出的準確性。不過訓練此一模型需要進行大量的運算,無法在單一電腦和圖形處理器(GPU)上實現此功能。 小型语言模型使用的參數遠少於大型语言模型,約從數千個到上億個不等。因此小型语言比較可以在…
统计机器翻译(,简写)是机器翻译的一种,也是目前非限定领域机器翻译中性能较佳的一种方法。统计机器翻译的基本思想是通过对大量的平行语料进行统计分析,构建统计翻译模型,进而使用此模型进行翻译。从早期基于词的机器翻译已经过渡到基于短语的翻译,并正在融合句法信息,以进一步提高翻译的精确性。 2016年前Google翻译的大部分语言对采用的都是统计机器翻译的方法。而Google亦在此本领域保持领先地位,在美国国家标准局组织的机器翻译评测中遥遥领先…
概率的潜在语义分析(PLSA),也称为概率潜在语义索引(PLSI,尤其是在信息检索领域),是用于分析双模和共现数据的统计方法。 实际上,人们可以根据对某些隐变量的亲和性来推导出观测变量的低维表示,就像PLSA是从潜在语义分析中演化而来。 与源于线性代数并缩小发生表(通常通过奇异值分解)的标准潜在语义分析所不同的是,概率潜在语义分析基于从潜类模型导出的混合分解。 模型 ,主题 c是一个潜变量。]] 考虑到以单词和文档的共现 (w,d)形式…
随機上下文无关文法()即在上下文无关文法中,为每一个产生式规则赋予一个概率,标示应用一个产生式规则的可能性。 参见 上下文有关文法 形式文法 * 分析表达式文法