小型語言模型()是用人工智慧進行自然语言处理的語言模型,其參數規模和處理能力比大型语言模型(LLM)要小。
大型语言模型會有上千億個訓練參數,有些模型的訓練參數甚至會超過一万億個。模型裡有許多的參數,可以處理大量的資訊,模型的通用能力很強,也可以提昇輸出的準確性。不過訓練此一模型需要進行大量的運算,無法在單一電腦和圖形處理器(GPU)上實現此功能。
小型语言模型使用的參數遠少於大型语言模型,約從數千個到上億個不等。因此小型语言比較可以在資源受限環境(像是電腦或是手機)下訓練和運作。
到2020年代為止,小型語言模型的架構和大型語言模型相同,但參數數量較少,有時運算精度也比較低。參數數量的問題可以用知識蒸餾和處理。精度可以通過量化來降低。大型語言模型上的工作絕大部份可以轉換到小型語言模型,也常會用剪枝和量化來提昇大型語言模型的速度。
模型
以下是一些小型語言模型的分類。
用預訓練集來強化小型語言模型性能
傳統AI語言系統需要許多電腦和大量的資料。預訓練相當重要,就算是非常小的模型,隨著預訓練資料集數量的增加,其預訓練性能提昇,實體性能也會有顯著提昇。若預訓練集和測試集的token類似,分類準確率會提昇。較淺的模型,配合協同學習,也可以有類似深層模型的性能。
相關條目
- 邊緣運算
參考資料
评论 (0)