{{about|美國人工智慧公司|-{zh-hant:繪文字;zh-hans:绘文字;zh-cn:表情符号;zh-hk:表情圖標;zh-tw:表情圖案;zh-sg:Emoji}-|繪文字-{zh-hans:绘文字;zh-hant:繪文字;zh-cn:Emoji;zh-tw:表情符號 (繪文字);zh-hk:表情符號;}-}}
Hugging Face, Inc.(中文譯名:抱抱臉)是一家美國人工智慧公司,總部位於紐約市,開發用於建構機器學習應用的運算工具。Hugging Face最具代表性的產品,是為自然語言處理打造的開放原始碼函式庫Transformers,以及供使用者分享機器學習模型與資料集的平台Hugging Face Hub,後者因功能近似程式碼託管平台而被媒體稱為「機器學習界的GitHub」。其名稱取自Unicode中的🤗擁抱臉表情符號()。
Hugging Face由三位法國創業家於2016年在紐約創立,最初開發一款面向青少年的聊天機器人應用程式,在將聊天機器人背後的模型開源後,轉型專注於成為機器學習平台。Hugging Face歷經多輪創投募資,2023年8月完成的2.35億美元D輪融資使其估值達45億美元,投資者包括Google、亞馬遜、輝達、英特爾、超微、高通、IBM與領投的Salesforce等企業。
Hugging Face以開放協作為核心理念。截至2025年,其Hub託管超過200萬個公開模型、逾50萬個公開資料集,並擁有約1300萬名使用者。Hugging Face發起並協調了BigScience等開源協作計畫,其中產出1760億參數的多語言模型BLOOM,並自2024年起投入開源機器人領域,於2025年收購法國人形機器人新創公司Pollen Robotics。執行長克萊蒙·德朗格()表示其使命是「將優良的機器學習民主化」。由於Hub開放使用者上傳,平台亦曾多次面臨惡意模型與內容濫用等資訊安全與爭議事件。
歷史
創立與轉型
Hugging Face由克萊蒙·德朗格、朱利安·肖蒙()與托馬斯·沃爾夫()三位法國創業家於2016年在紐約市創立。德朗格於2012年自ESCP畢業後婉拒Google的工作邀約,與正在開發協作式電子書閱讀器的肖蒙共同創業,2016年肖蒙的大學友人沃爾夫加入成為第三位共同創辦人,並將產品構想轉為聊天機器人。Hugging Face最初推出的產品是一款面向青少年、可與人工智慧「好友」對話的行動應用程式,於2017年初上線。在將聊天機器人背後的自然語言處理模型開源後,Hugging Face發現該技術本身的價值,遂轉型專注於機器學習模型與平台。2022年5月,Hugging Face宣布由勒克斯資本領投、紅杉資本與首度參與的1億美元C輪融資,估值達到20億美元。
2023年8月24日,Hugging Face完成2.35億美元的D輪融資,估值倍增至45億美元,由Salesforce創投部門領投,Google、亞馬遜、輝達、英特爾、超微、高通、IBM與Sound Ventures等參與投資。此輪融資的估值據報導超過其年化營收的100倍。2024年時,Hugging Face員工規模約250人。工作坊由數百名研究者協作,使用法國政府提供的Jean Zay超級電腦,於2021年5月至2022年5月間運作。2022年,工作坊以BLOOM的發布告終,這是一個具有1760億參數的多語言大型語言模型,涵蓋46種自然語言與13種程式語言,並以負責任人工智慧授權釋出。
2023年4月,Hugging Face推出開源聊天機器人HuggingChat,作為OpenAI旗下ChatGPT的開放原始碼替代方案。同年5月,其與ServiceNow共同主導的BigCode計畫發布程式碼生成模型StarCoder。8月,其完成D輪融資的同時,也發布了開源多模態視覺語言模型IDEFICS。
進軍機器人
2024年3月,Hugging Face推出開源機器人程式庫LeRobot,由前特斯拉研究員雷米·卡代納()領導,旨在為機器人領域建立以社群為基礎的人工智慧協作。2025年4月,Hugging Face收購由馬蒂厄·拉佩爾()與皮埃爾·魯阿內()於2016年創立的法國人形機器人新創公司Pollen Robotics。首席科學家沃爾夫表示,機器人可能是人工智慧開啟的下一個前沿,並且應當是開放、平價且注重隱私的。輝達亦與Hugging Face深化合作,將新模型與框架帶入LeRobot開源社群。台灣媒體分析指出,Hugging Face在文字與生成式人工智慧領域已居主導地位、成長空間有限,因而如同輝達一般轉向實體人工智慧發展。
產品與服務
Transformers 函式庫
Transformers是一個Python函式庫,包含用於文字、影像與音訊任務的Transformer模型開源實作,並內含BERT、GPT-2等知名模型。該函式庫最初名為「pytorch-pretrained-bert」,後更名為「pytorch-transformers」,並於2019年9月隨著對TensorFlow2.0的支援而簡化為「Transformers」,使模型能在PyTorch與TensorFlow框架間自由轉換。它作為跨框架的模型定義框架,同時支援PyTorch、JAX與TensorFlow,涵蓋文字、視覺、音訊與多模態模型的推論與訓練。Hub提供版本控制、提交歷史、分支、拉取請求與討論等功能,其運作方式被媒體形容為「機器學習界的GitHub」。2024年9月,Hub達到託管100萬個公開模型的里程碑;截至2025年10月,平台已託管超過200萬個公開模型、逾50萬個公開資料集與超過100萬個公開Spaces。為因應資料規模成長,Hugging Face於2024年8月收購儲存技術新創公司XetHub,這是其當時規模最大的一次收購,並自2025年起將Hub的儲存後端由Git LFS遷移至位元組層級去重的Xet系統。
其他函式庫與工具
除Transformers外,Hugging Face生態系還包含多個開源函式庫。Datasets用於存取與分享音訊、視覺及自然語言處理任務的資料集;Tokenizers是以Rust實作的高速分詞器函式庫;Diffusers提供最先進的預訓練擴散模型,用於生成影像、影片與音訊;Accelerate讓相同的PyTorch程式碼只需增加數行即可在各種分散式環境執行;PEFT提供參數高效微調方法,無須微調全部參數即可調適大型預訓練模型;TRL則是用於監督式微調、直接偏好最佳化與獎勵建模等後訓練方法的函式庫。Hugging Face也開發了硬體最佳化函式庫Optimum、Rust機器學習框架Candle,以及作為pickle格式安全替代品的張量儲存格式safetensors。此外,其於2025年推出以極少程式碼建構人工智慧代理的smolagents函式庫。
Gradio是一個開源Python套件,讓使用者能在數分鐘內為機器學習模型建立網頁介面與互動式展示,無須撰寫HTML、CSS或JavaScript程式碼。Hugging Face於2021年12月21日收購Gradio。2024年6月,Hugging Face又收購協作式資料標註平台Argilla。
Spaces 與推論服務
Spaces是在Hub上託管機器學習展示應用的方式,支援Gradio與Streamlit兩種PythonSDK。在模型部署方面,其提供全託管的Inference Endpoints服務,以及用於部署大型語言模型的Text Generation Inference工具組。2025年1月,Hugging Face推出Inference Providers推論路由層,將fal.ai、Replicate、SambaNova Systems與Together AI等第三方無伺服器推論供應商直接整合到Hub的模型頁面,其後陸續納入Cerebras等供應商。
Hugging Face亦維護多個公開評測榜單,其中2023年推出的Open LLM Leaderboard在兩年間評測了逾1.3萬個模型,成為開源大型語言模型的重要參考,並於2025年3月退役。開源聊天機器人HuggingChat累積超過100萬名使用者、支援逾20個開源模型,Hugging Face於2025年7月將其關閉,以推出與生態系整合更緊密的新服務。
模型與資料集
除BLOOM外,Hugging Face主導或參與開發了多個開源模型與資料集。在程式碼生成方面,Hugging Face與ServiceNow共同主持的BigCode計畫於2023年發布StarCoder,並於2024年2月發布涵蓋逾600種程式語言、以4兆多個詞元訓練的StarCoder2,兩者均基於程式碼資料集The Stack (資料集)。2023年10月,其H4團隊發布以直接偏好最佳化微調的Zephyr模型。
自2024年起,Hugging Face推出SmolLM系列小型語言模型,包含135M、360M與1.7B參數的版本,並於2024年11月與2025年7月分別發布小型視覺語言模型SmolVLM與具長脈絡推理能力的SmolLM3。在資料集方面,其於2024年發布由96份Common Crawl快照萃取、含15兆個詞元的FineWeb,以及從中篩選出的教育文本資料集FineWeb-Edu。Hugging Face早在2019年即發表知識蒸餾模型DistilBERT,其在保留BERT約97%語言理解能力的同時,體積縮小40%、速度提升60%。
合作夥伴
Hugging Face與多家雲端服務與晶片業者建立合作。2023年2月,Hugging Face與亞馬遜雲端運算服務(AWS)擴大策略合作,以AWS為首選公有雲,開發者可透過SageMaker與Trainium、Inferentia晶片訓練及部署模型。同年8月,輝達與Hugging Face宣布合作,於平台內提供DGX Cloud人工智慧超級運算與「訓練叢集即服務」。2024年1月,Google Cloud與Hugging Face建立策略合作,開發者可運用Vertex AI、GKE與Cloud TPU v5e訓練及部署模型。
其他合作對象包括微軟(於Azure機器學習提供模型目錄)、IBM(整合至watsonx.ai企業平台)、戴爾科技(本地部署生成式人工智慧)、(IPU最佳化)、英特爾、超微、高通與Cloudflare(在其全球網路部署最佳化模型)。
在公共與研究領域,Hugging Face於2024年6月與Meta、Scaleway合作,在巴黎的Station F推出面向歐洲新創的人工智慧加速器計畫,最終選出五家獲勝新創。2024年9月,其與Meta、聯合國教科文組織合作推出線上語言翻譯器,基於Meta的開源No Language Left Behind模型,可在200種語言間直接互譯。Hugging Face亦於2023年獲法國國家資訊自由委員會(CNIL)選入其強化支援計畫。
公司事務
商業模式
Hugging Face由三位共同創辦人領導。執行長克萊蒙·德朗格負責Hugging Face整體策略;技術長朱利安·肖蒙主導技術開發;首席科學家托馬斯·沃爾夫則領導研究,其學術背景橫跨統計物理與法律,曾任物理研究員與歐洲專利代理人。Hugging Face內的研究人員包括領導LeRobot機器人計畫的前特斯拉研究員雷米·卡代納。人工智慧倫理學者亦於Hugging Face擔任首席人工智慧倫理科學家,並入選2023年首屆TIME100 AI名單。
Hugging Face的營運以開放的模型協作平台為核心,主要營收來自向企業提供的付費工具與服務,包括封閉託管的企業版Hub、按時計費的推論與運算服務,以及個人與團隊訂閱方案。Hugging Face提供每月9美元的PRO個人方案,以及每人每月20美元起、含單一登入、稽核日誌與存取控制等功能的企業方案。
Hugging Face的財務規模隨人工智慧熱潮快速成長。2021年,其營收不足1000萬美元;至2023年年中,其營收年化率升至約3000萬至5000萬美元,獲利方式為在數十萬個由社群訓練的模型平台之上,加收安全與企業工具費用。針對歐盟人工智慧法案,Hugging Face與創用CC、GitHub等組織聯署,主張立法應顧及開放與開源機器學習開發的特性與優勢。Hugging Face也推廣OpenRAIL授權框架與模型卡()等機器學習透明化實踐。2023年12月,其成為由IBM與Meta發起的AI Alliance創始成員。
Hugging Face高層對人工智慧發展亦持鮮明觀點。首席科學家沃爾夫於2025年公開表示,現有人工智慧模型更可能造就「伺服器上的應聲蟲」,而非真正的科學突破,因為模型擅長回答問題卻不擅於提出前人未曾想過的問題。沃爾夫並認為開源人工智慧的效益遠大於風險,主張以光譜而非二分法看待開放程度。德朗格則於2025年11月預測大型語言模型存在泡沫,並可能在2026年破裂。在環境影響方面,其研究人員曾量測BLOOM訓練的碳足跡,估計僅計入動態電力消耗約為24.7公噸二氧化碳當量,若計入所有相關製程則約為50公噸。
教育與社群
Hugging Face提供多門免費開源線上課程,涵蓋大型語言模型、深度強化學習與人工智慧代理等主題。2022年,Hugging Face推出學生大使計畫,設定於2023年底前向500萬人教授機器學習的目標。Hugging Face也定期舉辦社群活動,例如2025年6月的Gradio人工智慧代理與MCP黑客松吸引逾4100人報名,總獎金超過1.65萬美元。截至2025年,其平台社群已成長至約1300萬名使用者,機器人資料集數量亦從2024年的1145個增至2025年的26991個。2025年2月,資安公司ReversingLabs揭露一種名為「nullifAI」的技術,攻擊者以7z壓縮並刻意破壞pickle檔案,藉此繞過平台的Picklescan掃描器,Hugging Face在通報後24小時內移除相關惡意模型,並改進掃描工具。同一時期,資安公司亦展示了繞過Picklescan黑名單機制的方法,並指黑名單並非良好的安全設計。
為因應這些風險,Hugging Face對推送至Hub的每個檔案執行安全掃描,包括ClamAV病毒掃描與pickle匯入掃描,但同時聲明此機制並非萬無一失。Hugging Face先後與資安公司Wiz、Protect AI與JFrog合作,將漏洞掃描與惡意模型掃描器整合進平台。此外,其開發並推廣的safetensors格式即為pickle風險的直接回應,該格式經Trail of Bits外部稽核確認安全。Wiz指出,此類租戶隔離風險並非Hugging Face獨有,而是人工智慧即服務業者普遍面臨的挑戰。2026年初,攻擊者濫用Hugging Face平台散布數千種變體的Android惡意軟體,並採用每15分鐘生成新變體的伺服器端多型技術以規避偵測;平台移除相關惡意資料集後,該行動一度以新名稱再度出現。2026年5月,資安公司HiddenLayer發現一個假冒OpenAI的惡意儲存庫「Open-OSS/privacy-filter」,累積約24.4萬次下載,Hugging Face證實其違反服務條款並予以移除。
版權與內容爭議
2023年,反盜版組織Rights Alliance指出,用於訓練人工智慧的Books3資料集含有未經授權的書籍,且該資料集曾在Hugging Face上被大量下載;經該組織接觸後,Hugging Face上託管的相關資料集連結被移除,該資料集頁面現標示為因侵權檢舉而永久停用。平台上也曾出現大量未經當事人同意、用於生成真實人物肖像的模型,以及針對政治人物的深偽脫衣工具,這些內容違反Hugging Face禁止未經同意的性內容的政策。
專利訴訟
2023年,韓國人工智慧新創公司FriendliAI於德拉瓦州聯邦法院控告Hugging Face,指其Text Generation Inference工具侵犯FriendliAI關於批次處理排程的專利。經逾一年訴訟,雙方於2025年1月達成保密和解,FriendliAI撤回訴訟。
資料來源
评论 (0)