LMArena

Arena (原名Chatbot Arena、LMArena)是一個公開的線上聊天機械人平台及排名,其透過匿名、群眾參與的成對比較來評估大型語言模型。

使用時,使用者輸入提示,由兩個匿名模型生成回覆,再投票選出表現較好的模型,模型名稱會在投票後才顯示。使用者也能自行挑選模型進行測試。

Arena在人工智慧領域中具有影響力,許多大型公司會在平台上提供自家語言模型,例如GPT、Gemini 、Claude 、Mistral、Grok、深度求索、Kimi,利用平台上的排名推廣產品,以及使用用戶在網站上的對話訓練模型。該網站也會被用於測試尚未正式公開的模型版本。

例如,中國公司DeepSeek在R1模型受到西方媒體關注前的數月,便已在Arena上測試其原型模型。其他在平台進行預先測試的案例包括:OpenAI以「summit」為代號測試GPT-5的變體,以及Google DeepMind以「nano-banana」為代號測試Gemini-2.5-Flash-Image。

不過,Arena的評估方法也成為學術界分析的對象,研究指出其存在局限,並提出改進建議。平台隨後依據相關研究持續更新政策與方法論。

參考資料
外部链接

评论 (0)

  • 还没有评论,来抢沙发吧。