标签:#大型语言模型

共 54 篇文章

大型语言模型列表

大型语言模型(LLM)是一种机器学习模型,专为语言生成等自然语言处理任务而设计。LLM 是具有许多参数的语言模型,并通过对大量文本进行自监督学习进行训练。 本页列出了值得注意的大型语言模型。 对于训练成本一列,1 petaFLOP-day = 1 petaFLOP/sec × 1 天 = 8.64 FLOP。此外,仅列出最大模型的成本。 参见 * 聊天机器人列表 注释 参考资料

Gemini (语言模型)

Gemini()是由谷歌DeepMind開發的多模态大型语言模型系列,是LaMDA和PaLM 2系列的继承者。Gemini 1.0于2023年12月6日面世,被定位为与OpenAI的GPT-4抗衡的产品系列。Gemini家族目前包含Gemini Deep Think、Gemini Pro、Gemini Flash和Gemimi Flash-Lite。 历史 開發 Google在2023年5月10日的Google I/O上發布由其子公司G…

GPT (语言模型)

,是一种大型语言模型(LLM)。首个GPT由OpenAI于2018年推出。截至2023年,大多数LLM都具备这些特征,并广泛被称为GPT。 OpenAI发布了具有极大影响力的GPT基础模型,它们按顺序编号,构成了“GPT-n”系列。由于其规模(可训练参数数量)和训练程度的提升,每个模型相较于前一个都显著增强。其中最新的模型是GPT-5.6,于2026年7月9日发布。这些模型为更具任务特定性的GPT系统奠定了基础,包括经过微调以适应特定指…

YandexGPT

YandexGPT是由俄羅斯公司Yandex開發的GPT系列模型。它能撰寫和修改文字、發想新點子,並理解與使用者的對話內容。 YandexGPT透過書籍、雜誌、報紙和網路的公開資料進行訓練。雖然這個模型有時會出錯或亂編內容,但隨著不斷學習,它產出的答案也會越來越準確。 用法 YandexGPT已被整合進旗下虛擬助理(類似Siri和Alexa),並可在與應用程式中使用。 歷史 2023年2月,Yandex宣布正在開發自家版本的ChatGP…

Agent harness

agent harness是大型语言模型(LLM)的軟體基礎架構,使大型语言模型可以發揮人工智能代理的功能。agent harness會處理工具使用、記憶、狀態持久性、執行環境及回饋回路,而大型语言模型會進行理解的工作。有一個2026年開始流行的縮寫,將這幾個技術簡化為Agent = Model + Harness。 因為LLM本身无状态,在沒有其他工具的協助下,只能產生文字,harness就是讓模型可以依照步驟採取行動、使用外部工具,…

机器学习

机器学习(,简称ML)是人工智能的一个分支。机器学习理论主要是设计和分析一些让计算机可以自动“学习”的算法。机器学习算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。因为学习算法中涉及了大量的统计学理论,机器学习与推断统计学联系尤为密切,也被称为统计学习理论。算法设计方面,机器学习理论关注可以实现的,行之有效的学习算法(要防止錯誤累積)。很多推论问题属于非程序化決策,所以部分的机器学习研究是开发容易处理的近似算法。…

大型语言模型

大型-{}-语言模型(),也称大-{}-语言模型,简称大模型,是一種基於人工神经网络的语言模型。其名稱中的「大型」指模型具有龐大的參數量(通常在數十億至數萬億級別,如GPT-3含1750亿参数)以及巨大的訓練數據規模。大語言模型通常采用自监督机器学习方法,從而能夠基于海量無標註的文本進行训练。大语言模型专为自然语言处理任务而设计,尤其适用于语言生成。 此外,基於其跨任务泛化能力,也可以针对特定任务對LLM进行微调,或通过提示工程进行引导…

GPT-4o

生成型预训练变换模型4多模态(,简称GPT-4o)是由OpenAI开发的多模态大型语言模型,于2024年5月13日发布。其名称中的「o」代表「omni」,意指该模型可处理文字、语音和视觉等多种形式的信息,并作为ChatGPT及OpenAI开发者产品中的基础模型之一使用。 GPT-4o发布时被定位为OpenAI继GPT-4 Turbo后的新一代旗舰模型。与GPT-4 Turbo相比,GPT-4o在运行速度、使用成本以及文字、语音和视觉处理…

推理語言模型

推理語言模型(),或稱推理大模型或大型推理模型,是一個進階的大型語言模型,它能經過進一步訓練,可以解決多步驟推理任務。推理語言模型在邏輯、數學或程式任務上的表現,一般都比傳統的自我迴歸的大型語言模型更好,具有回溯能力,並使用時間測試計算作為訓練範例、參數計數。 歷史 Open AI 在2024年9月推出o1-preview,為首個擁有高階推理能力的大型語言模型. 2024年12月, Open AI 推出 o1 正式版,並宣佈推出o3 推…

DeepSeek-V4

DeepSeek-V4是深度求索(DeepSeek)于2026年4月24日以預覽版形式發布的人工智能大型语言模型,分為V4-Pro與V4-Flash兩個版本,是深度求索的第四代旗艦模型。 架構 DeepSeek-V4系列包含兩個採用混合专家模型(MoE)架構的大型語言模型。 DeepSeek-V4-Pro:總參數量為1.6兆,每個token激活490億個參數,預訓練用了33兆個token。 DeepSeek-V4-Flash:總參數量為…

GPT-5

生成式預訓練變換模型5(GPT-5)是由OpenAI開發並託管的大型語言模型。作為該公司的旗艦代理式模型,GPT-5於2025年8月7日正式發佈,用戶可透過ChatGPT免費或付費使用,亦能透過API調用。 微軟宣布將把GPT-5整合至微软软件产品中,包括Copilot。 據《9to5Mac》報導,蘋果也計劃將該模型整合至Apple Intelligence系統。 研發背景 2023年4月14日,OpenAI首席执行官萨姆·奥尔特曼在麻…

OpenAI o3

OpenAI o3是由OpenAI发布的生成式预训练(GPT) 模型。作为截至2025年2月OpenAI最新发布的模型,OpenAI o3是OpenAI o1的升级版本,它在需要推理的问题上保留了更多的计算和思考时间,提高了回答的准确性和深度。 命名 OpenAI之所以采用“o3”这一名称,是为了避免与欧洲电信运营商品牌O2的商标发生冲突。 版本 此代模型正式提供服务的包括两个版本:o3-mini和o3-mini-high2025年1月…

Ollama

Ollama是一款可以在本地電腦上執行語言模型(LLM)的軟體,無需伺服器。該軟體以Go語言實作,並以MIT授權條款開放原始碼形式發佈。這個軟體支援Llama 2、Mistral與Gemma等語言模型,並可在Linux、macOS和Windows平台上使用。 安全性 Ollama 0.1.34之前版本存在远程代码执行漏洞(),可远程实现任意文件读写和代码执行,该漏洞已在2024年5月8日修复。 參考資料 外部連結 [https://ol…

LLaMA

LLaMA()是Meta於2023年2月發布的大型语言模型。它訓練了各種模型,這些模型的參數從70億到650億不等。LLaMA的開發人員報告說,LLaMA運行的130億參數模型在大多數NLP基準測試中的性能超過了更大的、具有1750億參數的GPT-3提供的模型,且LLaMA的模型可以與PaLM和Chinchilla等最先進的模型競爭 Code Llama 2023年8月,Meta继发布用于生成文本、翻译语言和创建音频的人工智能模型之后,…

通义千问

通义千问(海外版稱為Qwen)是由阿里巴巴集团旗下负责云端运算服务的科技公司阿里云所開發的大語言模型及聊天機器人,涵盖文本、视觉、音频、代码等多模态能力。 历史 2023年4月7日,阿里巴巴集团旗下的云端运算服务公司阿里云正式宣布通义千问对已受邀的企业用户开启内测,标志着阿里巴巴正式踏入大语言模型领域,其後逐步開放,现已对公众免费使用。 2023年4月11日,阿里巴巴董事局主席张勇在阿里云峰会上正式对外发布大语言模型工具「通义千问」,并…

GPT-J

GPT-J,又称GPT-J-6B,是由开放人工智能研究团体EleutherAI开发的大型语言模型。该模型于2021年公开发布,是一个基于Transformer架构的自回归文本生成模型,主要用于根据输入提示预测后续文本。名称中的“6B”表示模型约有60亿个可训练参数。GPT-J使用Ben Wang开发的Mesh Transformer JAX训练,权重以Apache License 2.0发布,是早期具有公开权重的GPT-3类大型语言模型…

LMArena

Arena (原名Chatbot Arena、LMArena)是一個公開的線上聊天機械人平台及排名,其透過匿名、群眾參與的成對比較來評估大型語言模型。 使用時,使用者輸入提示,由兩個匿名模型生成回覆,再投票選出表現較好的模型,模型名稱會在投票後才顯示。使用者也能自行挑選模型進行測試。 Arena在人工智慧領域中具有影響力,許多大型公司會在平台上提供自家語言模型,例如GPT、Gemini 、Claude 、Mistral、Grok、深度求…

LLM-as-a-Judge

LLM-as-a-Judge(意为“大型语言模型作为评估器”,亦称基于大型语言模型的评估)是自然语言处理中的一种技术,即用大型语言模型(LLM)依据预先设定的标准,评估一段文本输出(通常由另一个模型生成)的质量、相关性或正确性。它被用作人工标注以及 BLEU、ROUGE 等基于参考、只衡量词面重叠而非语义的指标的一种可扩展、低成本替代方案。 该方法不再仅依赖人类标注者,而是利用大型语言模型的通用语言能力来充当自动评估器。 评估器通常返回…

ChatGPT

ChatGPT,中文全称聊天生成预训练转换器(),是OpenAI开发的人工智能聊天机器人程序,于2022年11月30日推出。该程序使用基于GPT-3.5、GPT-4、GPT-4o、GPT-4.5、GPT-5架构的並以强化学习训练。 簡介 ChatGPT以文字方式互動,其不僅可藉由人類自然對話方式來互動,甚至可用於複雜之語言作業,包括自动產生文本、自动问答、自动摘要等多种任务。如:在自动文本產生方面,ChatGPT可以根据输入的文本自动產…