Gemini()是由谷歌DeepMind開發的多模态大型语言模型系列,是LaMDA和PaLM 2系列的继承者。Gemini 1.0于2023年12月6日面世,被定位为与OpenAI的GPT-4抗衡的产品系列。Gemini家族目前包含Gemini Deep Think、Gemini Pro、Gemini Flash和Gemimi Flash-Lite。
历史
開發
Google在2023年5月10日的Google I/O上發布由其子公司Google DeepMind开发的Gemini。它被定位为PaLM 2更强大的继任者。Google CEO桑达尔·皮查伊表示,Gemini当时仍处于早期开发阶段。与其他大型语言模型不同,Gemini的独特之处在于它并非仅在文本语料库上进行训练,而是从一开始就被设计为多模态模型,这意味着它可以同时处理多种类型的数据,包括文本、图像、音频、视频和代码。该模型由DeepMind和Google Brain合作开发,後者在當時已經和前者合併。在接受《连线》杂志采访时,DeepMind的CEO杰米斯·哈萨比斯宣传了Gemini的先进能力,他相信该算法将胜过OpenAI的ChatGPT(當時基于GPT-4运行)。哈萨比斯强调了DeepMind的AlphaGo项目的优势——该项目在2016年击败围棋世界冠军李世乭而举世闻名,并表示Gemini将结合AlphaGo及其他Google DeepMind大型语言模型的能力。
推出
2023年12月6日,谷歌在一次虚拟记者招待会上宣布推出了“Gemini 1.0”。
模型關閉時間資料來源:
https://ai.google.dev/gemini-api/docs/deprecations?hl=zh-tw
技术规格
Gemini是多模态模型,每个上下文窗口都可以包含多种形式的输入,用户在對話中可以混合文本、图片、视频和音频来开启对话,Gemini也能在回复生成這些的內容。输入图像可以是不同的分辨率,而视频则作为图像序列输入。音频以16kHz的频率进行采样,然后由通用语音模型(Universal Speech Model)转换为tokens序列。根據Deepmind的技術文檔,Gemini是多模态和多语言的数据集上訓練的,數據組由“网页文档、书籍和代码组成,并包含图像、音频和视频数据”。
Gemini是仅解码器的Transformer,并经过修改以允许在TPU上进行高效的训练和推理。Gemini 1.0使用了多查询注意力(multi-query attention)。
| rowspan=2| 在生产API中为100万
|-
| Flash
|
|}
Google未发布Gemini 2.0和Gemini 2.5的技术白皮书。
外界反响
Gemini的发布经历了长达数月的市场猜测和高度期待,被《麻省理工科技评论》形容为“AI炒作的顶峰”。 2023年8月,研究公司SemiAnalysis的分析师迪伦·帕特尔(Dylan Patel)和丹尼尔·尼什尔(Daniel Nishball)发表博文,宣称Gemini的发布将“吞噬世界”并超越GPT-4,此举引发了OpenAI CEO萨姆·阿尔特曼在X(原Twitter)上的嘲讽。 商业巨头、OpenAI的联合创始人埃隆·马斯克也参与讨论,并问道:“是数字错了吗?”《商业内幕》的休·兰利(Hugh Langley)评论说,Gemini对谷歌而言是一个成败的关键时刻,他写道:“如果Gemini表现出色,将有助于谷歌改变其被微软和OpenAI抢占先机的叙事。如果它令人失望,那么批评者会更大胆地宣称谷歌已经落后了。”
在2023年12月Gemini发布后,华盛顿大学名誉教授奥伦·埃齐奥尼预言,谷歌与OpenAI之间将展开一场“针锋相对的军备竞赛”。 加州大學柏克萊分校的教授阿列克謝·埃弗羅斯赞扬了Gemini多模态方法的潜力,而圣菲研究所的科学家米兰妮·米歇尔则称其“非常复杂”。并非所有人都印象深刻,华盛顿大学的奇拉格·沙阿(Chirag Shah)教授将这次发布比作苹果公司推出新款iPhone一样的例行公事。同样,斯坦福大学的珀西·梁(Percy Liang)、华盛顿大学的艾米丽·本德尔以及高威大学的迈克尔·马登(Michael Madden)都警告说,在不了解训练数据的情况下,很难解读基准测试的分数。
《快公司》的马克·苏利文(Mark Sullivan)认为,谷歌有机会挑战iPhone的主导市场份额,因为他相信苹果公司不太可能利用其Siri虚拟助手开发出与Gemini相媲美的功能。 在Gemini发布后的第二天,谷歌股价上涨了5.3%。
在Gemini发布时,谷歌发布了一段令人印象深刻的演示视频,名为“与Gemini的上手体验”,视频展示了模型流畅、实时响应语音和视觉提示的能力。然而,该视频很快引发了争议,因为谷歌承认这并非真实的实时互动录像。批评者指出,视频通过剪辑和后期处理,誤導用户認為Gemini拥有极低延迟和强大语音对话能力。根据报道,谷歌澄清该影片使用了视频录像中的静态图片帧,并结合文本提示词来生成Gemini的回应,而非模型实时理解人类语音和连续的视觉画面。事后,谷歌在视频的YouTube描述中补充:“为本次演示之目的,我们缩短了延迟并精简了Gemini的输出内容。”
Gemini 2.5 Pro預覽版在发布后登上LMArena的基准测试排行榜榜首。 该模型在评估推理、知识、科学、数学、编码和长上下文性能的中,均取得了顶尖或极具竞争力的结果。 初步评测强调了其相對旧版本在推理能力和性能上有所提升。 同时,也显示,在某些领域来自Anthropic、xAI或OpenAI的同期模型仍保持优势。
参见
*聊天機器人
*對話程式语言模型
*語言模型
*大型语言模型
*GPT-4
參考資料
外部链接
*[https://deepmind.google/technologies/gemini/#introduction Gemini官网]
*[https://ai.google.dev/ Google Gemini Pro API (Gemini Pro 可免费使用)]
*[https://makersuite.google.com Google免费的在线开发工具 Google AI Studio,快速构建 Gemini 应用]
深度學習
评论 (0)