DeepSeek-R1

DeepSeek-R1是深度求索(DeepSeek)于2025年1月20日发布的人工智能大型语言模型,专门适用于数学、编码和逻辑等任务,性能对标OpenAI o1。

訓練
DeepSeek-R1-Lite是Deepseek R1的預覽版,于2024年11月20日发布。后于2025年1月20日正式发布DeepSeek R1。

DeepSeek-R1与DeepSeek-R1-Zero基于DeepSeek-V3-Base,与其共享了相同的架构。而DeepSeek-R1-Distill系列模型则由其他预训练的开放权重模型(包括LLaMA和Qwen)初始化,然后基于R1生成的合成数据进行微调。

DeepSeek-R1-Zero仅使用GRPO强化学习进行训练,未使用SFT。与之前的版本不同,它没有使用基于模型的奖励。所有奖励函数均基于规则。主要分为两种类型(其他类型未具体说明):准确率奖励和格式奖励。准确率奖励用于检查方框内的答案是否正确(针对数学问题)或代码是否通过测试(针对编程问题)。格式奖励用于检查模型是否将其思维轨迹置于...
标签内。

不过此前的论文中,深度求索透露其训练使用的是英伟达因为美国出口管制而针对中国市场特供的低配版GPU H800,训练成本为557.6万美元,远低于类似西方公司的闭源模型。

外界预估R1的训练成本比DeepSeek-V3略高,或在600万美元上下。

DeepSeek-R1-0528
2025年5月28日,深度求索发布DeepSeek-R1-0528,为R1的小版本升级。此版本与原版R1同样基于DeepSeek-V3-Base,并未进行根本性的架构变更,而是通过投入更多算力及在后训练阶段引入算法优化机制,进一步提升了推理深度与推断能力。

除性能提升外,R1-0528亦降低了幻觉率,并新增对JSON输出及函数调用的支持,以提升开发者的使用体验。

測試成績
Deepseek-R1-Lite在數學、代碼和複雜邏輯推理上,獲得媲美 o1-preview 的推理效果。

在美国数学邀请赛中,DeepSeek 稱,該模型在美國邀請數學考試和 MATH 等既定基準上的表現超過了 OpenAI o1 Preview的水平,在國際數學奧林匹克正確率達到83%,

它還在Codeforces編程競賽中優於89%的參賽者,但在GPQA Diamond,LiveCodeBench和自然語言解謎中較為遜色。

應用情況
DeepSeek-R1使用MIT协议开源,意味着任何人都可以自由使用该模型,包括商业用途。

用户可以在DeepSeek官方网站和App使用官方提供的服务。

公共服务
中国大陆
2025年2月起,中国多地政府部门相继将DeepSeek接入政务服务系统,用于公文写作、政策解读等方面。

2025年2月8日,广东省深圳市龙岗区政务服务和数据管理局就已经在政务外网部署了DeepSeek-R1模型。

2025年2月16日,深圳市正式为全市各区及各部门提供DeepSeek模型应用服务;其中,福田区基于DeepSeek开发了首批70名AI“数智员工”。

2025年2月17日,佛山市“江义村智慧乡村平台”于正式接入DeepSeek。

2025年2月18日,北京市丰台区在政务云本地部署DeepSeek大模型。

HKGAI V1支援粵語、普通話及英語,將DeepSeek本地化、使用香港本地數據,全參數微調,並持續訓練。

HKGAI V1涵蓋「港話通」、「港文通」、「港會通」、「港法通」、「港環通」等系統,當中的「港文通」為生成式人工智能文書輔助應用程式,在超過70個香港政府部門開始試用。

創新科技及工業局局長孫東表示,期望「港話通」手機版應用程序在2025年内推出,並以此提供更有個性化的服務。

2025年5月8日,廉政公署向公衆展出「深博士」(),廉署在DeepSeek的基礎上開發的人工智能模型,可提供廉署資訊及防貪建議,未來有機會在廉署的分區辦事處、網上或手機使用。

其他
瀋陽飛機設計研究所在研發新戰機的過程中,引入了DeepSeek。

多家汽車製造商,包括BMW、東風汽車、比亞迪、廣汽、零跑、本田、日產,宣佈與DeepSeek合作,將其AI系統和中國版汽車結合。

在2025年緬甸地震的救援行動中,中國國家緊急語言服務團與北京語言大學團隊基於DeepSeek的大模型,研發中緬英互譯系統,支援中國國際救援隊進行救災工作,並在未來開源與其他地區使用。

外界反应
1月27日,DeepSeek超越ChatGPT,登顶苹果App Store美国区免费APP下载排行榜。

DeepSeek-R1爆火,引发全球投资者大量抛售人工智能相关股票。1月27日,英伟达美股股价下跌近17%,单日市值蒸发5890亿美元,为美国股市历史上最大。

DeepSeek-R1发布后不久,Meta首席执行官马克·扎克伯格就宣布,Meta计划在2025年投入超600亿美元,加大对人工智能的投入。其中两个小组研究其开发者如何降低训练和运行DeepSeek的成本,第三个小组研究训练模型可能使用了哪些数据,第四个小组研究基于DeepSeek模型属性重构其LLaMA模型的新技术。

OpenAI表示,其有证据表明DeepSeek使用OpenAI的专有模型来训练自己的开源模型,这违反了OpenAI的服务条款。在R1的Nature论文释出的同行评议文件中,DeepSeek-R1的研究人员称,R1 并没有使用OpenAI专有模型生成的样本但同时承认与大多数的生成模型一样,在训练过程中不可避免地使用了互联网上的由其他AI生成样本。

现状与替代方案
由于用户量激增,DeepSeek R1曾面临服务器频繁繁忙问题,主要归因可能有多种,包括算力需求、带宽限制及网络攻击。用户可通过本地部署(如Ollama工具)、调用API或使用第三方平台。

参见

  • OpenAI o1

注释
参考资料
外部链接
官方网页

媒体专题

评论 (0)

  • 还没有评论,来抢沙发吧。