张量处理单元

张量处理单元(,简称:),也称张量处理器,是 Google 开发的专用集成电路(ASIC),专门用于加速机器学习。自 2015 年起,Google 就已经开始在内部使用 TPU,并于 2018 年将 TPU 提供给第三方使用,既将部分 TPU 作为其云基础架构的一部分,也将部分小型版本的 TPU 用于销售。

总览
2016 年 5 月,Google 在 Google I/O 上宣布张量处理单元,并表示 TPU 已经在其数据中心内部使用超过一年。该芯片是专门为 Google 的 TensorFlow 框架(一个符号数学库,用于机器学习应用程序,如神经网络)设计。不过,截至 2017 年,Google 也将 CPU 和 GPU 用于其他类型的机器学习。其他供应商也设计了自己的 AI 加速器,并针对嵌入式和机器人市场。

Google 的 TPU 是专有的,一些 TPU 的型号已经上市。在 2018 年 2 月 12 日,纽约时报报道称 Google 将“允许其他公司通过其云计算服务购买对这些芯片的访问权”。Google 曾称,它们已用于 AlphaGo 与李世乭的人机围棋对战《The Information》報導Meta正與Google商討在2027年於自家資料中心部署Google的 TPU,並可能在2026年向Google Cloud租用相關晶片。分析師認為,倘若Meta最終選擇採用TPU,將成為Google的重大勝利,也讓TPU更具成為輝達图形处理单元(GPU)之外,企業的第二選擇。

与GPU相比,TPU 被设计用于进行大量的低精度计算(如 8 位的低精度),每焦耳功耗下的输入/输出操作更多,但缺少用于光栅化/纹理映射的硬件。
! !! TPUv1 !! TPUv2 !! TPUv3 !! TPUv4 !! TPUv5e !! TPUv5p !! v6e (Trillium) !! TPU v7 (Ironwood)
|-
| 推出时间 || 2015 || 2017 || 2018 || 2021 || 2023 || 2023 || 2024 || 2025
|-
| 制程 || 28 nm || 16 nm|| 16 nm || 7 nm || 未列出 || 未列出 || 未列出 || 未列出
|-
| 裸晶尺寸 (mm2) || 331 || 2,时钟速度为 700 MHz,热设计功耗为 28–40 W。它有28 MiB 的片上存储和 4 MiB 的 32位累加器,取 8 位乘法器的 256×256 脉动阵列的计算结果。TPU 还封装了 8 GiB 的双通道 2133 MHz DDR3 SDRAM,带宽达到 34 GB/s。Google 表示,第一代 TPU 的设计受到了内存带宽的限制,因此在第二代设计中使用 16 GB 的高带宽内存,可将带宽提升到 600 GB/s,性能从而可达到 45 TFLOPS。

第三代 TPU
第三代 TPU 于 2018 年 5 月 8 日发布。谷歌宣布第三代 TPU 的性能是第二代的两倍,并将部署在芯片数量是上一代的四倍的 Pod 中。与部署的第二代 TPU 相比,这使每个 Pod 的性能提高了 8 倍(每个 Pod 中最多装有 1,024 个芯片)。

第四代 TPU
第四代 TPU 于 2021 年 5 月 19 日发布。谷歌宣布第四代 TPU 的性能是第三代的2.7倍,并将部署在芯片数量是上一代的两倍的 Pod 中。与部署的第三代 TPU 相比,这使每个 Pod 的性能提高了 5.4 倍(每个 Pod 中最多装有 4,096 个芯片)。

第五代 TPU
2021 年,谷歌透露TPU v5的物理布局是在深度强化学习新技术的帮助下设计的。谷歌聲稱TPU v5快了差不多两倍,比TPU v4快。基于这一點和比A100更好的表现,人们推測TPU v5可能与H100一样快,甚至更快。

与v4i是v4的轻量级版本一样,第五代也有一个名为v5e的“成本效益”的版本。2023年12月,谷歌推出了TPU v5p,宣称其性能与H100旗鼓相当。

第六代 TPU
2024年5月,在Google I/O会议上,Google推出了TPU v6e (Trillium)。Google声称TPU v6比起TPU v5e可实现4.7倍的性能提升,這要歸功於大尺寸的矩阵乘法單元和更快的时钟速度。高带宽存储(HBM)容量和带宽均提高了一倍。pod可包含多达256个Trillium单元。

第七代 TPU
2025年4月,在Google Cloud Next会议上,谷歌推出了TPU v7 (Ironwood)。 这是一款名为Ironwood的新芯片,将有两个版本:256颗芯片集群和9,216颗芯片集群。Ironwood的峰值计算性能可达4,614 TFLOP。

Edge TPU
2018年7月,谷歌推出了用於邊緣運算的特殊應用積體電路Edge TPU。

参见

  • 视觉处理单元,一种专门用于视觉处理的小型设备
  • TrueNorth,一种用于模拟脉冲神经网络,而非计算低精度张量的小型设备
  • 神经处理单元

*

  • ,英伟达公司提出的类似的架构

参考文献
外部链接

评论 (0)

  • 还没有评论,来抢沙发吧。